LLM 训练全流程-v1
从数据、预训练、持续训练到后训练、部署与持续学习,梳理大模型训练与交付的完整流程。
从数据、预训练、持续训练到后训练、部署与持续学习,梳理大模型训练与交付的完整流程。
结合公开资料整理当前大模型训练数据从哪来、怎么处理,以及预训练、后训练和闭源蒸馏几条常见路径。
按版本整理 DeepSeek V2—V4 的架构与训练变化,比较 MLA、MoE、多 Token 预测等方法解决的问题与取舍。
整理 BAIT 如何通过反演攻击目标扫描大语言模型后门,附论文组会汇报与逐页讲解材料。
整理反向传播的 Loss、梯度、链式法则、优化器更新,以及 LLM 训练中常见的显存优化方法。
整理 LoRA 的低秩适配原理、训练与推理流程、常见插入位置、核心超参数,以及 QLoRA、AdaLoRA、DoRA 等变体。
基于 llama2.c 的 run.c 源码注释,梳理 Decoder-only Transformer 的推理流程、RoPE、Attention、FFN、采样和 BPE。
没有找到匹配的文章,试试其它关键词。