阅读提示

结合 AI 整理了这张图,后续有新的认知还会继续更新。

全流程概览

图表加载中…

graph TD
    A["数据获取 / 合成"] --> B["清洗 · 去重 · 过滤 · 配比"]
    B --> C["Tokenizer"]
    C --> D["预训练 Pre-train<br/>NTP / MTP"]
    D --> E["Base Model"]
    E --> F["Mid-training / CPT<br/>领域 · 长上下文 · 高质量 anneal"]
    F --> G["SFT<br/>指令 · 对话 · 工具轨迹"]
    G --> G2["可选 RS 选优造数"]
    G2 --> H["偏好优化<br/>DPO / 迭代 DPO / RM+PPO"]
    G --> H
    H --> I["RLVR / Online RL / RFT<br/>GRPO · verifier · grader"]
    I --> J["蒸馏 / 合并 / 压缩"]
    J --> K["部署 · Guardrail · TTC"]
    K --> M["Continual 更新 / Replay"]
    M --> G
    D --> V["评测闭环"]
    F --> V
    G --> V
    H --> V
    I --> V
    V --> A

图表加载失败,可展开查看源码。

下面记录流程中各关键阶段的一些概念

D. 预训练 Pre-train(NTP / MTP)

预训练是大模型获取世界知识、常识推理、句法语义以及代码能力的基础阶段。

1. 核心目标与损失机制

  • NTP(Next-Token Prediction,单 Token 下一步预测):

    标准的自回归语言模型(Autoregressive LM)建模方式。

    对于输入序列 $X = (x_1, x_2, \dots, x_T)$,模型通过最大化自回归对数似然进行优化:

    $$\mathcal{L}_{\text{NTP}}(\theta) = -\sum_{t=1}^T \log P(x_t \mid x_{\lt t}; \theta)$$

    模型依靠预测下一个词来隐式构建世界模型与表征逻辑。

  • MTP(Multi-Token Prediction,多 Token 协同预测):

    在 DeepSeek-V3 等现代前沿模型中采用的优化范式。传统 NTP 在时间步 $t$ 只拟合 $x_t$,缺乏跨时序的局部前瞻能力。

    MTP 在主干 Transformer 输出表征后,串联或并行接入 $K$ 个轻量级预测头(Shared Embedding + 独立 Transformer Layer/Linear Head),在同一时刻并行预测未来的 $K$ 个连续 Token:

    $$\mathcal{L}_{\text{MTP}} = \mathcal{L}_{\text{NTP}} + \sum_{k=1}^K \lambda_k \mathcal{L}_k(x_{t+k} \mid x_{\lt t})$$
  • 能力增益: MTP 提供了面向未来多个 Token 的训练信号,可能改善表示学习、生成连贯性或特定任务表现;收益取决于预测头设计、数据和训练配置,不能概括为必然提升代码或复杂推理能力。

  • 推理协同: 在具体实现支持且预测头保留的情况下,MTP 头可以参与推测解码(Speculative Decoding)。实际接受率和吞吐增益取决于模型、硬件、批量大小、序列长度及服务框架,不能预先保证固定的加速倍数。

E. 基座模型 Base Model

Base Model 是预训练结束收敛后的原始权重(Raw Checkpoint)。

1. 本质特征

  • 统计补全机: Base Model 没有“助手意识”,它本质上是一个高阶文本续写引擎。如果输入 请告诉我牛顿第一定律是什么?,它可能不会直接回答,而是续写出 A. 惯性定律 B. 加速度定律...(将输入识别为单选题题干)或继续罗列类似问题。
  • 知识内化边界: 通用事实知识、语言能力和基础推理先验主要来自预训练,但 CPT、SFT、RFT、蒸馏及持续训练仍可注入领域知识、任务知识并改变能力表现。“SFT 塑风格,Pre-train 灌知识”只能作为便于理解的简化概括。

2. 状态与局限

  • 长尾幻觉与不可控性: 极易陷入无限生成、无意识复读,缺乏对终止符(EOS Token)的灵敏决策。
  • 安全真空: 无防越狱能力与伦理边界,对任何前缀均按照概率分布补全。
  • 评估模式: Base Model 的评测方式应与基准任务匹配:语言建模可使用验证集损失或对数似然;MMLU 等选择题通常采用 zero-shot 或 few-shot 格式;GSM8K 需要约定提示模板、推理文本和答案抽取规则;HumanEval 则通过代码生成与单元测试计算通过率。不能把这些基准都归为纯对数似然评测,也不宜假设 Base Model 能稳定进行自然问答。

F. 增量预训练 Mid-training / CPT

Mid-training(或称 Continued Pre-training, CPT)介于纯通用预训练与 SFT 之间,旨在低成本、定向重塑或增强模型能力,避免重新走完整预训练流程。

text
Pre-train (海量通用 Web 语料)
Mid-training / CPT
  ├── 1. 领域增量(注入垂类高密度语料 + 通用回放以缓解遗忘)
  ├── 2. 长度外推(RoPE Base 缩放 + 长文本序列切分)
  └── 3. 高质量退火 Anneal(WSD 衰减期注入高信噪比合成/教科书数据)

1. 三大核心支柱

  • 垂直领域与特定任务扩展(Domain CPT)

    • 操作: 灌入特定垂直领域(金融合规、医疗诊断、专用编程语言等)的高密度专业语料。
    • 防灾难性遗忘: 通常会混入一部分通用预训练高质量回放数据(General Replay Buffer),但比例没有适用于所有模型和任务的固定标准,应通过通用能力回归评测、目标任务效果和训练稳定性来确定。
  • 长上下文窗口扩展(Long-Context Extension)

    • 位置编码改造: 采用 RoPE 插值技术,调整底数基频(Base Frequency,如将基底从 10,000 放大至 500,000+),或结合 YaRN(Yet another RoPE extensioN)在注意力尺度上平滑频域变化。
    • 序列长度递进: 可根据目标上下文窗口采用分阶段扩展,例如从较短窗口逐步过渡到更长窗口;具体阶段和长度需要结合位置编码方案、显存预算及长文本数据质量确定。训练时可使用 Context Parallelism(CP)沿上下文维度分摊计算和通信,并严选长代码仓、书籍、超长财报或合成的多跳问答数据。
  • 高质量退火(High-Quality Annealing)

    • 机制: 在 WSD 等学习率调度策略的 Decay 阶段逐步降低学习率。Decay 所占比例、衰减形状和最终学习率没有统一的固定值,应结合验证集损失、能力评测和训练稳定性调节。
    • 数据构成: 通常提高高信噪比数据(如经过质检的合成数据、教科书、数学证明和代码执行追踪)的占比,但不必然完全移除网页数据;数据混合比例应通过消融实验和目标能力评测确定。
    • 收益: 高质量退火可能以相对有限的额外计算改善特定数据分布上的验证损失和目标能力,但较低的 Validation Loss 不等同于必然激活深层逻辑推理能力,仍需独立能力评测验证。

G. 监督微调 SFT(Supervised Fine-Tuning)

SFT 是模型实现“形态跃迁”的关键一步。它通过人工标注或高精度合成的人机交互数据,将“文本续写机器”重塑为“遵循人类意图、懂得边界与具备格式控制力的智能助手”。

1. 主要数据形态

这些也是实际会话中会用到的主要功能。

数据类型构造重点核心作用
指令遵循 (Instruction)严密的系统 Prompt、多样化任务指令(翻译、提取、总结、改写、结构化输出)。消除无意义续写,学会听懂命令并精确按照给定格式(如 JSON、Markdown)输出。
多轮对话 (Multi-Turn)上下文追踪(Context Tracking)、历史指代消解、主动澄清反问、纠错适应。具备真实的会话连贯性,在多轮互动中保持记忆并接受用户反馈纠错。
工具轨迹 (Tool/Agent)ReAct 范式(Thought $\to$ Action $\to$ Observation $\to$ Final Answer)、Function Calling 结构体。赋予模型调用外部 API、执行代码解释器、检索私有知识库等外部工具扩展能力。

2. 训练工程关键细节

  • 损失掩码机制(Loss Masking)

    采用 ChatML 等模板(如 <|im_start|>user ... <|im_end|><|im_start|>assistant ... <|im_end|>)拼接多轮对话。

    在计算交叉熵损失时,通常对 System Prompt 和 User Instruction 等上下文部分进行 Mask(将其 Label 设为 -100),梯度主要来源于 Assistant 的回答 Token。工具调用任务需要按训练目标决定 Mask 范围:函数名、参数和控制 Token 往往需要保留监督;Tool Return 通常作为条件上下文,但某些轨迹字段也可能需要训练。因此不能把所有 Tool Return 都一概 Mask:

    $$\mathcal{L}_{\text{SFT}} = -\sum_{t \in \text{Assistant Tokens}} \log P(x_t \mid x_{
  • 质量压倒数量(LIMA 假说)

    数万条覆盖全面、逻辑链清晰、语言风格严密的超高质量 SFT 数据,效果远胜于百万条低信噪比抓取问答。避免低质数据的幻觉污染比堆叠样本数量更重要。

  • 拒答样本(Safety & Honesty Alignment)

    在 SFT 中显式注入一定比例的安全边界与事实性拒答样本。当指令涉及有害内容或超出客观知识边界时,引导模型回答“抱歉,我无法处理该请求”或承认未知,而非强行胡说编造。

G2. RS 拒绝采样(Rejection Sampling / Best-of-N)

在完成初版 SFT 之后,可以先用拒绝采样(Rejection Sampling, RS)筛选高质量轨迹,再进行 RFT 或偏好优化。RS 是一种模型生成、验证和筛选数据的自举式方法,并不等同于某一种强化学习算法。

1. 核心概念与流程

对于给定的 Prompt 集合,使用当前的 SFT 模型(或更强的上游模型)按任务设置采样温度,独立生成 $N$ 个候选响应:$\{y_1, y_2, \dots, y_N\}$。随后,通过评测系统对这 $N$ 个输出进行严格筛选与排重:

例如:

text
    Prompt 集合
    ▼ (按任务设置 Temperature,并行采样 N 次)
候选响应池 {y_1, y_2, ..., y_N}
    ▼ (Verifier 单元测试 / 规则校验 / RM 打分)
筛选分流:
  ├── 最优胜者 (Pass / High Score)  ──► 注入 RFT 数据集 (回灌 SFT)
  └── 胜负样本对 (Chosen vs Rejected) ──► 构造偏好对 (供给 DPO 或训练 RM)

2. 两大主流落地路径

  • 构造偏好训练集(For Preference Optimization)

根据任务验证器、规则或 Judge 的置信度筛选高质量样本,并在分数差异、难度、多样性和人工抽检满足要求时构造 $\text{Winner} (y_w)$ 与 $\text{Loser} (y_l)$。不建议机械地把最高分和最低分配成一对;样本对的质量和覆盖度仍决定偏好优化效果。RS 产生的数据更贴近当前策略分布,但不能自动消除离线训练中的分布偏移。

  • 拒绝微调(Rejection Fine-Tuning, RFT)

在数学推导或代码任务中,可仅保留通过验证器或单元测试的样本(Pass@N 中的成功轨迹),将其作为合成的新 SFT 数据,再次回灌模型进行监督训练。该过程可能提升确定性任务表现,但仍需检查验证器覆盖范围、样本重复和错误模式。

H. 偏好优化(Preference Optimization: DPO / 迭代 DPO / RM+PPO)

尽管 SFT 赋予了模型助手的口吻,但监督学习主要教模型模仿示例分布,难以单独表达“人类价值偏好”(如 Helpful、Honest、Harmless)与复杂质量好坏的边界。

1. 经典三阶段:RM + PPO (RLHF)

  • 奖励模型(Reward Model, RM)

    基于人类比较数据对 $(x, y_w, y_l)$,利用 Bradley-Terry 假设训练标量奖励模型 $r_\psi(x, y)$,其损失函数为:

    $$\mathcal{L}_{\text{RM}}(\psi) = -\mathbb{E}_{(x, y_w, y_l)}\left[\log \sigma\left(r_\psi(x, y_w) - r_\psi(x, y_l)\right)\right]$$
  • PPO(Proximal Policy Optimization,近端策略优化)优化闭环

    PPO 通过裁剪策略概率比或使用等价约束,限制单次策略更新幅度,以改善策略优化稳定性。

    由 Actor(当前待调模型)、Critic(价值网络)、Reference Model(原始模型冻结参数)、Reward Model(提供即时奖励)四套模型协同推进。

    • 难点与瓶颈: 显存占用极大(4 个大模型同时驻留 GPU 集群);PPO 对超参数极其敏感,容易发生 Value 估计漂移;极易出现 Reward Hacking(模型学会钻奖励模型的漏洞,如输出超长文字或过度谄媚来刷高分)。

2. 直接偏好优化:DPO(Direct Preference Optimization)

DPO 通过数学代换,直接绕过了训练 RM 和在线采样的步骤。

  • 数学原理: 在 KL 正则化、参考策略和偏好数据分布等假设下,最优策略 $\pi^*$ 与潜在奖励函数 $r(x,y)$ 存在解析对应关系:

    $$r(x, y) = \beta \log \frac{\pi_\theta(y \mid x)}{\pi_{\text{ref}}(y \mid x)}$$
  • 损失函数:

    $$\mathcal{L}_{\text{DPO}}(\theta) = -\mathbb{E}_{(x, y_w, y_l)}\left[\log \sigma\left(\beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)}\right)\right]$$
  • 优劣权衡: 训练通常比在线 PPO 简单,训练时需要策略模型和参考模型;但它依赖静态离线数据,数据覆盖不足或训练过度时可能出现分布偏移,也可能受到长度和风格偏置影响。实际程度取决于数据、损失归一化、训练轮数和正则化设置。

3. 迭代推进:Iterative / Online DPO

为弥补 DPO 离线采样的不足,可以采用 Iterative DPO

  • 机制: 不使用固定的偏好数据集,而是每一轮用当前最新的 $\pi_t$ 在线生成新样本,用更强的外部 Judge 或独立 RM 实时打分排序,构造动态偏好对,更新到 $\pi_{t+1}$。它在兼顾 DPO 显存高效性的同时,吸收了 Online RL 的探索能力。

4. AI 反馈驱动对齐:RLAIF(Reinforcement Learning from AI Feedback)

RLAIF 是用模型自动化替代人工标注的关键工程演进,解决了传统 RLHF 标注昂贵、吞吐受限、主观偏置严重以及难以监督超人类水平推理的瓶颈。

RLAIF 最初由 Anthropic 在 Constitutional AI (CAI,宪法 AI) 框架中系统化确立。

  • 核心思想: 放弃对海量外包标注员的依赖,改用一套显式的、人类可读的行为准则(Constitution / Principles)作为 Prompt,引导能力更强的 AI(或自身)对模型的输出进行自动化“审判、批评与标注”,以此产生的信号指导下游强化学习。
  • 两大运转路径:
    • AI-as-a-Judge 伪偏好构造: 策略模型生成多个候选响应后,由 Judge 模型按规则打分排序并生成带思维链(CoT)的判词,产出百万级伪偏好对 $(x, y_w, y_l)$。这些数据既可直接注入上述的 RM 训练与 PPO 流程,也可无缝供给 DPO / Iterative DPO。
    • 批判与自修正(Critique & Revision): 模型先生成初稿,再根据准则指出初稿漏洞并执行修正,直接通过自举方式生成高质量正样本。
  • 工程去偏关键(Bias Mitigation):
    • 位置偏置(Position Bias): 必须进行交换位置双向评估(Swap Evaluation),仅采纳两次候选互换后判断依然一致的高置信样本。
    • 冗长偏置(Verbosity Bias): 对长文本施加长度惩罚(Length Normalization),防止 Judge 模型盲目偏好长篇大论但信息密度低的回答。
    • 自恋偏置(Self-Enhancement Bias): 采用多异构模型(Multi-Judge Ensemble)联合打分投票,避免单一模型家族倾向于给自身生成内容打高分的现象。

I. RLVR / Online RL / RFT(GRPO · verifier · grader)

这是大模型从“迎合人类主观偏好”跃迁到“自发涌现深层推理(Deep Thinking)”的核心分水岭(以 OpenAI o 系列与 DeepSeek-R1 为典型代表)。

text
        Prompt (数学/代码/逻辑问题)
                   ▼ (Actor 采样 Group 个回答: o_1, o_2, ..., o_G)
             ┌─────┴─────┐
             ▼           ▼
       [Rule Verifier]  [Compiler]
             │           │  (结果判别或评分)
             └─────┬─────┘
     计算组内相对优势 A_i = (r_i - Mean) / (Std + ε)
        GRPO 策略优化更新 (通常不使用独立 Critic)

1. 核心组件与机制

组件 / 概念核心功能与机制
RLVR (可验证奖励强化学习)Reinforcement Learning with Verifiable Rewards。利用单元测试、形式化验证、规则或答案抽取器等可执行信号提供奖励。奖励可以是二值,也可以包含部分分数或过程信号;验证器本身可能存在覆盖不足、误判和被投机的问题,因此不能宣称彻底杜绝 Reward Hacking。
GRPO (群组相对策略优化)Group Relative Policy Optimization。它通常不训练独立的 Critic 网络。对于每个输入 Prompt,策略网络采样一组候选结果 $\{o_1, o_2, \dots, o_G\}$,再依据奖励 $r_i$ 计算组内相对优势,例如:$$A_i = \frac{r_i - \text{mean}({r})}{\text{std}({r}) + \epsilon}$$其中组内统计量提供基线。这样可以减少价值网络的显存和训练开销,但仍需处理零方差、KL 约束、裁剪和奖励归一化等实现细节。
Verifier & GraderORM(结果监督验证器): 依据最终答案或执行结果判断正确性。PRM(过程奖励模型): 对推导步骤提供过程级评分或奖励。两者的覆盖范围、标注质量和鲁棒性都会影响强化学习效果。

2. 行为涌现:长思维链(Long CoT)

在合适的冷启动数据、奖励设计和验证器支持下,RLVR/GRPO 可能促使模型增加反思、重试或自我校验等行为,推理 Token 长度也可能随任务难度变化。此类行为是否真正提升能力,取决于奖励是否与目标一致,必须通过独立基准、长度控制和错误分析验证,不能预设为必然涌现或显著超越 Base/SFT。

3. 后训练系统的四个正交维度

上述技术最好按四个彼此正交的维度理解,而不是把反馈来源、奖励表示和具体优化算法放在同一层级。

维度涉及技术回答的问题
反馈来源(Feedback Source)Human Feedback、AI Judge / Constitutional AI / Critique、Rule / Program、Environment谁或什么系统产生监督信息?
反馈表示(Feedback Representation)Demonstration、Pairwise Preference、Scalar Reward、Outcome Reward(ORM,结果奖励模型)、Process Reward(PRM,过程奖励模型)、Binary Verification、Dense Environment Reward模型实际收到什么形式的学习信号?
数据采样方式(Data Generation)Offline Dataset、On-policy Rollout、Off-policy / Historical Data、Iterative / Online Sampling、Best-of-N / Rejection Sampling、Environment Rollout训练数据如何产生、是否由当前策略持续生成?
参数更新方法(Parameter Update)SFT / RFT、DPO / IPO / ORPO、PPO、GRPO / RLOO、Distillation参数通过什么目标和算法更新?

概念边界

  • RLHF 和 RLAIF 通常描述反馈参与的完整对齐范式,不只是信号来源;更准确的来源节点是 Human、AI Judge、Rule/Program 和 Environment。
  • **RM(Reward Model,奖励模型)**是生成标量奖励的一种模型;**ORM(Outcome Reward Model,结果奖励模型)**依据最终答案或任务结果评分,**PRM(Process Reward Model,过程奖励模型)**则对中间步骤或过程轨迹评分。**RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)**是利用可执行验证结果构造奖励的训练范式,两者不是严格对称的技术实体。
  • **DPO(Direct Preference Optimization,直接偏好优化)**通常是基于偏好数据的离线目标函数,而不是在线强化学习算法。所谓 Online / Iterative DPO 的核心变化主要在于偏好数据是否由当前策略持续采样、评分和更新。
  • **IPO(Identity Preference Optimization)**和 **ORPO(Odds Ratio Preference Optimization)**也是直接利用偏好数据更新模型的目标函数;它们与 DPO 的正则化方式和损失形式不同,具体优势需要结合数据和任务评测。
  • **GRPO(Group Relative Policy Optimization,群组相对策略优化)**通常不需要独立 Critic,但仍可能需要 reference policy、奖励计算和在线 rollout;它可以使用 RLVR、RM 或混合奖励。**RLOO(Reinforcement Learning with Leave-One-Out baseline)**则使用同一组中其他样本的平均奖励作为留一基线,二者都属于减少独立价值模型依赖的策略优化方法。
  • **PPO(Proximal Policy Optimization,近端策略优化)**通过裁剪策略概率比或使用等价约束,限制单次策略更新幅度,以改善策略优化稳定性。它可以使用 RM 奖励,也可以使用规则验证奖励;RLVR 不等于 GRPO。
  • KL 正则化 / KL 约束通过惩罚或限制当前策略与参考策略之间的分布差异,防止策略更新过激、语言行为漂移或偏离原模型过远;强度需要结合任务效果和稳定性调节。

阶段性观察

截至本文记录时间(2026.09),以下是对公开资料和工程实践的阶段性观察,不代表所有团队或任务的统一选择。

GRPO / Online RL: 在数学、代码、复杂逻辑规划等可验证领域(RLVR),GRPO、RLOO 等不依赖独立价值模型的方法受到较多关注。组内或留一基线可以减少 Critic 的显存和训练开销,但仍需要可靠的奖励、rollout 基础设施和独立评测。

RLAIF: RLAIF 在大规模偏好数据生成和安全对齐中日益常见,但关键安全规范、评测集、高风险样本和抽检通常仍需要人工参与。AI Judge 和 Critique 可以提高数据生产吞吐,但也会引入位置偏置、长度偏置、自恋偏置和错误传播,需要校准与人工质检。

因此,不宜简单总结为“RLAIF 主导、RM 不再使用、GRPO 主导、PPO 基本淘汰”。实际方案通常根据任务的可验证程度、反馈成本、数据分布、基础设施和安全要求组合使用。Offline DPO 仍可用于通用偏好和下游任务;Online / Iterative DPO 只是通过当前策略持续产生数据来缓解静态数据覆盖不足,并不自动保证更好。

后训练系统示意

text
后训练系统

反馈来源
技术:Human · AI Judge · Rule/Program · Environment


反馈表示
技术:Demonstration · Preference Pair · Scalar Reward · ORM / PRM


数据生成
技术:Offline Dataset · Best-of-N / RS · On-policy Rollout · Iterative Sampling


参数更新
技术:SFT / RFT · DPO · PPO · GRPO / RLOO


任务应用
能力:数学 · 代码 · Agent · 工具使用
对齐:偏好 · 安全 · 风格 · 指令遵循

以上四层可以交叉组合,并不存在一一对应关系。一个训练流程一般可以是:

text
[SFT 模型 / 冷启动]
【第一轨:客观能力优化 (RLVR + GRPO / RLOO 等)】
  * 任务:数学、代码、逻辑推理
  * 机制:程序/环境反馈 + 可为二值或连续的奖励 + 组内或留一基线
  * 结果:可能改善验证通过率和任务策略,是否出现长思维链需独立评测
【第二轨:主观偏好与安全优化 (Iterative DPO / PPO / RLAIF 等)】
  * 任务:语言风格、多轮拟人、安全拒答、格式遵循
  * 机制:动态在线采样 + AI 裁判根据宪法规则打标 + 策略闭环微调
  * 结果:改善偏好、安全、风格和格式遵循;具体效果需要通过独立评测确认
[最终交付模型]

J. 蒸馏 / 合并 / 压缩(Distillation, Merging, Compression)

通过探索与强化训练出的模型可能体量庞大且计算昂贵,蒸馏、合并或量化等手段可以在部分场景下帮助降低部署成本;具体取舍需要结合能力、延迟、显存和运维约束评估。

1. 模型蒸馏(Distillation)

  • 白盒 Logit 蒸馏: 迫使轻量 Student 模型拟合大尺寸 Teacher 模型的输出概率分布(Soft Target),通过最小化输出层间的 KL 散度,传递未激活词上的暗知识(Dark Knowledge)。
  • 黑盒思维轨迹蒸馏(Reasoning Trajectory Distillation): 常见做法之一是让较强的 Teacher 生成经过筛选的推理轨迹,再将其作为 Student 的 SFT 或偏好优化数据(如 DeepSeek-R1-Distill 系列所采用的路线)。轨迹数量、是否包含可见思维链以及 Student 能获得的收益取决于数据质量、任务覆盖和蒸馏目标;Teacher 的错误、偏置或不适合公开的内部推理过程也可能被一并传递,因此不能简单承诺以极低成本获得通用高阶推理能力。

2. 模型合并(Model Merging)

模型合并通常不需要完整的二次训练,而是在参数权重或权重增量空间执行线性或非线性运算,尝试融合同源但专精不同的检查点。合并前需要确认 tokenizer、架构和参数对齐,并通过目标任务与通用能力回归评测验证结果:

  • SLERP(球形线性插值): 在参数向量之间进行球面插值,可能在某些同源检查点上比朴素平均更稳定,但没有对所有模型和任务都成立的优越性。
  • TIES-Merging & DARE: 根据权重增量识别冲突、筛选或稀疏化更新。它们有时能缓解任务干扰、减少冗余,但剪枝比例需要通过实验确定,不能假设可以无损保留各分支能力。

3. 模型压缩与量化(Compression & Quantization)

  • 量化方案:
    • W8A8 / FP8: 在支持相应 Tensor Core 和算子的硬件上可降低显存和计算成本;精度损失取决于模型、校准方法、算子实现和任务,不能一概而论为“几乎为零”。
    • W4A16(AWQ / GPTQ): 适合显存受限场景,将权重压缩至低比特并在计算时使用较高精度激活或反量化;需要校准数据和量化后回归评测,长上下文、代码和推理任务可能更敏感。
  • 架构级与系统级优化: GQA、MLA 通常属于模型架构设计或需要重新训练/转换的方案,不是对任意已训练模型都能直接执行的通用后处理。MoE 专家剪枝也可能损伤能力,必须结合路由统计和任务评测谨慎验证。

K. 部署 · Guardrail · TTC(Deployment, Guardrails, Test-Time Compute)

这一阶段负责将离线训练好的权重真正转化为高可用、安全受控且具备弹性计算深度的在线服务。

1. 部署引擎(Deployment Engines)

基于 vLLM、SGLang 或 TensorRT-LLM 搭建高吞吐服务底座:

  • PagedAttention: 彻底解决显存碎片化问题,将 KV Cache 划分为可非连续映射的虚拟显存块(Block)。
  • Continuous Batching & Chunked Prefill: 消除传统静态 Batch 的气泡等待(Bubble),并将长 Prefill 阶段切块交织打散进 Decode 阶段,维持 P99 延迟稳定。
  • 推测解码(Speculative Decoding): 搭配前面预训练产出的 MTP 头或轻量小模型执行 Draft 生成,由主干模型一次性并行验证多个 Token,大幅打破显存读取带宽的吞吐瓶颈。

2. 安全护栏(Guardrail)

在生成流的外周构建实时防御防火墙:

  • 输入侧拦截: 部署轻量化安全分类器(如 Llama Guard)和语义嵌入向量库,阻断越狱攻击(Jailbreak)、提示词注入(Prompt Injection)与 PII 隐私信息泄露。
  • 输出侧流式熔断(Stream Guard): 挂载敏感词 DFA 树与有害意图探测器。一旦流式输出检测到违规风险,立即阻断当前 SSE(Server-Sent Events)通道,静默触发截断与兜底回复。

3. 推理期算力缩放(TTC, Test-Time Compute)

大模型正在由“纯预训练 Scale-up”向“推理期计算量 Scale-up”演进:

  • 动态思考预算(Thinking Budget): 针对简单问题(如查询事实)限制其生成 CoT,零思考极速返回;针对高难度算法与复杂证明,动态放开上限,允许模型在隐藏层中消耗 8K~32K 个推理 Token 进行自主验算。
  • 推理期搜索(Search & Sampling): 引入蒙特卡洛树搜索(MCTS)或束搜索(Beam Search),由轻量 Verifier 在每一步做出评分指引,在推理阶段动态探索最平稳的分支,用更多的运行期算力换取极致的准确率。

M. Continual 更新 / Replay(持续学习与闭环回放)

模型一旦正式上线,静态权重就会面对持续变化的客观现实(时间流逝、新政策知识、用户行为漂移与新发现的 Badcase)。

text
        线上真实流量 (Traffic & Badcases)
           [脱敏、聚类与根因归因]
      数据引擎高保真合成 / 专家修正注入
  ┌────────────────────────────────────────┐
  │         混合重放队列 (Replay Buffer)     │
  │  新数据 + Golden 历史数据(比例按评测调节) │
  └──────────────────┬─────────────────────┘
                     ▼ (回流以缓解灾难性遗忘)
                  重新进入
        [Mid-training (F) / SFT (G)]

1. 核心挑战:灾难性遗忘(Catastrophic Forgetting)

如果只拿少量线上 Badcase 直接微调模型,模型可能快速拟合这些样本,同时损伤通用常识、代码或特定格式生成能力。这种灾难性遗忘的程度取决于学习率、参数更新范围、数据分布和训练步数,通常可以通过回放、参数高效微调、正则化、蒸馏和回滚机制缓解。

2. Replay 缓冲工程细节

  • Golden Replay Buffer: 维护一套跨领域严格校验的“黄金回放锚点数据集”(包含顶级通识推理、代码基准、基础指令遵循和跨语言对话)。
  • 配比约束训练: 增量训练应混合新业务数据与 Replay Buffer 数据,但没有适用于所有任务的固定比例。可以结合能力回归、遗忘指标、数据新鲜度和训练稳定性动态调整,并按需要使用梯度投影、锚点损失、蒸馏或参数高效微调。

3. 闭环连接(回流至 G / F)

持续学习闭环还应包含数据治理、版本管理和发布门禁:线上数据需要脱敏、权限控制、保留期限和投毒检测;训练数据、模型和评测结果需要可追溯;更新应经过离线回归、灰度发布、线上监控,并保留可执行的回滚路径。

  • 微小能力演进: 可优先评估 M -> G -> H -> I 的轻量链路,例如在 SFT 阶段更新对齐策略并复用偏好校验;是否需要进入后续阶段取决于变更类型和评测结果。
  • 重大知识结构升级: 若新增数据属于全新长周期语料(如全新版本的框架文档或垂直行业内部知识库),可考虑将 Replay 闭环回流至 F 阶段(Mid-training/CPT),进行小幅度持续预训练或退火,再根据评测结果决定是否顺序向下流转。