帖子链接:https://linux.do/t/topic/2538870/145
今天看这个帖子,感觉是很有价值的思考,记录一下。
此外自己的一个小想法是:这套框架不只可以解释推理,也可以顺手扩展到训练。
一次推理本身就不是只由模型决定,也不是只由 prompt 决定,而是两者共同作用的结果。模型参数像初始地形,prompt 则像这次任务里施加的局部条件,所以最终输出其实是在这片地形上被共同引导出来的一条路径。
如果沿着这个类比继续往下想,训练其实就是在改造地形本身。
- 预训练是在塑造基础的语义地貌,让模型先形成大范围的语言、知识和模式分布。
- SFT 像是在已有地形上修路,让模型输出更容易沿着想要的行为轨迹去走。
- 偏好优化像是在多条路径之间重新分配优先级,让一些回答方式更“顺坡”,另一些则更难被走到。
- reasoning RL 我觉得更像是在训练“地形如何变化的规则”。它不只是改出一个静态地形,而是在让模型学会:推理展开时,局部地形应该怎样继续被改变,才会更倾向于朝分步推理的方向演化。
这样看,推理和训练其实像是同一套框架里的两个时间尺度:
- 推理是在既有地形上走一次路径。
- 训练是在长期上塑造地形,甚至塑造“地形会如何继续变化”的规律。