On-Policy Distillation: 重塑大模型后训练的新范式
本文综合了 Thinking Machines Lab 的 On-Policy Distillation 博客 与 OPD 前沿技术综述的内容,系统梳理同策略蒸馏(OPD)的核心原理、工业实践与最新算法进展。 大语言模型的能力并非一蹴而就——它们通常经历三个训练阶段:预训练(Pre-training) 教会模型语言理解与世界知识;中间训练(Mid-training) 注入领域知识;后训练(Post-training) 引导出指令遵循、数学推理或对话等目标行为。后训练是将基础模型变成有用工具的关键一步,而同策略蒸馏(On-Policy Distillation, OPD)正在以更高的样本效率和更密集的监督信号,重新定义这一阶段的范式。 ...