针对大模型后训练中普遍默认需要密集token级监督的假设,研究团队以OPD在线策略蒸馏为初始场景进行实验。实验发现,仅保留单条推理轨迹中1个token的极端稀疏梯度信号,不仅不会导致训练崩溃,反而能显著提升大模型的推理能力。团队通过9组不同师生模型配置的测试进一步发现,选取轨迹中师生模型输出分歧最大的1到2个token作为监督信号,效果甚至优于全信号训练,所得学生模型性能可超越教师模型,且学生模型性能提升并非单纯模仿教师。这一现象在代码推理任务、Llama系列模型及RLVR后训练范式中均得到验证。机制研究表明,推理性能提升与监督信号稠密程度并非单调相关,万分之一的监督信号仅需更新10%的网络参数即可大幅提升推理能力,效果差异还与师生模型表征能力的相对强弱有关。研究团队类比人类学习过程,认为经过预训练等阶段的大模型已具备基础推理能力,少量关键监督信号即可引导模型调整并显著提升推理性能。
