三星大模型团队携手牛津大学、北京大学,共同提出了基于信任域的On-Policy Distillation新方法——TrOPD。该方法旨在解决端侧小模型在继承大模型能力时,因师生模型能力差异大而导致的监督信号失真和训练不稳定问题。研究揭示,OPD训练成功的关键在于教师能否为学生生成的每个token提供可靠监督,而非散度公式的选择。TrOPD通过识别教师的可信监督区域,在信任域内采用常规策略学习,在离群区域则采用更温和的监督方式,并引入离策略引导,主动引导学生生成内容靠近信任区域。实验结果表明,TrOPD在数学、代码、指令遵循、STEM等多个基准测试中均超越了现有的OPD改进方法,且其优势不仅限于训练领域。师生模型能力差距越大,TrOPD的优势就越明显,为前沿AI低成本部署到数亿终端提供了新途径。
