3B 模型成功率 94.5%,Token 级奖励打开长链路智能体训练新思路
13 小时前

多轮智能体任务若仅设置终点奖励,会面临时间信用分配难题,即难以确定轨迹中哪一步需要被强化。当前主流方案是利用模型为无技能轨迹的token打分,但教师置信度可能更偏好语言表达,而非任务关键动作。中科大与阿里团队提出了ADRS方法,该方法将训练期的特权技能转化为token级信用,并接入强化学习路径。通过三步训练,ADRS利用三层信用构造,解决了教师分数跨步不可比、置信度未必有用、独立蒸馏损失绕开组相对优势等问题。该方法不改变底层RL算法,且推理时无需技能。在ALFWorld、WebShop和搜索式QA环境测试中,ADRS显著提升了模型成功率,能精准强化关键决策token,数据效率高,在长交互链路中优势更明显,同时明确了方法边界。