Agent 驱动的模型训练,基元律动做了一次迈向 RSI 的实验
8 小时前

基元律动发布了开源模型NeoHorse-1,该模型包含4B和9B两个版本。它利用此前开源的OpenSquilla路由系统生成的完整轨迹数据,包括需求预测、路由决策、执行过程和环境结果,作为教学资料。NeoHorse-1将Agent的推理、行动和反馈链条作为训练单元,通过轨迹筛选、基于路由能力需求的课程学习以及路由引导的On-Policy Distillation等步骤,完成了单轮闭环训练。这一训练方式显著提升了模型在Harness Agent和工具交互等任务上的能力,被视为递归自我改进(RSI)的可复现单轮闭环验证。该项目由无问芯穹提供底层技术支持,清北团队参与算法研究。其构建的模型与Harness飞轮有望推动Agent在执行过程中不断成长。