针对大模型强化学习后训练中动态数据策略接入困难、不同策略效果难以公平对比的问题,北大DCAI团队等联合发布了开源框架DataFlex-RL。该框架复用verl训练流程,将数据选择、样本重加权、领域配比调整三类动态数据策略设计为可配置组件,共享训练过程中产生的奖励、优势等信号,实现打分与执行解耦。这使得用户无需反复修改训练器,即可在同一RLVR/GRPO流程中灵活切换和验证不同数据策略。研究团队通过591次实验,覆盖了多类模型和数学、逻辑、科学任务,验证了各类数据策略的实际效果。DataFlex-RL是此前开源项目DataFlex向强化学习训练环节的延伸,两者互补,共同覆盖了从数据准备到强化学习更新的全流程数据调度需求。
