Apple与Hasso Plattner研究所联合发表的论文,基于超200组GRPO强化学习推理训练实验发现:高资源语言以母语推理训练与英语训练的性能差距普遍在2%以内,中文差距仅1.1%,打破「推理必须用英语」的固有认知,表明中文等非英语高资源语言推理模型可独立训练。实验还表明,跨语言迁移普遍有效,低资源语言训练有时能提升泛化能力,多语言混合训练性价比高,但部分模型-语言组合会导致特定任务性能骤降,需逐语言、任务、模型排查风险。