Anthropic发布的研究显示,Claude在不到四周的时间内优化了30多个开源生物分子模型。在允许少量精度变化的情况下,任务平均加速约4倍;在要求输出一致的情况下,平均加速近2倍。代码优化主要由Claude完成,仅有两名无传统推理优化或GPU内核工程背景的技术人员负责监督。几乎与此同时,AItonomy Foundation发布了开源项目ScienceIDE,该项目将科学代码库转化为可执行、可验证的智能体学习环境。目前,ScienceIDE已集合了包含27个科学代码库的64个环境、2812个任务及1076项科学检查,覆盖多个科研方向。团队以PLUTO代码进行实验发现,AI生成的第一版GPU实现虽能运行且结果符合预期,但速度提升有限。经过与AI的迭代优化,速度再次提升近3倍。这表明,AI一次性生成的实现距离充分利用硬件性能仍有差距,且科学代码优化需确保科学等效性。团队还推出了ScienceIDE-Hard评测集,在15个前沿模型中,表现最强的Claude Fable 5.1仅完成了67.1%,多数模型的完成率在30%以下。此外,团队利用科学交互轨迹进行监督微调,训练并开源了PhAI-IDE系列模型,发现其不仅提升了科学任务能力,还能迁移至代码、推理、知识类通用基准任务。AItonomy Foundation计划将Anthropic开源的36个优化包整理成ScienceIDE环境,以便社区在此类工作上训练和评测模型。
