美初创建 AI 科研设施 测试发现 AI 模型缺实验室实操能力
6 小时前

美国旧金山初创公司C5R耗时12周,建成了由AI驱动的跨生物学、化学和材料科学研究设施Facility-0,并推出了SciUniverse基准,用于测试AI模型在真实实验室环境中的工作能力。测试结果显示,尽管前沿AI模型具备扎实的科学理论知识,但在物理现实操作上存在严重不足,如忽略样本冷冻状态、重复使用枪头导致样本污染、对敞开孔板涡旋震荡时无视溶剂蒸发等。在Level1难度的任务测试中,6款前沿大模型参与,这些任务熟练科学家仅需数小时即可完成,但表现最佳的Claude Fable 5.1 Pass@1通过率仅为45.3%。此外,测试还发现模型表现与推理成本之间并未形成理想的正相关关系。SciUniverse基准共包含92个Level1任务,覆盖样品制备、仪器控制、协议适配等科研核心环节。与全机器人无人自主实验室的行业趋势不同,C5R的系统将人类操作员纳入工作循环,可同时控制仪器和向人类下发指令,其核心在于评估模型能否将研究目标转化为人和机器可执行的实验步骤,并基于实验结果指导后续决策。C5R认为,当前AI自主科研的瓶颈正从计算转向物理执行,要让AI开展真正有用的科研工作,必须为其提供连接实体仪器与实验的物理工作空间,而非仅处理数字数据的系统。