美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值
8 小时前 / 阅读约12分钟
来源:36kr
美国阿贡国家实验室提出大语言模型驱动的智能体系统ChemGraph,用于计算化学分子模拟。通过13项基准任务评估,多智能体架构显著提升模型表现,展现了AI自动化科研工作流的潜力。

来自美国阿贡国家实验室的研究团队提出了一种由大语言模型驱动的智能体系统 ChemGraph,旨在执行计算化学领域中的分子模拟工作流程。

近年来,人工智能的快速发展,尤其是大语言模型(LLM)的进步,为自动化科学研究开辟了新的可能。当前已有多个基于 LLM 的智能体被开发出来,用于辅助用户完成各种与化学相关的任务——比如 Bran 等人开发了由大语言模型驱动的化学智能体 ChemCrow,能够执行多种分子的化学合成任务;McNaughton 等人开发了一种集成化学信息学工具的大语言模型智能体 CACTUS,能够帮助研究人员完成分子性质预测、相似性搜索以及药物相似性评估等任务;White 及其同事提出了一种能够执行分子动力学(MD)工作流程的 LLM 智能体助手 MDCrow。 

在此背景下,来自美国阿贡国家实验室的研究团队提出了一种由大语言模型驱动的智能体系统 ChemGraph,旨在执行计算化学领域中的分子模拟工作流程。 

研究人员在 13 项基准任务中对 ChemGraph 进行了评估,结果表明,对于仅需调用少量工具的简单任务,较小规模的大语言模型(如 GPT-4o-mini 和 Claude-3.5-haiku)能够实现较高的准确性和稳定性,然而随着任务复杂度提升,这些模型的性能会显著下降,而大型模型(GPT-4o)则能够保持较强的表现。通过有策略地将复杂任务拆解为更小、更易管理的子任务,即使采用较小规模的模型,也能够提升 ChemGraph 的性能,使其达到与 GPT-4o 相当的水平,甚至在部分情况下超过 GPT-4o 的表现。 

相关研究成果以「ChemGraph as an agentic framework for computational chemistry workflows」为题,已刊登  Nature 子刊 Communications Chemistry。 

研究亮点:

* ChemGraph 利用基于图神经网络的基础模型实现准确且效率高的计算,同时结合 LLM 的自然语言理解、任务规划和科学推理能力,提供直观且交互式的操作界面

* ChemGraph 能够完成从 SMILES 字符串和分子结构生成,到几何优化、振动分析以及热化学计算等一系列任务

* ChemGraph 支持用户使用多种分子模拟方法,包括半经验方法、机器学习势函数以及密度泛函理论(DFT)

论文地址:https://www.nature.com/articles/s42004-025-01776-9

13项基准实验,建立计算化学智能体评估体系

尽管目前已经存在一些智能体基准测试框架,但计算化学领域尚不存在用于智能体评估的统一基准。因此,研究人员设计了 13 项基准实验,用于评估 ChemGraph 的能力。 这些实验旨在测试 ChemGraph 利用六种集成工具完成任务的能力,包括单次工具调用和工具链式调用。 

根据用户输入类型的不同,这些任务被划分为三类:(1)分子名称;(2)SMILES字符串;(3)化学反应,下表总结了 13 项实验中开展的 360 次独立评估。 

*用于评估 ChemGraph 的基准实验汇总表*

在前 11 项实验中,任务主要围绕分子名称或 SMILES 字符串展开,每项任务最多需要调用 4 次工具或完成 4 个子任务。相比之下,最后两项实验聚焦于化学反应热化学性质的计算,复杂程度显著提高,根据反应物和生成物数量的不同,需要调用 9 至 12 次工具。这些任务需要分别对每种物质执行热化学计算,并基于之前得到的结果进一步构建反应层面的性质。

由大语言模型驱动的智能体框架 ChemGraph

ChemGraph 是一种由大语言模型驱动的智能体框架,旨在通过结构化工具调用和推理能力,实现分子模拟工作流程的自动化,其基于 LangGraph 实现,并遵循 ReAct 框架。

LangGraph 引入了一种基于图结构的执行模型,旨在实现更加稳健的多智能体协同。一个典型的 LangGraph 工作流程由三个部分组成:

  • 状态(state):状态是表示系统当前状态的共享数据结构。
  • 节点(nodes):节点是定义智能体逻辑的 Python 函数,以当前状态作为输入,并返回更新后的状态;节点可以是大语言模型,也可以是执行特定操作的函数。
  • 边(edges):边是控制消息流向的函数,用于决定下一步执行哪个节点。边可以分为有向边或条件边——有向边表示消息从一个节点到另一个节点的固定单向传递过程;相比之下,条件边提供了更大的灵活性,使消息能够根据特定条件流向不同节点。

下图展示了 ChemGraph 的通用结构——首先,大语言模型智能体会获得一组预定义工具,根据用户提示词,智能体决定调用哪一个工具;每次工具调用完成后,大语言模型会接收工具调用结果,并判断是否需要进行下一次工具调用;当所有工具调用完成后,消息可以沿两种路径之一继续传递。

*ChemGraph 概览*

在第一种路径中,ChemGraph 类似于传统的大语言模型,会返回一个类似人类语言的响应,其中包含工具调用产生的结果;在第二种模式下,消息会被转发给第二个大语言模型智能体,该智能体负责生成结构化输出(采用预定义的 JSON 格式),直接响应用户请求。这种双模式设计同时支持自然语言交互和系统化评估,使 ChemGraph 既能够满足典型使用场景,也能够适用于评测工作流程。

下图进一步展示了 ChemGraph 如何调用工具并协调工具输出,以完成计算化学任务:

*使用 GPT-4o-mini 执行 react2enthalpy 任务时,人类与 ChemGraph(单智能体)交互的示例* 

在该示例中,用户要求 ChemGraph 使用 GFN2-xTB 方法计算甲烷燃烧反应在 400 K 条件下的反应焓。ChemGraph(搭载 GPT-4o-mini)首先将反应中每个分子的化学名称转换为 SMILES 字符串(工具调用 1 至  4)。随后,它基于这些 SMILES 字符串,在 AtomsData 数据结构中生成原子坐标(工具调用 5 至 8)。最后,ChemGraph 利用生成的原子坐标以及用户指定的参数(例如计算器类型、温度等)执行热力学计算。

多智能体架构能显著提升模型表现

通过 13 项基准任务测试,研究团队对 ChemGraph 在不同复杂程度计算化学任务中的表现进行了系统评估: 

单智能体评估

首先,研究人员针对三种大语言模型——GPT-4o-mini、Claude-3.5-haiku 和 Qwen-2.5-14B,对单智能体 ChemGraph 在 13 项实验任务中的表现进行了评估;对于 GPT-4o,仅评估了其在最后两个问题(react2enthalpy 和 react2gibbs)中的表现。下图展示了不同模型在不同任务上的准确率:

*单智能体 ChemGraph 的准确率热力图* 

在 name2smi 任务中——Claude-3.5-haiku 并没有始终一致地调用 molecule_name_to_smiles 工具,而是有时尝试利用其内部化学知识手动构建 SMILES 字符串,或者拒绝使用该工具, 受此影响,Claude-3.5-haiku在该任务中每个分子的平均工具调用次数在三个模型中最低;GPT-4o-mini能够准确完成该实验并生成正确答案;Qwen-2.5-14B通常能够生成准确的工具调用,包括正确的工具名称和参数,然而它的错误主要发生在从工具输出中提取结果的过程中。

在 name2xyz、name2opt 和 name2vib 任务中——要求大语言模型不仅能够准确调用工具,还需要生成正确且结构化的输出结果。对此,GPT-4o-mini 和 Claude-3.5-haiku 均表现良好,准确率超过 83%。

在 smi2xyz 至 smi2file 任务中——Claude-3.5-haiku 和 GPT-4o-mini 保持了较强且稳定的表现,两者准确率均超过83%;Qwen-2.5-14B 在这一组任务中的表现也有所提升,最低准确率达到 77%。

在 react2enthalpy 和 react2gibbs 任务中——Qwen-2.5-14B 的表现最弱,准确率低于20%;GPT-4o-mini 取得了中等水平的结果,准确率分别为 40% 和 49%;Claude-3.5-haiku 的表现优于其他小规模大语言模型,准确率分别达到 67% 和 69%;GPT-4o 取得了最高性能,在两个任务中的平均准确率均超过 83%。

多智能体评估

研究人员进一步使用 GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14B 以及 GPT-4o 评估了多智能体 ChemGraph 的性能(如下图),并将结果与单智能体性能进行了比较。

*使用不同大语言模型时,多智能体和单智能体 ChemGraph 在 react2enthalpy 和 react2gibbs 任务中的平均准确率*

结果显示,多智能体系统显著提升了不同模型的准确率。在 react2enthalpy 任务中,GPT-4o-mini 的准确率从 40% 提升至 87%,Claude-3.5-haiku 则从 67% 提升至 87%,两者结果均为三次独立运行的平均值。值得注意的是,这两个模型均超过了单智能体 GPT-4o 的 83% 基准表现。在最后一个任务 react2gibbs 中,也观察到了类似趋势:GPT-4o-mini 的准确率从 49% 提升至 87%,Claude-3.5-haiku 则从 69% 提升至 93%。相比之下,Qwen-2.5-14B 仅获得了有限提升,主要原因在于其频繁出现工具调用错误,限制了聚合智能体生成准确答案的能力。

最终,在多智能体模式下,GPT-4o 实现了完美准确率,以 100% 的成功率完成了两个任务(react2enthalpy 和 react2gibbs)。

写在最后

ChemGraph 作为面向计算化学和材料科学的大语言模型智能体系统,展现了 AI 自动化科研工作流的潜力。研究团队表示,未来将通过集成更多工具、优化智能体架构以及增强高性能计算支持,进一步拓展 ChemGraph 在大规模模拟任务中的应用能力。同时,系统通过 Docker 容器保障运行安全,并持续提升智能体的可靠性。

值得注意的是,ChemGraph 并非替代传统计算化学软件,而是通过自然语言交互成为连接研究人员与模拟工具的智能协作层。随着开源大模型的发展,ChemGraph 也有望降低 AI 科研应用成本,推动智能科学智能体在材料发现、分子设计等领域发挥更大价值。

参考文献:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9