AI4Science 科普系列 05|科研 Agent:从工具调用到自主实验
AI 怎样把文献、代码、仿真和实验接成一条工作链
科研工作里,耗时间的地方经常不在某一次计算本身。找资料、整理参数、写脚本、跑仿真、检查报错、比较结果、修改方案,再把这些过程记录下来,往往占掉了更长的时间。前几篇文章讨论了 PINN、神经算子、代理模型和数字孪生,它们解决的是建模、快速预测和在线同步的问题。再往前走一步,会遇到一个很实际的需求:这些模型和工具能不能按照研究目标被自动组织起来。
这就是科研 Agent 出现的背景。
Agent 这个词近两年被使用得很多。放在科研场景里,可以先用一个朴素的定义来理解:它接收目标,读取当前状态,选择合适的工具执行任务,再根据工具返回的结果决定下一步。 这个过程会循环多次,直到达到预先设置的停止条件,或者把任务交回研究人员处理。
这类思路在 2023 年前后已经开始成形。ReAct 在 2023 年已经系统讨论了“推理—行动—观察”的交替过程[1]。随后 ChemCrow 把化学数据库、计算工具和实验相关工具接入大模型[2];Coscientist 则进一步把网络检索、代码执行和实验自动化放进同一套研究流程[3]。到 2026 年,相关研究已经延伸到先进科研仪器操作、自校正多智能体实验系统以及实验室级资源管理[4-6]。
本文不讨论某一个 Agent 框架的 API,也不比较不同大模型的排行榜。重点放在科学计算和工程研发里更稳定的几个问题:Agent 到底增加了什么能力,科研任务如何拆解,多智能体为什么会出现,以及自动化走到真实设备以后需要补上哪些约束。
01 从模型输出到任务执行
普通机器学习模型最常见的形式很简单:给定输入,得到输出。
$$
\mathbf{y}=f_{\theta}(\mathbf{x})
$$
例如给定电机的气隙、磁钢厚度和电流,模型预测转矩和效率;给定材料组成,模型预测性能;给定一个温度场的初始条件,神经算子预测后续演化。这类模型的任务边界很清楚,输入和输出通常在训练前就已经确定。
固定工作流比单个模型多了一层执行逻辑。工程师可以预先写好:先读入参数,再运行求解器,然后提取结果,最后生成报告。只要每一步都正常,整个流程可以无人值守地跑完。问题出现在流程之外的情况,例如某个仿真不收敛、结果超出约束、文件格式发生变化,或者下一组参数需要根据上一组结果临时调整。固定工作流只有提前写过相应规则时才会处理这些情况。
Agent 多了一层“根据当前情况选择下一步动作”的能力。可以把它写成:
$$
a_t=\pi_{\theta}(s_t,m_t,g)
$$
其中,$s_t$ 表示当前任务状态,$m_t$ 是已经积累的历史信息,$g$ 是研究目标,$a_t$ 是当前准备执行的动作。动作执行以后,环境返回观测 $o_t$,任务状态随之更新:
$$
s_{t+1}=F(s_t,a_t,o_t)
$$
这里的“动作”可以很普通,例如运行一段 Python、调用有限元软件、读取数据库、查询文献,也可以是让机械臂完成一次取样。Agent 的工作重点放在动作选择、参数组织、结果读取和后续处理上。

图 1 大语言模型、固定工作流和科研 Agent 在执行层面的差别。
表 1 可以更直接地看出三者的边界。
| 类型 | 步骤由谁决定 | 工具调用 | 遇到异常后的处理 | 是否保存任务状态 | 适合的任务 |
|---|---|---|---|---|---|
| 单次大模型调用 | 用户和提示词 | 可以有 | 通常重新询问或重新生成 | 较弱 | 问答、总结、代码片段 |
| 固定工作流 | 开发者预先写好 | 稳定 | 依赖预设规则 | 稳定 | 流程清楚、变化少的批处理 |
| 科研 Agent | 根据目标和当前状态动态选择 | 动态 | 可根据结果重新规划 | 通常需要 | 长任务、多工具、需要迭代判断的研究流程 |
ReAct 提供了一个早期且影响很大的实现思路:模型在“思考当前任务”和“调用外部环境”之间交替进行[1]。ChemCrow 把这种模式放到化学领域,接入了 18 个专家设计工具,用于反应、分子、安全和检索等任务[2]。这些工作说明了一件很实际的事:大模型在科研系统里的用途并不局限于生成一段文字,它也可以承担工具之间的调度工作。
当然,能够调工具还只是开始。科研任务比一般软件自动化更麻烦,因为工具返回的结果常常没有一个简单的“成功/失败”标签。有限元算完了,结果可能仍然不可信;代码顺利运行,单位可能写错;实验数据看起来正常,也可能已经受到仪器漂移影响。后面的“验证”环节因此不能省略。
02 一次科研 Agent 任务通常怎样推进
用一个比较常见的工程优化任务做例子。假设目标是设计一台电机,希望提高效率,同时满足转矩和温度约束。可以把目标写成:
$$
\max_{\mathbf{x}}\ \eta(\mathbf{x})
$$
约束为:
$$
T(\mathbf{x})\ge T_{\mathrm{req}}
$$
$$
T_{\max}(\mathbf{x})\le 120^{\circ}\mathrm{C}
$$
设计变量还要满足边界:
$$
\mathbf{x}{\min}\le \mathbf{x}\le \mathbf{x}{\max}
$$
这里的 $\mathbf{x}$ 可以包括气隙、磁钢厚度、极弧系数、绕组参数和工作电流。工程师手工做这件事时,会先确定参数范围,再生成方案,运行 Motor-CAD 或 Maxwell,看结果是否通过约束,再决定下一组参数。
把这套工作交给 Agent 后,工作内容基本没有消失,只是被拆成了更明确的几个环节。
2.1 先把研究目标写成可以检查的条件
自然语言里的“效率尽量高”“温度不能太高”需要转成机器能检查的目标和约束。很多 Agent 项目失败在这一步:任务描述很长,验收条件却含糊。科研场景里最好把结束条件提前写清楚,例如:
- 效率达到 96% 以上;
- 峰值温度不超过 120 ℃;
- 至少完成 30 组有效高保真计算;
- 连续 5 轮优化改进低于 0.1% 时结束;
- 所有最终候选方案都要重新用高保真模型复核。
这些条件越明确,Agent 后面的行为越容易检查。
2.2 根据任务选择工具
科研 Agent 通常没有必要自己重新实现一个有限元求解器。它会调用已经成熟的工具,例如 Python、Matlab、Maxwell、Motor-CAD、COMSOL、数据库接口和文献检索系统。Coscientist 的做法就是把文档搜索、网络搜索、代码执行和实验自动化放在一个系统里[3]。2026 年 Vriza 等人的工作则进一步展示了 Agent 学习和操作复杂科研仪器的可能性[4]。
工具接口设计会直接影响系统稳定性。一个好的工具调用应该给出清楚的输入、输出和错误状态。例如仿真工具至少需要返回:任务是否启动、是否收敛、结果文件在哪里、关键指标是多少、是否出现警告。只返回一段很长的日志,对后续自动判断帮助有限。
2.3 执行之后先检查,再决定下一步
假设某一组参数得到:
$$
\eta=96.4%,\qquad T=210\ \mathrm{N\cdot m},\qquad T_{\max}=137^{\circ}\mathrm{C}
$$
效率很好,但温度已经超出约束。此时任务不能简单标记为“仿真成功”。更合理的状态是“计算成功,设计不满足约束”。Agent 可以把这组结果写入数据库,再让优化算法提出下一组参数。
对于科研任务,“执行成功”和“科学上可接受”需要分开记录。前者检查软件是否跑通,后者检查单位、约束、物理规律、数值收敛以及结果是否处在模型的有效范围内。
2.4 过程记录要和计算结果一起保存
长任务中最容易丢失的往往是中间过程。一次计算为什么重跑、哪个参数被改过、用了哪个软件版本、失败任务为什么被跳过,这些信息如果没有保存,后续很难复查。
可以把第 $t$ 轮的任务记录写成:
$$
\mathcal{H}_t=
{(a_1,o_1),(a_2,o_2),\ldots,(a_t,o_t)}
$$
实际工程中还应附带时间、数据版本、程序版本、文件哈希和运行环境。2026 年关于 self-driving laboratory 的综述把完整的数据来源和实验过程记录列为后续规模化的重要基础[7]。这件事听起来没有“智能”那么吸引眼球,但它直接决定系统出了问题以后能不能查清楚。

图 2 科研 Agent 的一次工作循环。每轮都保留执行和验证结果,下一轮再读取这些状态。
不同环节适合采用的实现方式也不一样。
| 环节 | 常用实现 | 需要重点检查的内容 |
|---|---|---|
| 目标解析 | LLM + 规则模板 | 目标是否可量化、约束是否完整 |
| 工具选择 | LLM、路由器、固定策略 | 工具权限、输入格式、适用范围 |
| 参数生成 | 优化算法、主动学习、LLM | 是否越界、是否重复、是否物理合理 |
| 计算执行 | 脚本、API、仿真软件 | 启动状态、收敛、异常日志 |
| 结果验证 | 规则、物理判据、独立模型 | 单位、极值、约束、物理一致性 |
| 过程记录 | 数据库、文件系统、知识图谱 | 版本、来源、时间和修改原因 |
03 单 Agent 和多 Agent 怎么选
一个 Agent 可以完成很长的任务,但任务越复杂,它需要同时维护的信息越多。科研项目经常同时包含参数设计、计算、数据清洗、优化和结果复核,这些工作使用的工具不同,失败方式也不同。把职责拆开后,系统更容易定位问题,也更方便给不同角色配置不同权限。
以电机仿真优化为例,可以把任务分成五类:设计 Agent 负责生成候选参数,仿真 Agent 负责求解器调用,优化 Agent 负责搜索设计空间,验证 Agent 检查结果,数据 Agent 负责保存计算过程。再由一个编排 Agent 维护整体目标和任务队列。

图 3 多智能体工程设计的一种分工方式。角色数量应根据任务复杂度确定,没有必要为了形式把每一步都拆成独立 Agent。
从数学上看,多智能体系统可以抽象成一个通信图:
$$
\mathcal{G}=(\mathcal{V},\mathcal{E})
$$
$\mathcal{V}$ 是 Agent 集合,$\mathcal{E}$ 表示允许的信息交换关系。某个 Agent $i$ 在时刻 $t$ 的决策可以写成:
$$
a_t^{(i)}=\pi_i\left(s_t^{(i)},m_t^{(i)},\mathcal{M}_t^{(i)}\right)
$$
其中 $\mathcal{M}_t^{(i)}$ 表示从其他 Agent 收到的信息。这样写的好处是可以看出,多 Agent 系统多出来的不只是“多个模型”,还有通信、同步和冲突处理。
2026 年 Kusne 和 McDannald 在 Communications Materials 中专门讨论了自主材料实验室的管理问题[6]。文章比较了中央 Agent 和多 Agent 分层管理两类方案:中央式结构较容易实现,复杂度集中在一个管理节点;分层结构可以把工具知识放到本地 Agent,上层只处理跨工具和跨任务协调。后者更容易扩展,代价是通信、资源调度和状态一致性问题变多。

图 4 单一中央 Agent 与多 Agent 分层管理的概念对比。根据 Kusne & McDannald (2026) 的实验室管理场景改绘[6]。
2026 年的 AutoLabs 也采用了多智能体和自校正机制,用来把自然语言实验要求转换成高通量液体处理设备可以执行的协议[5]。这类工作开始把“Agent 分工”从软件演示推进到可以执行的实验流程。
不过,多 Agent 并不适合所有任务。角色增加以后,会出现新的工程负担,例如两个 Agent 同时修改同一份参数、重复提交计算任务、相互等待、对同一结果给出相反判断。下面这个表更接近实际选型时需要考虑的问题。
| 维度 | 单 Agent | 多 Agent |
|---|---|---|
| 系统结构 | 简单,状态集中 | 角色和通信关系更多 |
| 工具数量 | 少量工具较合适 | 适合多工具、多设备 |
| 并行执行 | 一般 | 更容易并发 |
| 故障定位 | 长任务中较难 | 可以按角色定位 |
| 权限隔离 | 粗粒度 | 可以按 Agent 分配权限 |
| 协调成本 | 低 | 较高 |
| 适用场景 | 边界清楚的单任务 | 跨软件、跨设备、长周期研究任务 |
在工程实现里,常见的折中方式是“一个管理 Agent + 一组功能模块”。只有那些需要独立判断、长期状态和独立权限的模块才做成 Agent,其余步骤保留为普通函数、脚本或优化算法。这种结构通常更容易维护。
04 从软件 Agent 到自主实验
前面的例子主要发生在数字环境里。Agent 调用代码和仿真软件,最多影响计算资源。当它接入传感器、机器人、表征仪器和实验设备以后,问题会多出时间同步、设备状态、物理安全和实验成本。
可以把这类系统粗略分成三个层级。
4.1 软件 Agent
任务全部发生在计算机里,例如:
- 自动整理文献和数据;
- 生成并运行代码;
- 批量调用仿真软件;
- 根据优化结果继续搜索参数;
- 自动整理报告和实验计划。
这类系统最容易落地,失败后的代价也相对容易控制。
4.2 与数字孪生连接的 Agent
数字孪生持续接收真实设备数据,Agent 则读取孪生状态并决定是否调整参数、安排额外计算或触发维护流程。上一篇文章讨论过状态估计和模型更新。把 Agent 接进来之后,可以形成:
观测 → 状态估计 → Agent 决策 → 动作 → 新观测
这里 Agent 负责工作流层面的判断,数字孪生负责提供更稳定的系统状态。两者职责分开后,工程上更容易做权限控制。
4.3 Self-driving laboratory
自主实验室把闭环继续推进到实验设计和设备执行。一个典型循环是:
$$
\mathbf{x}{t+1}=\arg\max{\mathbf{x}}\mathcal{A}(\mathbf{x}\mid\mathcal{D}_t)
$$
其中 $\mathcal{A}$ 是采集函数,可以衡量预期改进、不确定性或信息增益。系统执行实验后获得新观测:
$$
\mathcal{D}{t+1}=\mathcal{D}t\cup{(\mathbf{x}{t+1},\mathbf{y}{t+1})}
$$
然后继续选择下一次实验。这里的优化算法可以是贝叶斯优化、主动学习,也可以和大模型 Agent 结合。Agent 更适合处理实验说明、工具选择、异常和跨设备编排,数值优化器则负责明确的连续参数搜索。

图 5 科研 Agent 接入数字模型和真实设备后的闭环。真实设备返回的新数据进入下一轮任务规划。
这一方向已经有不少实证工作。Coscientist 在 2023 年展示了大模型系统自动设计并执行化学实验[3];ChemCrow 在 2024 年把化学工具与大模型结合,用于合成规划和材料相关任务[2]。2026 年 Vriza 等人展示了能够从仪器说明和运行过程继续学习的科研仪器 Agent[4]。同年 Nature Reviews Chemistry 的综述把 self-driving laboratories 的发展问题归纳到三个很具体的方面:规模化、跨平台泛化和全过程数据来源记录[7]。
从现有文献看,自主实验室距离“通用机器人科学家”还有很长的工程距离。大多数系统仍然围绕边界清楚的材料、化学或仪器任务搭建。设备接口、样品流转、异常检测、标准化数据和实验安全仍占据大量工作量。2026 年多智能体实验室管理的讨论也强调了数字沙盒和物理沙盒的作用:在控制昂贵设备之前,可以先在仿真环境中验证 Agent 的策略和资源调度方法[6]。
05 科研 Agent 的可靠性要从执行过程里做出来
科研 Agent 经常会面对一个误区:模型回答得流畅,工具也调用成功,看起来任务就完成了。工程和实验场景里,很多错误不会让程序崩溃,它们只会让结果悄悄变得不可信。
5.1 软件运行成功和科学结论成立是两类检查
例如弹性模量应该输入:
$$
E=2.1\times10^{11}\mathrm{Pa}
$$
如果程序接口要求单位为 MPa,而 Agent 没有换算,求解器依然可能正常运行。类似问题还包括温度的摄氏度和开尔文混用、毫米和米混用、转速单位错误,以及材料牌号对应关系错误。
因此,自动化流程至少需要两类检查:执行层检查软件有没有跑通,科学层检查输入输出是否符合物理和工程约束。
5.2 停止条件应提前写进任务
Agent 很容易陷入“还能继续优化”的循环。如果目标已经几乎不再改善,继续计算只会消耗资源。常见停止条件可以写成:
$$
\frac{|f_{k+1}-f_k|}{|f_k|}<\varepsilon
$$
连续满足 $N$ 轮后停止。也可以设置计算预算、实验次数、最大运行时间和不确定性阈值。研究人员在任务开始前给出这些条件,比运行到后面再由模型临时判断更稳定。
5.3 高风险动作要有权限边界
软件环境里的读取、计算、修改文件和真实设备控制,风险等级完全不同。可以给 Agent 划分操作权限。
| 权限级别 | 允许操作 | 典型用途 |
|---|---|---|
| L0 | 只读取资料和历史结果 | 文献、数据库查询 |
| L1 | 运行受限计算 | Python、代理模型、仿真后处理 |
| L2 | 修改数字模型和提交计算 | 参数扫描、批量仿真 |
| L3 | 改变设备设定值,需要人工确认 | 温度、流量、功率、运动轨迹 |
| L4 | 在明确安全边界内自动闭环 | 成熟的自主实验平台 |
2025 年关于 self-driving laboratory 安全的综述专门讨论了机器人、实验设备、视觉感知和风险分级等问题[8]。这类安全设计与模型推理能力是两条不同的工作线,需要分别建设。
5.4 每一步都要能追溯
科研结果最终要回答“这个数从哪里来的”。Agent 系统也一样。建议每一次执行都至少保存:
| 记录项 | 示例 |
|---|---|
| 任务输入 | 用户目标、参数范围、约束 |
| 动作记录 | 调用了哪个工具、传入什么参数 |
| 软件环境 | 软件版本、模型版本、依赖环境 |
| 输出结果 | 数值、文件、图像、日志 |
| 判断依据 | 为什么接受、拒绝或重试 |
| 数据来源 | 文献、数据库、实验批次 |
| 人工操作 | 谁确认了高风险步骤 |
这些内容不需要全部交给大模型“记住”。更稳妥的方式是存进数据库、结构化日志或知识图谱,Agent 需要时再读取。长期运行以后,这些记录也会成为故障分析和下一轮模型训练的数据来源。
5.5 自动化程度可以逐步增加
科研系统没有必要一开始就追求完全自主。很多团队更适合从“Agent 给建议、人工点击执行”开始,再逐步开放批量计算、数字模型修改和设备控制。随着工具接口、异常处理和验证规则稳定下来,再提高自动化等级。
2025 年 Hartung 对 agentic models 和实验自动化的综述把可重复性、可审计性和治理列为科研 Agent 继续扩展时需要解决的问题[9]。2026 年 AutoLabs 的自校正多智能体系统也把可靠执行作为研究重点[5]。这些工作给出的方向比较一致:科研 Agent 的性能需要和过程可靠性一起评估。
结语
科研 Agent 可以先理解成一个执行层。它上面接研究目标,下面接文献、数据库、代码、仿真软件、数字孪生和实验设备。模型负责理解任务和做局部判断,已有的科学软件负责计算,优化器负责搜索,数据库负责保存状态,验证规则负责把不合理结果拦下来。
这种结构对 AI4Science 很实用,因为科研工作本来就是由很多异构工具拼起来的。把这些工具接通以后,Agent 可以减少重复操作,让长周期任务更容易持续运行,也能把计算和实验过程留下更完整的记录。
现阶段最适合 Agent 的任务通常具有几个特点:步骤很多、工具明确、状态可以记录、结果可以检查。任务越开放、科学判断越依赖经验,人工参与仍然越重要。自主实验室的发展也在沿着这个顺序推进:先把窄任务做稳,再逐步扩大工具范围和自动化程度。
下一篇可以继续沿着这条线讨论 Self-driving Laboratory。届时关注点会从“Agent 如何执行研究任务”进一步落到实验闭环:怎样选择下一次实验、怎样把机器人和表征设备接进来,以及一个自主实验系统怎样判断自己已经学到了足够的信息。
参考文献
[1] Yao S, Zhao J, Yu D, et al. ReAct: Synergizing Reasoning and Acting in Language Models. International Conference on Learning Representations (ICLR), 2023. https://arxiv.org/abs/2210.03629
[2] Bran A M, Cox S, Schilter O, et al. Augmenting large language models with chemistry tools. Nature Machine Intelligence, 2024, 6: 525-535. https://doi.org/10.1038/s42256-024-00832-8
[3] Boiko D A, MacKnight R, Kline B, et al. Autonomous chemical research with large language models. Nature, 2023, 624: 570-578. https://doi.org/10.1038/s41586-023-06792-0
[4] Vriza A, Prince M H, Zhou T, et al. Operating advanced scientific instruments with AI agents that learn on the job. npj Computational Materials, 2026, 12: 160. https://doi.org/10.1038/s41524-026-02005-0
[5] Panapitiya G, Saldanha E, Job H, et al. AutoLabs: cognitive multi-agent systems with self-correction for autonomous chemical experimentation. Scientific Reports, 2026, 16: 19554. https://doi.org/10.1038/s41598-026-45593-z
[6] Kusne A G, McDannald A. Managing autonomous materials labs with multi-agent AI and its implications for the science of science. Communications Materials, 2026, 7: 173. https://doi.org/10.1038/s43246-026-01219-5
[7] Canty R B, Abolhasani M. The past, present and future of self-driving laboratories. Nature Reviews Chemistry, 2026, 10: 523-537. https://doi.org/10.1038/s41570-026-00847-2
[8] Leong S X, Griesbach C E, Zhang R, et al. Steering towards safe self-driving laboratories. Nature Reviews Chemistry, 2025, 9: 707-722. https://doi.org/10.1038/s41570-025-00747-x
[9] Hartung T. AI, agentic models and lab automation for scientific discovery - the beginning of scAInce. Frontiers in Artificial Intelligence, 2025, 8: 1649155. https://doi.org/10.3389/frai.2025.1649155