当 AI 进入实验室与工程设计:麦肯锡 2026 年"科学发现与工程 AI"研究解读
麦肯锡《Technology Trends Outlook 2026》技术趋势解读系列 · 第 3 篇
摘要
麦肯锡将"用于科学发现与工程的 AI"(AI for scientific discovery and engineering)列为 2026 年新增技术趋势。它覆盖生命科学、材料、化学、物理、能源等领域,关注模型、仿真、智能体与实验系统如何共同参与研发。报告指出,资本投入正在加速,但多数组织仍处于实验阶段,科学可靠性、数据质量、实验接入和成果转化继续限制规模化收益。本文区分预测、生成、工作流编排与实验闭环四类能力,结合药物研发、材料发现和物理仿真案例,分析技术进步转化为科研生产率的条件。本文提出,评价科学 AI 应当关注单位资源能够获得多少可靠、可重复且具有决策价值的证据。候选生成、实验选择、真实验证与反馈学习之间的协调,将决定这一趋势能否形成持续的研发优势。
关键词: 科学 AI;AI for Science;药物发现;材料设计;工程仿真;自主实验室;实验预算;科研生产率
一、这一趋势改变的是怎样的科研过程
假设一个团队正在寻找性能更好的电池材料。AI 可以根据已有数据预测材料性质,也可以生成新的候选结构。团队随后需要决定哪些候选值得投入实验,能否合成,如何测量性能,以及结果是否支持继续开发。
如果模型、仿真、实验设备和数据系统能够连接,实验结果还可以进入下一轮候选筛选。研发活动就会逐步形成持续迭代的过程。
这是用于解释机制的假设场景,并非报告中的实测案例。它呈现了这一趋势的核心:AI 正在参与科学问题的提出、候选方案的选择和证据的积累。
麦肯锡将其定义为利用 AI 加速生命科学、材料科学、化学、物理、气候、能源、地球科学、天文学及工程领域的研究。模型、仿真和智能体工作流可以帮助研究者生成假设、设计实验并自动化部分工作。1,正文第 28 页
这与前两项趋势具有联系。软件开发智能体提供任务执行与工具使用能力,企业智能体提供工作流组织方式;科学 AI 则进一步需要处理实验不确定性、物理约束、结果解释和可重复性。
在软件任务中,一个测试通过可以成为局部完成标准。科学研究通常还要判断:测试实际验证了什么,测量是否可靠,观察能否重复,以及结果能够支持多大范围的结论。
因此,科学 AI 的应用不仅涉及执行效率,也涉及证据如何形成。研究者能够更快提出和检验方案,确实可能提高探索能力;形成稳定的科学与商业成果,则需要更完整的验证过程。
二、先区分四类能力:科学 AI 并非一种统一工具
报告讨论了科学基础模型、深度学习仿真代理、智能体编排和实验自动化。这些技术可以组合,但它们承担的任务不同。
| 能力类型 | 主要承担的工作 | 输出还需要怎样检验 |
|---|---|---|
| 科学预测模型 | 根据科学数据预测结构、性质或相互作用 | 对照实验结果,并判断适用范围与不确定性 |
| 生成与设计模型 | 提出分子、序列、材料或工程设计候选 | 检查可实现性、目标性能与其他约束 |
| 科研工作流智能体 | 整理资料、组织分析、调用软件并管理任务状态 | 核对依据、参数、执行过程和结果解释 |
| 自动化实验系统 | 执行实验、采集数据并支持迭代 | 检查设备与测量质量,保留必要复核与重复验证 |
这一划分是本文依据报告提出的分析框架。1,第 28---33、36 页 它有助于避免把某项模型进展直接当作整套科研系统的能力。
以报告提到的几种模型为例,AlphaFold 在蛋白质结构预测上取得了重要进展;Boltz-2 进一步联合处理生物分子复合物结构与结合亲和力预测;Evo 2 则是基于 DNA 序列的模型,面向基因组建模与设计。2---4 将它们都笼统理解成"会设计药物的模型",会掩盖其输入、输出与验证要求的差异。
结构、结合与功能也需要分别判断。预测一个分子如何与靶点相互作用,有助于选择候选;药物研发还涉及细胞和机体中的行为、安全性及临床表现。不同证据回答不同问题,不能用一个预测结果代替后续全部验证。
大语言模型在这一体系中,往往承担工作流组织与交互的角色。报告明确强调,语言模型可以协调科研工具与仿真流程,并与领域模型、确定性计算软件和人类专家共同工作。1,第 31---32 页
这使科研系统具有组合式的能力来源:语言模型组织任务,领域模型提供预测,科学软件完成计算,实验系统产生观察,研究者负责问题定义、证据判断和重要决策。
三、报告中的发展信号:投资加速,采纳仍在实验阶段
第三项趋势的数据,与前两项趋势并不完全相同。
| 指标 | 报告结果 | 解读时需要保留的边界 |
|---|---|---|
| 2025 年股权投资 | 79 亿美元 | 报告定义的资本交易统计,不能当作科研成果价值或行业收入 |
| 2026 年上半年股权投资 | 125 亿美元 | 已超过前一年度统计值,但不是全年结果,也不是全部研发支出 |
| 相关岗位公告变化 | 2024---2025 年增长 18% | 特定关键词与数据来源下的招聘活动 |
| 较长时期的人才需求变化 | 岗位公告较 2022 年高点下降超过一半 | 与最近一年的回升可以同时成立,不能简单概括为持续扩张 |
| 2025 年岗位职能结构 | 约 80% 属于研发 | 反映统计范围内的研究与技术建设特征,不能换算为商业成熟程度 |
| 企业采纳评级 | 2:实验阶段 | 基于专家访谈的五级判断,多数组织尚处于早期部署 |
资料来源:报告正文第 30、34---35 页及研究方法第 3 页。
这些信号说明,科学 AI 正在吸引更多资本与应用尝试,但建立稳定的研发运行方式仍需要时间。融资支持了模型、设备、数据和人才建设,实际效果则应通过科研产出与转化结果另行判断。
招聘数据尤其值得仔细阅读。近期增长 18%,与较 2022 年高点显著下降,描述的是不同时间尺度。这些变化可能受到行业招聘周期、研发预算和岗位结构调整影响。报告本身不足以证明科学家岗位的下降由 AI 替代造成。
研究与专利的趋势分数也有统计边界。报告按定义的关键词识别活动,并在所研究的技术趋势之间归一化。1,第 3 页 科学 AI 的研究分散在多个学科,较低的类别分数不能直接证明相关研究稀少或科学基础薄弱。
与前两项趋势的"试点阶段"相比,这一趋势被评为"实验阶段"。这一判断对应的是 AI 原生科学发现系统的组织采纳,不能推导为蛋白质预测等所有具体技术都处于相同阶段。技术模块的成熟,与完整研发系统的成熟,需要分别观察。
四、药物发现:预测与设计改善了什么,临床证据说明了什么
报告把生命科学作为重要应用领域。AI 可以参与分子优化、毒性预测、候选生成和评估,也可以辅助文献分析、实验设计及临床研究相关工作。1,第 28 页
其意义首先体现在候选探索与筛选。科研团队可以利用模型比较更多方案,减少部分昂贵计算或低价值筛选,把实验资源投向更有希望的候选。
但研发目标包含多个互相约束的条件。某个候选对靶点具有较好的结合表现,还需要满足其他开发要求。一个模型优化得分最高的方案,未必就是整体上最适合推进的方案。
报告引用了药物研发通常需要超过十年、成本约 13 亿至 26 亿美元等行业估计,并用"Eroom 定律"描述研发生产率长期承压的现象。1,第 28---29 页 这些成本数字依赖具体估计口径,包括失败项目与资金成本如何计入,不能直接作为单个项目预算。
AI 可以改善其中若干环节,却不能从计算层面的提速直接推出完整研发周期按相同比例缩短。后续实验、临床研究和制造验证,仍有各自的证据要求与时间约束。
报告提到的 rentosertib 提供了一个具体案例。2025 年发表于《Nature Medicine》的研究报告了一项随机、双盲、安慰剂对照的 2a 期试验,纳入 71 名患者,治疗观察期为 12 周。主要终点是治疗期间出现不良事件的比例,肺功能等指标属于次要终点。研究者认为结果支持更大规模、持续时间更长的进一步研究。5
这一案例具有明确的价值:AI 参与发现与设计的候选,可以进入真实的人体研究,并接受独立于模型预测的临床检验。
其证据边界同样重要。一次早期试验不能单独证明长期疗效,也不能证明 AI 发现的所有药物都优于传统路径。本文引用的是这项 2025 年研究,并未把它作为候选截至本文核对日的完整开发状态。
从研发管理角度,还需要另一个比较维度:候选取得进展,与 AI 带来多少额外效率,是两个不同问题。若要评价平台生产率,需要比较任务难度、实验投入、时间、失败情况和后续结果,才能判断改善来自哪些环节。
五、材料与工程:理论上有希望的方案,如何进入实际设计
1. 材料发现需要同时考虑合成与制造条件
报告讨论了电池、催化剂、半导体、合金及其他材料中的 AI 应用。研究目标逐渐扩展到哪些材料能够被合成、放大并经济地制造。1,第 29、31 页
这意味着材料筛选是一项包含多重约束的工作。一个结构在计算中表现出良好的性质,并不能单独证明它能够在预期条件下制备,也不能证明性能在实际运行中长期稳定。
AI 对大规模候选空间的筛选,可以降低部分搜索与计算负担;合成方法、实际性能和制造约束,则需要由其他模型、仿真与实验共同补充。不同环节之间的信息能否连贯传递,影响研发效果。
伯克利实验室的 A-Lab 展示了这样的组合:AI 算法提出候选化合物,机器人进行制备与测试,使候选提出和实验评价能够更紧密地连接。6 这个案例说明实验自动化可以支持发现过程,并不意味着被制备的材料已经具备完整商业应用条件。
本文认为,材料 AI 的评价应当同时观察预测、合成和性能验证。只看候选数量,会忽略实际可执行性;只看某项性能,又可能忽略稳定性、可加工性和成本。
2. 工程仿真中的提速,需要保留模型适用范围
报告指出,物理约束 AI 与深度学习仿真代理可以近似某些昂贵的计算过程,例如流体和结构性能分析。1,第 29 页
仿真代理可以理解为利用既有数据学习设计参数与计算结果之间的关系,让团队更快比较大量方案。它能扩大早期探索范围,但误差会受到训练数据、物理条件和设计区域的影响。进入新的工况之后,需要进一步检验。
因此,工程团队可以在不同阶段使用不同精度的工具。较快的模型用于比较和筛选,重要设计再接受适当的高保真计算与实物测试。评价时应说明加速发生在哪个阶段,以及精度和适用范围如何得到保证。
3. 语言模型可以组织仿真,但自动补齐的假设需要检查
报告引用的 MCP-SIM 研究,尝试把不完整的自然语言要求转化为仿真任务,通过多个智能体组织澄清、代码生成、执行、诊断与结果说明。论文在其定义的 12 项基准任务中报告了全部任务成功,并明确保留了超出测试范围的验证需求。7
这展示了自然语言交互与专业计算工具连接的潜力。研究者和工程师有机会减少工具使用与流程组织中的部分工作,把更多精力投入问题本身。
同时,需要区分计算收敛和问题设定正确。如果系统自行补齐了边界条件或材料参数,即使计算顺利完成,也需要判断这些假设是否符合实际研究目标。
因此,本文建议把关键假设作为可检查的产物保留下来。语言模型可以协助提出设定,专业人员需要看清依据与影响范围。能够运行并生成图表,是工程分析的重要一步;形成可靠设计结论,还需要完整的验证依据。
六、闭环发现:把真实实验结果接回下一轮研究
报告最值得重视的发展之一,是从孤立模型向闭环发现系统扩展。1,第 32---33 页 在这样的系统中,模型提出候选,研究者与工作流选择实验,设备执行测试,数据系统记录结果,再用于调整下一轮研究。
其中,实验选择是连接预测与证据的关键环节。模型可以提出大量候选,团队却通常只有有限的实验预算。实验目标、可执行性、预期价值和不确定性,都需要进入选择过程。
| 闭环环节 | 需要形成的科研产物 | 对后续工作的作用 |
|---|---|---|
| 提出假设与候选 | 可检验的问题、设计及预测依据 | 明确研究对象与预期结果 |
| 选择实验 | 实验目标、资源安排与评价标准 | 把候选探索转化为可执行行动 |
| 执行与验证 | 原始观察、测量条件与质量记录 | 判断结果支持或反驳了什么 |
| 解释与反馈 | 更新后的判断、数据与研究计划 | 改善下一轮预测和实验选择 |
这是本文对闭环机制的归纳,并非报告中的实测模型。一个系统是否形成有效闭环,需要看真实结果有没有改变后续决策。
报告引用了 Ginkgo Bioworks 与 OpenAI 团队的一项研究。其 2026 年 2 月公布的预印本把 GPT-5 与自动化云实验室连接,经过六轮迭代,在特定无细胞蛋白质合成任务中,把每克蛋白质的反应配方成本较所用先进基准降低约 40%。8
这里的 40% 有具体含义:它对应特定实验条件下的反应配方成本指标,不能换成整个科研项目的总成本降低。模型调用、实验设备、人员和长期运维等投入,需要另外核算。
研究也保留了人类对实验系统的准备、维护和流程改进。8 因而,案例展示的是模型、自动化平台与团队配合的结果。本文按其预印本版本讨论,不将其视为所有科研任务都已实现自主执行的证明。
它所提供的重要证据,是语言模型提出的实验设计可以进入真实测试,测试结果又可以支持下一轮优化。在这一特定任务上,系统获得了能够被测量的改进。
闭环系统还需要管理失败。实验没有得到预期结果,可能源于候选本身,也可能源于执行条件、测量问题或设计不充分。只有记录这些差异,反馈才能改善研究判断,而不会把执行错误误当作科学结论。
七、怎样衡量科研生产率:把候选数量与证据产出分开
科学 AI 可以显著扩大候选探索空间,报告也把它视为提升研发生产率的一条路径。1,第 28 页 但产生更多候选与获得更多有效发现之间,存在实验选择和验证能力的约束。
假设团队的实验预算只允许验证 100 个候选。候选生成数量从 1,000 增加到 10,000,如果实验选择质量和验证条件没有改善,最终获得的可靠结果未必增加。这个例子用于解释约束,并非报告中的数据。
更多候选仍可能具有价值。它能够提供此前未考虑的选择,让团队比较不同设计方向。其价值需要通过筛选质量、实验信息和后续决策体现出来。
本文认为,科研生产率可以按以下层级观察。
| 评价层级 | 可以观察的结果 | 主要回答的问题 |
|---|---|---|
| 计算与分析 | 预测表现、仿真耗时、候选探索范围 | AI 是否改善了局部研究能力 |
| 实验与证据 | 固定预算下的验证结果、重复性与失败信息 | 资源是否获得了更可靠的知识 |
| 跨轮学习 | 后续预测与实验选择是否改善 | 反馈是否形成持续学习 |
| 开发与转化 | 进入后续阶段的成果、放大表现和完整成本 | 局部进展是否具有持续应用价值 |
上表是本文提出的评价框架。不同研究阶段需要选择适当指标,不能要求所有探索性工作立即证明商业收益。
实验目标本身也有区别。有些实验用于验证最有希望的候选,有些用于分辨关键机制、减少不确定性。后者即使没有产生可推进的候选,也可能帮助团队调整方向。因此,评价不能只统计"成功实验"的数量,还需要解释实验获得了什么信息。
实验选择与反馈还存在样本边界。只有被选中的候选接受了验证,其结果不能自动代表全部生成候选。未测试的方案也不能直接标记为失败。模型与团队在跨轮学习时,需要明确哪些判断来自观察,哪些仍然只是预测。
由此可见,科学 AI 的生产率包含两类改善:更有效地发现值得推进的方案,以及用更少资源减少重要的不确定性。企业和研究机构应根据项目目标,分别检验这两类作用。
八、数据与知识协调:为什么实验记录会成为重要资产
报告把科学数据列为战略资产,并讨论了数据合作、自动化实验数据生成及联邦学习等方式。1,第 33 页 但数据的数量,需要与质量和适用性一起评价。
同一项测量,往往依赖样本、批次、设备、处理方法和环境条件。若只有最后一个数值,模型可能难以区分候选性质与实验条件的影响。完整记录能够帮助研究者判断结果为何出现,以及是否可以重复。
失败与负结果也具有知识价值。它们可以揭示不适用的区域、被否定的假设和需要改进的实验方式。若数据系统只保留最好的结果,模型和团队可能持续得到不完整的反馈。
这还涉及人类专家与 AI 之间的知识协调。模型提供的是基于数据与计算形成的判断,专家还会考虑既有理论、实验经验、设备条件和项目目标。团队需要把这些信息转化为实验选择依据,并让验证结果能够更新原有判断。
报告因此强调,组织需要将专有数据、实验诀窍、领域知识和验证惯例编码进科学工作流。1,第 32 页 这样的建设,可以减少知识在不同人员、软件与设备之间传递时的损失。
不过,编码不应抹去不确定性。一个研究假设、一个模型预测和一次实测结果,具有不同证据地位。数据系统应保留它们的来源、版本与适用条件,让后续使用者能够判断。
联邦学习等合作方式,可以降低共同建模时集中转移原始数据的需求。1,第 33 页 它们仍需要处理数据定义、质量、访问控制与结果评价。采用一种共享架构,并不自动解决所有研究协作问题。
本文据此认为,科学 AI 的长期优势可能来自可持续使用的知识资产:经过整理的实验数据、可复用的验证流程,以及能够解释结果的领域经验。模型更新可以较快发生,这些资产往往需要在长期研究中积累。
九、组织与经济性:把 AI 能力放进完整研发体系
报告的人才数据提供了一个有启发性的观察。在相关岗位中,82% 要求计算生物学,74% 要求机器学习;按其识别口径,两类技能的人才供给需求比分别约为 4.6 和 4.3。报告同时指出,能兼具领域科学与技术能力的人更难找到。1,第 35 页
这些统计主要基于英语国家的岗位与人才数据,不能直接作为某个地区的供需判断。1,第 3 页 但它们提醒我们,单项技能具备供给,并不代表跨学科协作已经顺畅。
科学 AI 团队需要协调问题定义、建模、实验执行、数据管理与结果验证。若模型团队主要优化基准成绩,实验团队主要追求设备利用率,而项目负责人关注下一阶段开发,局部目标就可能偏离共同研究目标。
因此,组织应围绕具体研发任务设置责任与评价。什么证据足以推进,什么时候需要重复实验,哪些结果要求调整方向,应当能够被参与人员理解并执行。
人类专家的作用也会随工作方式调整。部分资料整理、计算和实验操作可以由系统承担;研究者仍需要判断问题是否值得研究、模型假设是否合理,以及证据能支持什么结论。这些工作可以得到 AI 协助,但其质量仍然需要评价。
经济性需要覆盖完整投入。科学 AI 可能减少部分计算或实验工作,同时增加数据清理、自动化设备、系统接入、模型运行和质量管理成本。单次预测更便宜,并不直接说明项目总成本已经下降。
可以把项目效果区分为两类:一类是在可比任务中节省资源,另一类是让此前难以开展的探索成为可能。前者适合比较完整成本与时间;后者需要评价新增探索是否产生有用的证据和后续选择。
报告列出的下游约束尤其重要。临床研究、制造放大与其他现实验证,可能限制发现进入市场的速度。1,第 36 页 AI 提高了前端产出,组织就需要判断后续承接能力是否匹配,避免大量候选堆积而无法形成有效进展。
十、如何评价麦肯锡的判断,并检验未来发展
这份报告的贡献,在于把科学模型、科研工作流、实验自动化和成果转化放进同一套讨论。它描述了新的能力组合,也明确保留了可靠性、可重复性、数据、实验接入、经济规模与下游转化等不确定性。1,第 36---37 页
本文认为,其方向性判断具有较强解释力:AI 正在改变科研中的搜索、计算、选择和反馈方式。不过,某项计算任务的表现、一个实验案例的改善、资本投入和完整研发生产率,仍需要分别衡量。
未来一至两年,可以重点检验以下四个判断。这些判断属于本文分析,不是麦肯锡已经证实的结论。
第一,竞争将更重视模型与实验之间的有效连接。 具备模型能力的组织,需要进一步证明候选能够进入验证,结果能够改善下一轮研究。可以观察固定资源条件下的证据产出、实验周转与跨轮选择质量是否改善。
第二,可合成性、可验证性和可放大性将更早进入设计目标。 研究团队可能更主动地把实际约束纳入候选生成与筛选。可以观察计算表现与真实实验结果之间的差距是否缩小,以及进入后续阶段的成果是否更稳定。
第三,工程 AI 的应用将围绕明确任务边界逐步扩展。 具有充分数据、明确物理条件和成熟验证方式的任务,更适合持续积累可信使用经验。可以观察模型进入新工况后的误差、假设透明度,以及高保真计算和实物测试的配合情况。
第四,数据、实验基础设施与下游开发能力之间的合作会更重要。 模型能力、实验条件、行业经验和产业化资源往往分布在不同组织。可以观察合作能否形成持续反馈,并通过实际成果与完整成本证明价值,而非只看协议金额和融资规模。
这四个判断共同指向一个更具体的问题:科学 AI 能否让组织在相同或合理增加的资源投入下,持续获得更多可靠知识,并据此作出更好的研发决策?
结语
科学 AI 扩大了研究者能够探索的方案空间,也提供了连接计算、实验与反馈的新方式。它可以改善候选提出、计算筛选、实验组织和研究迭代,具体作用需要在相应任务与条件下检验。
麦肯锡这一章揭示的核心,是发现能力与验证能力之间的配合。候选越容易生成,实验选择、测量质量、证据解释和后续开发就越需要受到重视。
本文的判断是,持续的研发优势将来自模型、专家、实验系统和数据之间有效的知识协调。能够让可靠证据不断改进下一轮研究的组织,更有机会把 AI 能力转化为可重复的科学进展与长期应用价值。
参考资料与口径说明
本文主要依据用户提供的麦肯锡 2026 年 9 月版报告,解读第 3 项技术趋势,正文第 28---37 页,并结合第 3 页研究方法。页码指报告印刷页码,对应 PDF 文件页序第 30---39 页和第 5 页。补充资料用于核对模型任务、科研案例与验证范围,核对日期为 2026 年 10 月 3 日。
文中的假设场景、实验预算示例、能力分类、评价框架与未来判断属于作者分析。临床案例按所引用论文的研究范围讨论,不将历史论文作为药物当前完整开发状态。自动化实验案例按引用的预印本版本解读。
-
McKinsey & Company. Technology Trends Outlook 2026. September 2026, sixth edition. "AI for scientific discovery and engineering", pp. 28--37; research methodology, p. 3. 本文主要依据用户提供的 PDF。
-
Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature, 596, 583--589, 2021. 用于明确蛋白质结构预测的任务范围。
-
MIT Jameel Clinic / Boltz-2 team. Boltz-2 --- Towards Accurate and Efficient Binding Affinity Prediction. June 6, 2025. 研究团队的机构说明,用于核对结构与结合亲和力预测的能力定位。
-
Arc Institute. AI can now model and design the genetic code for all domains of life with Evo 2. February 19, 2025. 用于区分基因组序列模型与蛋白质结构模型。
-
Xu, Z., et al. A generative AI-discovered TNIK inhibitor for idiopathic pulmonary fibrosis: a randomized phase 2a trial. Nature Medicine, 31, 2602--2610, 2025. 用于核对 rentosertib 的这一项早期临床研究及其证据边界。
-
Berkeley Lab. How AI and Automation are Speeding Up Science and Discovery. September 4, 2025. 用于理解 A-Lab 中模型与实验自动化的结合方式。
-
Park, D., Moon, H., & Ryu, S. A self-correcting multi-agent LLM framework for language-based physics simulation and explanation. npj Artificial Intelligence, 2, Article 10, January 20, 2026. 用于核对 MCP-SIM 的组织方式与基准范围。
-
Smith, A. A., et al. Using a GPT-5-driven autonomous lab to optimize the cost and titer of cell-free protein synthesis. 2026 年 2 月公布的预印本;同时核对了研究团队提供的全文。用于区分特定反应配方成本的改善与整体研发收益。