背景
限制性内切酶、Taq 聚合酶、CRISPR------生物学史上这些里程碑式的发现,都源于研究者在海量序列数据中识别出"不寻常的东西"。2026 年春,Anthropic 组建生命科学研究团队,探索通用 AI 模型能否系统化并加速这类发现过程。团队不仅训练 Claude 理解生物学知识,还在湾区建立了真实的分子生物学实验室,开展 BSL-1 和 BSL-2 级别的湿实验室工作,全部实验操作由人类科学家完成,不涉及可感染人类的病原体。团队成员此前的研究方向涵盖 CRISPR 系统的进化与调控、细胞和基因疗法用新型酶的发现,以及 DNA 异常检测工具开发,是 Anthropic 更大生命科学组织的一部分。
核心原理
典型工作流程是:Claude 阅读相关文献,在公开数据上复现已知结果以验证方法,然后搜寻不属于任何已知系统的家族成员或基因组邻近序列,为每个候选者生成人类可读报告,并在后续阶段批判性评估证据、淘汰大多数候选。
在发现 ART 的任务中,科学家给 Claude 的初始提示是:在大规模 DNA 序列数据库中搜索有趣的新型逆转录酶(RT)。此后科学家不再深度介入,约 950 个 Claude 智能体并行运作,共消耗约 2.1 亿个 token,历时 21 小时。智能体从超过 20 万条 RT 序列中筛选出 3500 个候选系统,进一步缩减至 20 个最具价值的候选并生成对应报告------这项工作若由人类专家独立完成,通常需要数周至数月。
其中一个智能体在扫描某 RT 基因附近的原始 DNA 序列时,注意到一个此前无人报告的串联重复阵列,在分析日志中写道:"RT 旁边的 DNA 太壮观了:我用肉眼就能看出一个串联重复阵列......这是一个类 CRISPR 的重复阵列?!"随后该智能体统计重复单元数量、测量间距、与已知 RT 系统进行布局比对、检索文献确认无先例,最终提交报告供人类审核。
ART 系统由三部分组成:逆转录酶本身、其旁边的一个伴侣基因,以及一段由均匀间隔的 DNA 重复序列构成的长阵列,主要存在于噬菌体中。该 RT 的基础序列此前已在一种超大噬菌体研究中被识别,但其伴随的重复阵列和功能未知的附属蛋白,是 Claude 首次注意到的。所有具有这类特征组合的已知系统,均具备可编程性,并能执行 DNA 的切割、复制或粘贴操作。
局限
ART 系统的主要生物学功能目前尚不明确,研究工作仍在进行中。文章以预印本形式发布,尚未经过同行评审。
智能体完成的是计算分析和假设生成部分,全部实验室验证工作由人类科学家承担。团队坦承 AI 不适合实验室中临时应变的湿实验室操作流程。由于 Claude 能大量产出候选报告,团队目前正在研究什么特征使某个候选值得进入实验室验证阶段,并将这些判断反馈给 Claude 以使其学习研究者的科学品味------当前筛选标准在很大程度上仍依赖人类专家的主观判断,自动化评估标准尚在建立中。
对开发者的意义
ART 的发现揭示了一种可复用的 AI 辅助科学研究模式。
任务分解与并行化。 此次任务的核心是将"在海量数据中识别异常模式"拆解为可并行的子任务,并为每个子任务设计结构化输出格式。约 950 个智能体并行处理了一个需要数月人工的分析流程,对需要处理大规模非结构化数据的系统有直接参考价值。
反馈回路的设计。 团队通过分析"哪些候选被选中、哪些被淘汰"来改进给 Claude 的指令,将领域专家判断转化为可迭代的提示策略。这适用于任何需要在大量候选中进行专业筛选的场景。
人机协作的边界划定。 该案例清晰展示了一种分工模式:AI 负责大规模搜索、模式识别和假设生成,人类负责初始任务定义、候选审核和实验室验证。明确划定这条边界比追求完全自动化更务实。
这项工作表明,通用大语言模型在配备适当工具和任务框架后,有能力在专业科学领域产出人类专家层面的发现线索,是科研辅助、知识发现或大规模数据分析系统开发者值得深入研究的真实案例。