摘要
系统性消融实验对于定位AI虚拟细胞模型的性能增益来源至关重要;但这类消融实验很少落地执行,原因在于生物领域代码库标准化程度不足,并且与领域专用数据、格式强耦合。现有的代码智能体可以把研究想法转化为代码,但大多止步于生成代码,缺少验证器,无法复现可靠基线,也不能严谨测试究竟哪些组件真正决定模型性能。本文提出1款面向虚拟细胞代码库的Reproduce‑then‑Ablate(先复现‑后消融)智能体AblateCell,填补上述验证环节的空白。AblateCell首先端到端复现已报道的基线结果:自动配置运行环境、解决依赖与数据问题、重新执行官方评估流程,同时输出可核验的产物文件。之后开展闭环消融实验:生成隔离式代码库变更图,在兼顾性能影响与执行开销的奖励函数驱动下自适应筛选待执行实验。在3套单细胞扰动预测代码库(CPA、GEARS、BioLORD)上完成评测:AblateCell端到端工作流成功率达88.9%(相比人类专家提升29.9个百分点);恢复真实关键组件的准确率达93.3%(相比启发式基线提升53.3个百分点)。该成果支持直接在生物学代码库上开展规模化、基于原始代码库的验证与归因分析。
#虚拟细胞 #消融实验 #智能体AI #可复现性 #单细胞扰动预测 #代码库自动验证 #模型组件归因
引言

图1 AblateCell设计动机
现有AI智能体可以规模化生成研究想法,但无法完成想法归因。自动化消融实验填补这一缺口,系统地验证到底哪些组件真正起到关键作用。
左侧流程:想法生成→编码实现→得到研究结果;
关键问题:AI智能体可以自动合成想法,但归因分析是瓶颈,究竟哪些组件才真正发挥作用?之后执行消融研究,得到验证后的结论。
右侧对比:现有AI智能体:环境冲突、依赖兜底回退机制、缺少全流程自动化。
本文AblateCell:可验证复现、闭环消融实验、自主归因;实现完整端到端的「先复现‑后消融」研究流程。
系统设计
规划器‑执行器解耦架构

图2 AblateCell整体系统架构
AblateCell由2大核心模块构成:规划器模块、执行器模块。
规划器(Planner):解析代码仓库,抽取API、配置、数据集路径;查询领域知识库,生成结构化执行指令。
执行器(Executor):包含代码智能体,在Docker容器内完成调试、基线复现;输出复现完成的基线,交付下游消融模块。消融子模块接收复现完成的基线,执行基于图的自适应消融采样,输出消融指标与分析报告。全部运行在容器隔离环境,保障可复现性。
表1 规划器提取仓库元信息的主要类别
规划器从目标代码仓库脚本、配置文件中自动解析得到的信息类别,用于生成执行指令。

代码智能体
表2 代码智能体处理的典型故障类型与处理策略
代码智能体在Docker容器中迭代调试,处理复现基线过程中常见错误。

基于图的自适应采样消融实验
算法1 带动态上置信界UCB的自适应消融研究


图3 AblateCell整体评测结果
AblateCell可以稳定实现很高的端到端TSR(任务成功率)。规划器‑执行器分离架构在复现阶段可靠定位程序入口点、解决依赖问题;基于图的编排机制稳健处理消融过程中各类代码变更;隔离工作树保证全部实验互相干净隔离。对比基线智能体框架,基线容易出现:① 任务理解漂移;② 过度依赖通用兜底策略;③ 执行幻觉;④ 缺少结构化规划,只能反复试错。移除消融相关模块会同时损害执行可靠性与假设质量,TSR下降18.7%,Acc@5下降23.3%;系统失去对组件语义的领域理解,只能盲目探索,产生大量无效假设。

图4 AblateCell在CPA、GEARS、BioLORD三个测试仓库上的消融实验汇总
展示各模型不同组件移除后性能指标(MSE、皮尔逊相关系数)的变化幅度,量化各组件对模型性能贡献大小。
表3 AblateCell在3套虚拟细胞仓库上的整体评测指标
对比AblateCell、人类专家、启发式基线;指标包含端到端任务成功率TSR、识别真实关键组件Acc@k;括号内为相对于对比基线的提升幅度。

详细总结

思维导图
内部多智能体分工

测试AIVC目标仓库
单细胞扰动预测模型

主要实验结果

参考
AblateCell: A Reproduce‑then‑Ablate Agent for Virtual Cell Repositories
https://arxiv.org/abs/2604.19606
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。