摘要
人工智能虚拟细胞(AIVC)被设想为1类科学智能体,可模拟细胞应答、解释内在机理并支撑假说驱动的科学发现。但现有的AIVC基准测试主要聚焦仿真层,因此亟需1套可以评估模型解读实验证据、生成生物学假说能力的配套评测体系。本文提出OMNIVCBENCH,以图为核心、来源可溯源的基准数据集,专门用于评测AIVC的解读能力组件。该数据集包含6,077条经过人工筛选的单/多子图问答对,全部源自科技文献中的图表与实验背景。 本文依据布鲁姆教育目标分类学,围绕AIVC「预测‑解释‑发现(Predict‑Explain‑Discover)」范式,搭建解读层的3层科学推理任务:L1基于证据开展条件化推理、L2机理解释、L3基于证据提出科学假说。进一步提出AIVC‑Judge,面向任务条件的大模型裁判框架,配备分任务类别、参考感知式评分细则,用于评估开放式模型输出。 同时提出模型生成式负例挖掘(MDHNM)策略,将模型推理过程中产生的合理错误转化为选择题干扰项,实现低成本评测。在本研究测试的多组异构模型中,选择题准确率与AIVC‑Judge打分呈正相关,可与开放式回答评测形成互补视角。 对闭源与开源多模态模型开展评测表明,即便是性能最优的闭源模型,在AIVC‑Judge下满分5分仅取得3.28分。在辅助数据集OMNIVCTRAIN上开展监督微调、检索增强生成,性能可获得适度提升,提升幅度取决于具体配置。 综上,OMNIVCBENCH整合与原始文献对齐的细胞图表、围绕「预测‑解释‑发现」范式组织解读任务,同时配套开放式问答与可控选择题2套评测方案;是套来源可溯源的资源,用于评估候选AIVC解读组件基于证据的推理能力。
https://anonymous.4open.science/r/OmniVCBench
#OMNIVCBENCH #人工智能虚拟细胞 #多模态科学推理 #文献图表理解 #证据驱动推理 #负例挖掘 #基准测试
引言

图1 AIVC工作流中的解读组件
仿真层生成虚拟细胞与扰动细胞;实验输出观测结果;解读层(OMNIVCBENCH评测对象)基于证据开展推理,输出生物学洞见;之后进入AIVC优化循环,更新假说。OMNIVCBENCH仅评测高亮标记的解读组件,包含L1‑L3三项科学推理任务;其余阶段属于应用上下文。
解读层3类任务:
L1基于证据的条件化推理:观测到了哪些变化?
L2机理解释:这些变化因何发生?
L3基于证据提出假说:从证据可以推导出哪些可供检验的科学假说?
相关工作
表1 近年虚拟细胞与科学图表类基准测试汇总
对比各基准数据集规模、评测内容、所处层级(仿真层/解读层)

方法
开放式问答生成

图2 数据集构建与双轨评测流水线
从OmniScience文献源过滤得到候选记录,生成问答对,经过质量控制得到OMNIVCBENCH数据集,支持开放式评测(AIVC‑Judge裁判打分)与选择题评测(MDHNM挖掘得到干扰项);粗粒度问答样例形成OMNIVCTRAIN,用于监督微调SFT与多模态检索增强RAG。
AIVC‑Judge裁判模型

图3 AIVC‑Judge裁判工作机制
输入结构化内容(问题、模型回答、原始图表图像、参考证据);将回答拆解为原子级论断,每条论断判定:证据支持、证据矛盾、证据不足无法核验;再按照L1/L2/L3分层维度打分;输出各维度分数、总体分数、论断‑证据溯源追踪记录。
L1打分维度:正确性、证据支撑度
L2打分维度:忠实度、因果完备性、机理粒度、证据一致性
L3打分维度:判断正确性、论证质量、证据权衡。
实验
实验设置
表2 OMNIVCBENCH配对评测结果
选择题准确率(%,左侧)与AIVC‑Judge打分(1‑5分,右侧)
分为闭源模型、开源模型;†代表基于 OMNIVCTRAIN训练得到的16号秩、2轮SFT微调版本;统计全部问答样本的汇总指标

基于OMNIVCTRAIN开展模型适配

图4 评测一致性与模型适配增益
(a) 11个模型的选择题平均准确率与AIVC‑Judge总体得分相关性;
(b) Qwen3‑VL‑8B在L1/L2/L3不同任务层级下,基线、全语料SFT、高秩子集SFT、多模态RAG的性能对比;
(c) 各主流闭源模型L3任务的分项维度得分轮廓。
表3 Qwen3‑VL‑8B在选择题任务上的适配实验结果
记录基线、不同SFT、RAG配置下准确率变化Δ,以及置换检验P值

详细总结

思维导图
现有AIVC基准对比

3层任务L1‑L2‑L3
对齐Predict‑Explain‑Discover工作流、Bloom认知分类

整套数据集资源构成

评测工具AIVC‑Judge

多模型基准结果
节选

基于OMNIVCTRAIN的适配实验
Qwen3‑VL‑8B

闭环证据获取试点实验
4套模拟AIVC闭环

参考
OmniVCBench: Benchmarking Evidence-Grounded Multimodal Reasoning Towards AI Virtual Cells
https://arxiv.org/abs/2609.37773
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。