评科研 LLM/Agent:从读论文抽检到 ERA 树搜索写可计分实证软件千笔-AIWritePaper · https://www.aiwritepaper.com「模型会不会做科学」很容易停在聊天印象:答对几道题、复述几段摘要。Google Research 在 ICTS 相关公开分享里强调另一条路:先评测模型在真实科研工作流上的缺口,再把算力花在可计分的实证软件迭代上。Nature 论文描述的 Empirical Research Assistance(ERA)把大模型提案与树搜索结合起来,在沙箱里执行候选代码、用明确指标打分,并在生物信息、流行病学预报等多个基准上报告专