9.19 大语言模型研究简报:Anthropic × Accenture 把“第三方评测者”直接嵌入前沿模型研发流程

Embedded Evaluation 会成为 Frontier AI Safety 的新范式吗?

北京时间 2026 年 9 月 19 日 04:05,Anthropic 宣布与 Accenture 建立 Embedded Evaluation 合作机制。


摘要

Anthropic 与 Accenture 宣布建立 Embedded Evaluation(嵌入式评测) 合作机制:由 Accenture 旗下专业 AI 团队 Faculty 进入 Anthropic 内部,与其研发和安全团队并行工作,对前沿模型开展 Evaluation、Red Teaming、Alignment Assessment 和 Safeguard Testing。

双方预计未来五年分别投入至少 10 亿美元 ,合计至少 20 亿美元 用于建设相关能力。

与传统"模型训练完成之后,再交给第三方做外部测试"不同,Embedded Evaluation 希望让独立评测者更早进入模型研发流程,观察模型如何训练、如何部署以及安全决策如何形成。

这意味着前沿模型评测正在从 Post-hoc Evaluation(事后评测) ,逐步向 Continuous Evaluation(持续评测) 演化。


1. Anthropic 和 Accenture 到底要做什么?

Anthropic 与 Accenture 计划共同建立一支:

Embedded Evaluators

也就是:

直接进入前沿 AI 实验室内部工作的独立评测团队。

该合作由 Accenture 旗下专业 AI 公司 Faculty 主导。

主要工作包括:

工作内容 具体目标
模型评测(Model Evaluation) 系统评估前沿模型能力与风险
红队测试(Red Teaming) 主动寻找模型和系统中的高风险行为
对齐评估(Alignment Assessment) 判断模型行为是否符合设计目标与安全约束
安全防护测试(Safeguard Testing) 测试模型安全防护机制是否真正有效
事件分析(Incident Analysis) 分析异常模型行为与安全事件
安全承诺核验(Safety Commitment Verification) 检查实验室是否真正履行既定安全承诺

Anthropic 与 Accenture 表示:

双方预计未来五年分别投入至少 10 亿美元,用于建设这类 AI Safety Evaluation 能力。

也就是说:

总投资额 ≥ 20 亿美元 \text{总投资额} \geq 20\text{ 亿美元} 总投资额≥20 亿美元

时间跨度:

研发时间 ≥ 5 年 研发时间 \geq 5\text{年} 研发时间≥5年


2. Embedded Evaluation 和传统第三方评测有什么不同?

传统 AI 第三方评测通常发生在模型已经基本完成之后。

例如:

text 复制代码
Model Training
      ↓
Model Finished
      ↓
API / Checkpoint
      ↓
External Evaluator
      ↓
Safety Benchmark
      ↓
Report

这种模式本质上属于:

Post-hoc Evaluation

即:

text 复制代码
模型做完了
    ↓
再来检查

而 Anthropic 希望建立的 Embedded Evaluation 更接近:

text 复制代码
            Model Development
                   │
        ┌──────────┼──────────┐
        ↓          ↓          ↓
     Training    Evals     Deployment
        │          │          │
        └──────────┼──────────┘
                   ↓
          Embedded Evaluator
                   ↓
       Continuous Observation
                   ↓
     Feedback / Audit / Reporting

也就是说,评测者不只看:

text 复制代码
Final Model

而是开始观察:

text 复制代码
How the model is trained
How safety decisions are made
How safeguards are implemented
How deployment decisions are made

4. 关键变化:评测者开始拥有"接近员工级别"的访问权限

这次合作最重要的一句话是:

Embedded evaluators will work inside AI companies, with access comparable to an employee's.

也就是说,这些评测人员可能拥有:

text 复制代码
Employee-comparable Access

而不是传统第三方研究机构通常获得的:

text 复制代码
Black-box API Access

两者差异非常大。

维度 传统外部评测 Embedded Evaluation
介入时间 模型基本完成后 模型研发过程中
访问方式 API / 部分 Checkpoint 接近员工级访问
观察对象 最终模型 模型 + 训练流程 + 安全流程
是否可观察中间模型 通常不能 有可能
是否了解研发决策 很有限 更深入
是否持续参与 通常一次性 持续评测
能否检查内部安全承诺 有限 设计目标之一
能否发现流程级风险 较难 更有可能

因此,Embedded Evaluation 真正改变的是:

AI Evaluation 的观察窗口。


5. 从"评测模型"到"评测实验室"

传统安全评测的问题通常是:

这个模型危险吗?

例如:

text 复制代码
Can it hack?
Can it deceive?
Can it replicate?
Can it build biological weapons?
Can it evade monitoring?

但 Embedded Evaluation 进一步提出:

开发这个模型的组织,其安全流程是否可靠?

于是评测对象从:

text 复制代码
Model

逐渐扩展为:

text 复制代码
Model
+
Training Process
+
Deployment Process
+
Safety Governance
+
Incident Handling

可以表示为:

A I S a f e t y ≠ M o d e l S a f e t y AI\ Safety \neq Model\ Safety AI Safety=Model Safety

而更接近:

A I S a f e t y = M o d e l + I n f r a s t r u c t u r e + P r o c e s s + G o v e r n a n c e + O v e r s i g h t AI\ Safety =Model + Infrastructure + Process + Governance + Oversight AI Safety=Model+Infrastructure+Process+Governance+Oversight


6. 为什么现在开始强调 Embedded Evaluation?

因为前沿 AI 正在从:

text 复制代码
Chatbot

演化成:

text 复制代码
Tool-using Agent
        ↓
Long-horizon Agent
        ↓
AI R&D Agent
        ↓
AI building better AI

当模型开始参与:

  • 模型训练;
  • Evaluation 开发;
  • GPU Kernel 优化;
  • 数据处理;
  • Coding;
  • Cybersecurity;
  • AI Research;

传统的:

text 复制代码
训练完成后再评测

可能越来越不够。

因为真正的风险可能发生在:

text 复制代码
Training
Fine-tuning
RL
Agent Rollout
Evaluation
Infrastructure
Deployment

中的任意阶段。

因此评测机制也必须从:

text 复制代码
Snapshot Evaluation

升级到:

text 复制代码
Continuous Evaluation

7. Embedded Evaluator 的独立性怎么样?

这是此次合作最值得讨论的问题之一。

Anthropic 把这套机制描述为:

Independent Embedded Evaluation

但与此同时,Anthropic 也明确表示:

当前 Accenture 的工作将由 Anthropic 直接出资。

因此存在一个天然的问题:

text 复制代码
Anthropic
    ↓
Funding
    ↓
Accenture / Faculty
    ↓
Evaluate Anthropic

于是:

谁付钱给 Evaluator?

就成为 Independent Evaluation 无法回避的问题。


当前模式

text 复制代码
Frontier Lab
      ↓
   Funding
      ↓
Independent Evaluator
      ↓
Evaluate Frontier Lab

潜在问题包括:

text 复制代码
Conflict of Interest
Commercial Dependency
Reporting Pressure
Access Dependency
Long-term Contract Incentives

8. Anthropic 承认:目前还没有成熟标准

Anthropic 明确表示,目前 Embedded Evaluation 至少有三个关键问题尚未解决。

① Evaluator 应该看到什么?

例如:

text 复制代码
Model Weights?
Training Data?
RL Traces?
Chain-of-thought?
Incident Logs?
Safety Decisions?
Internal Slack?
Deployment Metrics?

如果权限太少:

text 复制代码
Evaluator 看不到关键问题

如果权限太大,就会导致

text 复制代码
IP / Security / Privacy Risk

② Evaluator 应该向谁报告?

可能存在:

text 复制代码
Evaluator
   ↓
Anthropic

也可能:

text 复制代码
Evaluator
   ↓
Public Report

甚至:

text 复制代码
Evaluator
   ↓
Government / Regulator

不同报告路径,会直接决定 evaluator 的模型角色:

Evaluator 到底是"顾问"还是"审计者"。


③ 谁来付钱?

Anthropic 表示,从长期来看,更理想的方式可能是:

text 复制代码
Pooled Funding

或者:

text 复制代码
Government Funding

而不是:

text 复制代码
被评测实验室直接付钱

原因很简单:

真正独立的 Evaluation,最终需要独立的 Funding Structure。


9. 一个可能的未来框架

成熟的 Frontier AI Evaluation 体系可能逐步演化为:

text 复制代码
                  Frontier AI Lab
                        │
        ┌───────────────┼───────────────┐
        ↓               ↓               ↓
 Internal Safety   Embedded Eval   External Eval
        │               │               │
        └───────────────┼───────────────┘
                        ↓
                  Shared Standards
                        ↓
               Independent Reporting
                        ↓
                 Public / Regulator

也就是说:

未来可能不会只有一个 Evaluator。

而是多个组织同时存在:

text 复制代码
Internal Safety Team
+
Commercial Embedded Evaluator
+
Non-profit Evaluator
+
Academic Researchers
+
Government Auditors

形成:

Evaluator Ecosystem


10. Anthropic 寻求的其他方面帮助

Anthropic 同时表示:

正在与 METR 等非营利评测机构讨论 Embedded Evaluation 的试点合作。

并且 Anthropic × Accenture 的合作:

text 复制代码
Non-exclusive

也就是说:

Anthropic 未来不会只使用 Accenture 一个 Evaluator。

Accenture 同样可以:

text 复制代码
Evaluate Other AI Labs

如果这一模式推广,未来可能出现一种类似:

text 复制代码
AI Safety Auditing Industry

的专业领域。


11. 这和传统软件安全审计有哪些相似性

传统 Cybersecurity 中已经存在:

text 复制代码
Internal Security Team
+
External Penetration Testing
+
Independent Audit
+
Compliance Audit
+
Red Team

AI Safety 未来可能形成类似结构:

text 复制代码
Internal Alignment Team
+
External Evaluation
+
Embedded Evaluator
+
Red Team
+
Government Oversight

因此 Embedded Evaluation 很可能是:

AI Safety 从研究问题逐步走向制度化安全工程的一部分。


12. AI Evaluation 比传统审计更难

传统软件审计往往可以检查:

text 复制代码
Code
Configuration
Network
Permissions
Logs

但 Frontier AI 的问题更加复杂。

因为模型能力并不是完全静态的。

例如:

text 复制代码
Same Model
+
Different Prompt
+
Different Tool
+
Different Context
+
Different Scaffold
=
Different Behavior

甚至:

text 复制代码
Model Capability

可能随着:

text 复制代码
Tool Access
Inference Compute
Memory
Agent Architecture

增加而出现新的行为。

因此真正要评估的不是:

text 复制代码
Static Artifact

而更像:

text 复制代码
Dynamic AI System

13. Embedded Evaluation 对 Agent Safety 的重要性分析

对于普通 Chatbot:

text 复制代码
Input
  ↓
Model
  ↓
Text Output

风险相对局限。

但 Agent:

text 复制代码
Goal
 ↓
Reasoning
 ↓
Tool
 ↓
Action
 ↓
Observation
 ↓
Memory
 ↓
More Actions
 ↓
...

因此风险存在于:

text 复制代码
Entire Trajectory

而不是单次输出。

可以把 Agent 风险表示成:

R a g e n t = f ( M , T , E , P , H ) R_{agent} =f( M, T, E, P, H ) Ragent=f(M,T,E,P,H)

其中:

  • (M):Model Capability;
  • (T):Tool Access;
  • (E):Environment;
  • (P):Permissions;
  • (H):Execution Horizon。

这也是为什么未来 Evaluator 很可能需要:

观察整个 Agent System,而不只是测试单个 Model Endpoint。


14. 从 Post-hoc Evaluation 到 Continuous Evaluation

这次合作最核心的范式变化,可以浓缩成下面这张表:

阶段 Evaluation 范式
传统 ML Benchmark
Frontier LLM Safety Eval
Agent Trajectory Evaluation
Frontier Lab Continuous Embedded Evaluation

演化路径:

text 复制代码
Benchmark
    ↓
External Evaluation
    ↓
Red Teaming
    ↓
Embedded Evaluation
    ↓
Continuous AI Audit

最终评测的问题可能从:

"这个模型能力有多强?"

变成:

"这套 AI 系统从训练、部署到实际运行,是否始终处于可控和可验证的安全边界内?"
P.S. Post-hoc Evaluation 可以翻译为 "事后评测" 或 "事后评估"。

它指的是:模型或系统基本完成训练之后,再对最终模型进行能力、安全性、可靠性等方面的评估,而不是在整个训练过程中持续介入。

典型流程是:

text 复制代码
模型训练
  ↓
模型基本定型
  ↓
提供模型 / API / Checkpoint
  ↓
开展 Evaluation
  ↓
发现能力与风险
  ↓
形成评测报告 

在大模型领域,Post-hoc Evaluation 通常包括:

评测内容 主要检查什么
Capability Evaluation 推理、数学、代码、Agent 等能力
Safety Evaluation 是否生成危险、有害或违规内容
Alignment Evaluation 模型行为是否符合预期目标和约束
Red Teaming 主动寻找模型的安全漏洞和异常行为
Robustness Evaluation 面对异常输入、攻击或分布变化是否稳定
Dangerous Capability Evaluation 网络攻击、生物安全、自主行动等高风险能力

总结

Anthropic × Accenture 的合作最重要的并不是:

"双方要投入 20 亿美元。"

真正值得关注的是:

前沿 AI 的安全评测开始尝试从实验室外部,直接进入模型研发流程内部。

传统模式:

text 复制代码
Build Model
    ↓
Release Model
    ↓
Evaluate Model

正在尝试变成:

text 复制代码
Build Model
    ↕
Evaluate Continuously
    ↕
Red Team
    ↕
Audit
    ↓
Deploy Model

也就是说:

Evaluation 正在从一个研发完成后的步骤,逐渐变成 Frontier AI Development 本身的一部分。

随着 AI Agent 开始拥有更强的:

text 复制代码
Reasoning
Tool Use
Memory
Autonomy
Cyber Capability
AI R&D Capability

仅仅依赖:

text 复制代码
Internal Safety Team

可能越来越不足。

未来真正成熟的 Frontier AI Safety 体系,很可能需要:

text 复制代码
Internal Safety
+
Embedded Evaluation
+
Independent External Evaluation
+
Public Reporting
+
Regulatory Oversight

共同组成一套:

Continuous AI Safety Audit System

如果这一模式能够建立统一标准并解决 Funding、Access 和 Independence 三个核心问题,那么 Embedded Evaluation 很可能成为未来前沿 AI 实验室安全治理的重要基础设施。


参考资料

  1. Anthropic 官方公告

    Partnering with Accenture on embedded evaluation

  2. Accenture 官方公告

    Accenture and Anthropic Partner to Build Team of Embedded Evaluators at Anthropic

  3. Reuters

    Anthropic, Accenture to invest $2 billion in AI model evaluation as safety concerns rise


相关推荐
Patrick在香港16 小时前
Python 抓 0.91 GB 香港法例:Agent 的进度该写进磁盘,不是写进上下文
爬虫·python·api·claude·香港
空 白II1 天前
9.17 大语言模型研究简报:openAI 公开模型失配报告框架
openai·大语言模型
ServBay2 天前
Claude 突然不偷懒了?实测抓包到的 Opus 5.2,成卷王了
aigc·ai编程·claude
plainGeekDev2 天前
Harness 从"建议"到"强制":CLAUDE.md 为什么不够,Hooks 才是底线
aigc·ai编程·claude
空 白II2 天前
9.17 大语言模型研究简报:Grok Build 引入正式 Agent 系统发布
大语言模型·grok build
FEF前端团队2 天前
03# Claude Code实战:终端里的逻辑引擎
前端·ai编程·claude
Patrick在香港3 天前
Claude Prompt 香港场景:公文里「今日」落在 6 个日历日上,「翌日」锚错了 5 天
python·自然语言处理·正则表达式·claude·数据清洗
Behavior3 天前
每天用 Claude Code 的人,常用指令都在这 100 条里
aigc·claude·vibecoding