Embedded Evaluation 会成为 Frontier AI Safety 的新范式吗?

北京时间 2026 年 9 月 19 日 04:05,Anthropic 宣布与 Accenture 建立 Embedded Evaluation 合作机制。
摘要
Anthropic 与 Accenture 宣布建立 Embedded Evaluation(嵌入式评测) 合作机制:由 Accenture 旗下专业 AI 团队 Faculty 进入 Anthropic 内部,与其研发和安全团队并行工作,对前沿模型开展 Evaluation、Red Teaming、Alignment Assessment 和 Safeguard Testing。
双方预计未来五年分别投入至少 10 亿美元 ,合计至少 20 亿美元 用于建设相关能力。
与传统"模型训练完成之后,再交给第三方做外部测试"不同,Embedded Evaluation 希望让独立评测者更早进入模型研发流程,观察模型如何训练、如何部署以及安全决策如何形成。
这意味着前沿模型评测正在从 Post-hoc Evaluation(事后评测) ,逐步向 Continuous Evaluation(持续评测) 演化。
1. Anthropic 和 Accenture 到底要做什么?
Anthropic 与 Accenture 计划共同建立一支:
Embedded Evaluators
也就是:
直接进入前沿 AI 实验室内部工作的独立评测团队。
该合作由 Accenture 旗下专业 AI 公司 Faculty 主导。
主要工作包括:
| 工作内容 | 具体目标 |
|---|---|
| 模型评测(Model Evaluation) | 系统评估前沿模型能力与风险 |
| 红队测试(Red Teaming) | 主动寻找模型和系统中的高风险行为 |
| 对齐评估(Alignment Assessment) | 判断模型行为是否符合设计目标与安全约束 |
| 安全防护测试(Safeguard Testing) | 测试模型安全防护机制是否真正有效 |
| 事件分析(Incident Analysis) | 分析异常模型行为与安全事件 |
| 安全承诺核验(Safety Commitment Verification) | 检查实验室是否真正履行既定安全承诺 |
Anthropic 与 Accenture 表示:
双方预计未来五年分别投入至少 10 亿美元,用于建设这类 AI Safety Evaluation 能力。
也就是说:
总投资额 ≥ 20 亿美元 \text{总投资额} \geq 20\text{ 亿美元} 总投资额≥20 亿美元
时间跨度:
研发时间 ≥ 5 年 研发时间 \geq 5\text{年} 研发时间≥5年
2. Embedded Evaluation 和传统第三方评测有什么不同?
传统 AI 第三方评测通常发生在模型已经基本完成之后。
例如:
text
Model Training
↓
Model Finished
↓
API / Checkpoint
↓
External Evaluator
↓
Safety Benchmark
↓
Report
这种模式本质上属于:
Post-hoc Evaluation
即:
text
模型做完了
↓
再来检查
而 Anthropic 希望建立的 Embedded Evaluation 更接近:
text
Model Development
│
┌──────────┼──────────┐
↓ ↓ ↓
Training Evals Deployment
│ │ │
└──────────┼──────────┘
↓
Embedded Evaluator
↓
Continuous Observation
↓
Feedback / Audit / Reporting
也就是说,评测者不只看:
text
Final Model
而是开始观察:
text
How the model is trained
How safety decisions are made
How safeguards are implemented
How deployment decisions are made
4. 关键变化:评测者开始拥有"接近员工级别"的访问权限
这次合作最重要的一句话是:
Embedded evaluators will work inside AI companies, with access comparable to an employee's.
也就是说,这些评测人员可能拥有:
text
Employee-comparable Access
而不是传统第三方研究机构通常获得的:
text
Black-box API Access
两者差异非常大。
| 维度 | 传统外部评测 | Embedded Evaluation |
|---|---|---|
| 介入时间 | 模型基本完成后 | 模型研发过程中 |
| 访问方式 | API / 部分 Checkpoint | 接近员工级访问 |
| 观察对象 | 最终模型 | 模型 + 训练流程 + 安全流程 |
| 是否可观察中间模型 | 通常不能 | 有可能 |
| 是否了解研发决策 | 很有限 | 更深入 |
| 是否持续参与 | 通常一次性 | 持续评测 |
| 能否检查内部安全承诺 | 有限 | 设计目标之一 |
| 能否发现流程级风险 | 较难 | 更有可能 |
因此,Embedded Evaluation 真正改变的是:
AI Evaluation 的观察窗口。
5. 从"评测模型"到"评测实验室"
传统安全评测的问题通常是:
这个模型危险吗?
例如:
text
Can it hack?
Can it deceive?
Can it replicate?
Can it build biological weapons?
Can it evade monitoring?
但 Embedded Evaluation 进一步提出:
开发这个模型的组织,其安全流程是否可靠?
于是评测对象从:
text
Model
逐渐扩展为:
text
Model
+
Training Process
+
Deployment Process
+
Safety Governance
+
Incident Handling
可以表示为:
A I S a f e t y ≠ M o d e l S a f e t y AI\ Safety \neq Model\ Safety AI Safety=Model Safety
而更接近:
A I S a f e t y = M o d e l + I n f r a s t r u c t u r e + P r o c e s s + G o v e r n a n c e + O v e r s i g h t AI\ Safety =Model + Infrastructure + Process + Governance + Oversight AI Safety=Model+Infrastructure+Process+Governance+Oversight
6. 为什么现在开始强调 Embedded Evaluation?
因为前沿 AI 正在从:
text
Chatbot
演化成:
text
Tool-using Agent
↓
Long-horizon Agent
↓
AI R&D Agent
↓
AI building better AI
当模型开始参与:
- 模型训练;
- Evaluation 开发;
- GPU Kernel 优化;
- 数据处理;
- Coding;
- Cybersecurity;
- AI Research;
传统的:
text
训练完成后再评测
可能越来越不够。
因为真正的风险可能发生在:
text
Training
Fine-tuning
RL
Agent Rollout
Evaluation
Infrastructure
Deployment
中的任意阶段。
因此评测机制也必须从:
text
Snapshot Evaluation
升级到:
text
Continuous Evaluation
7. Embedded Evaluator 的独立性怎么样?
这是此次合作最值得讨论的问题之一。
Anthropic 把这套机制描述为:
Independent Embedded Evaluation
但与此同时,Anthropic 也明确表示:
当前 Accenture 的工作将由 Anthropic 直接出资。
因此存在一个天然的问题:
text
Anthropic
↓
Funding
↓
Accenture / Faculty
↓
Evaluate Anthropic
于是:
谁付钱给 Evaluator?
就成为 Independent Evaluation 无法回避的问题。
当前模式
text
Frontier Lab
↓
Funding
↓
Independent Evaluator
↓
Evaluate Frontier Lab
潜在问题包括:
text
Conflict of Interest
Commercial Dependency
Reporting Pressure
Access Dependency
Long-term Contract Incentives
8. Anthropic 承认:目前还没有成熟标准
Anthropic 明确表示,目前 Embedded Evaluation 至少有三个关键问题尚未解决。
① Evaluator 应该看到什么?
例如:
text
Model Weights?
Training Data?
RL Traces?
Chain-of-thought?
Incident Logs?
Safety Decisions?
Internal Slack?
Deployment Metrics?
如果权限太少:
text
Evaluator 看不到关键问题
如果权限太大,就会导致
text
IP / Security / Privacy Risk
② Evaluator 应该向谁报告?
可能存在:
text
Evaluator
↓
Anthropic
也可能:
text
Evaluator
↓
Public Report
甚至:
text
Evaluator
↓
Government / Regulator
不同报告路径,会直接决定 evaluator 的模型角色:
Evaluator 到底是"顾问"还是"审计者"。
③ 谁来付钱?
Anthropic 表示,从长期来看,更理想的方式可能是:
text
Pooled Funding
或者:
text
Government Funding
而不是:
text
被评测实验室直接付钱
原因很简单:
真正独立的 Evaluation,最终需要独立的 Funding Structure。
9. 一个可能的未来框架
成熟的 Frontier AI Evaluation 体系可能逐步演化为:
text
Frontier AI Lab
│
┌───────────────┼───────────────┐
↓ ↓ ↓
Internal Safety Embedded Eval External Eval
│ │ │
└───────────────┼───────────────┘
↓
Shared Standards
↓
Independent Reporting
↓
Public / Regulator
也就是说:
未来可能不会只有一个 Evaluator。
而是多个组织同时存在:
text
Internal Safety Team
+
Commercial Embedded Evaluator
+
Non-profit Evaluator
+
Academic Researchers
+
Government Auditors
形成:
Evaluator Ecosystem
10. Anthropic 寻求的其他方面帮助
Anthropic 同时表示:
正在与 METR 等非营利评测机构讨论 Embedded Evaluation 的试点合作。
并且 Anthropic × Accenture 的合作:
text
Non-exclusive
也就是说:
Anthropic 未来不会只使用 Accenture 一个 Evaluator。
Accenture 同样可以:
text
Evaluate Other AI Labs
如果这一模式推广,未来可能出现一种类似:
text
AI Safety Auditing Industry
的专业领域。
11. 这和传统软件安全审计有哪些相似性
传统 Cybersecurity 中已经存在:
text
Internal Security Team
+
External Penetration Testing
+
Independent Audit
+
Compliance Audit
+
Red Team
AI Safety 未来可能形成类似结构:
text
Internal Alignment Team
+
External Evaluation
+
Embedded Evaluator
+
Red Team
+
Government Oversight
因此 Embedded Evaluation 很可能是:
AI Safety 从研究问题逐步走向制度化安全工程的一部分。
12. AI Evaluation 比传统审计更难
传统软件审计往往可以检查:
text
Code
Configuration
Network
Permissions
Logs
但 Frontier AI 的问题更加复杂。
因为模型能力并不是完全静态的。
例如:
text
Same Model
+
Different Prompt
+
Different Tool
+
Different Context
+
Different Scaffold
=
Different Behavior
甚至:
text
Model Capability
可能随着:
text
Tool Access
Inference Compute
Memory
Agent Architecture
增加而出现新的行为。
因此真正要评估的不是:
text
Static Artifact
而更像:
text
Dynamic AI System
13. Embedded Evaluation 对 Agent Safety 的重要性分析
对于普通 Chatbot:
text
Input
↓
Model
↓
Text Output
风险相对局限。
但 Agent:
text
Goal
↓
Reasoning
↓
Tool
↓
Action
↓
Observation
↓
Memory
↓
More Actions
↓
...
因此风险存在于:
text
Entire Trajectory
而不是单次输出。
可以把 Agent 风险表示成:
R a g e n t = f ( M , T , E , P , H ) R_{agent} =f( M, T, E, P, H ) Ragent=f(M,T,E,P,H)
其中:
- (M):Model Capability;
- (T):Tool Access;
- (E):Environment;
- (P):Permissions;
- (H):Execution Horizon。
这也是为什么未来 Evaluator 很可能需要:
观察整个 Agent System,而不只是测试单个 Model Endpoint。
14. 从 Post-hoc Evaluation 到 Continuous Evaluation
这次合作最核心的范式变化,可以浓缩成下面这张表:
| 阶段 | Evaluation 范式 |
|---|---|
| 传统 ML | Benchmark |
| Frontier LLM | Safety Eval |
| Agent | Trajectory Evaluation |
| Frontier Lab | Continuous Embedded Evaluation |
演化路径:
text
Benchmark
↓
External Evaluation
↓
Red Teaming
↓
Embedded Evaluation
↓
Continuous AI Audit
最终评测的问题可能从:
"这个模型能力有多强?"
变成:
"这套 AI 系统从训练、部署到实际运行,是否始终处于可控和可验证的安全边界内?"
P.S. Post-hoc Evaluation 可以翻译为 "事后评测" 或 "事后评估"。它指的是:模型或系统基本完成训练之后,再对最终模型进行能力、安全性、可靠性等方面的评估,而不是在整个训练过程中持续介入。
典型流程是:
text模型训练 ↓ 模型基本定型 ↓ 提供模型 / API / Checkpoint ↓ 开展 Evaluation ↓ 发现能力与风险 ↓ 形成评测报告在大模型领域,Post-hoc Evaluation 通常包括:
评测内容 主要检查什么 Capability Evaluation 推理、数学、代码、Agent 等能力 Safety Evaluation 是否生成危险、有害或违规内容 Alignment Evaluation 模型行为是否符合预期目标和约束 Red Teaming 主动寻找模型的安全漏洞和异常行为 Robustness Evaluation 面对异常输入、攻击或分布变化是否稳定 Dangerous Capability Evaluation 网络攻击、生物安全、自主行动等高风险能力
总结
Anthropic × Accenture 的合作最重要的并不是:
"双方要投入 20 亿美元。"
真正值得关注的是:
前沿 AI 的安全评测开始尝试从实验室外部,直接进入模型研发流程内部。
传统模式:
text
Build Model
↓
Release Model
↓
Evaluate Model
正在尝试变成:
text
Build Model
↕
Evaluate Continuously
↕
Red Team
↕
Audit
↓
Deploy Model
也就是说:
Evaluation 正在从一个研发完成后的步骤,逐渐变成 Frontier AI Development 本身的一部分。
随着 AI Agent 开始拥有更强的:
text
Reasoning
Tool Use
Memory
Autonomy
Cyber Capability
AI R&D Capability
仅仅依赖:
text
Internal Safety Team
可能越来越不足。
未来真正成熟的 Frontier AI Safety 体系,很可能需要:
text
Internal Safety
+
Embedded Evaluation
+
Independent External Evaluation
+
Public Reporting
+
Regulatory Oversight
共同组成一套:
Continuous AI Safety Audit System
如果这一模式能够建立统一标准并解决 Funding、Access 和 Independence 三个核心问题,那么 Embedded Evaluation 很可能成为未来前沿 AI 实验室安全治理的重要基础设施。
参考资料
-
Anthropic 官方公告
-
Accenture 官方公告
Accenture and Anthropic Partner to Build Team of Embedded Evaluators at Anthropic
-
Reuters
Anthropic, Accenture to invest $2 billion in AI model evaluation as safety concerns rise