AppenTalk | 当AI推理不再只是模型的事:Dan Roth谈智能体的真正边界

Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与"推理"的形式意义之间存在根本区别。

推理与生成:一条严格的界线

Roth对推理的定义极窄:一个推理问题,必须存在可以通过形式系统推导或证明的答案。 在此定义下,仅靠LLM无法解决所有类型的推理问题,但一个AI系统可以。

区别在于: LLM可理解问题、将其转化为合适表征,并将计算委托给求解器(solver),应被理解为完整系统的能力,而非模型本身的属性。这要求提问方式从**"这个模型能推理吗?"** 转向**"这个系统能可靠判断何时需推理、调用正确机制并验证结果吗?"**

推理问题必须有一个能通过形式系统推导或证明的答案。

------Oracle首席AI科学家 Dan Roth

从模型到系统:智能体的架构演进

**当前AI智能体正将模型与外围架构分离。**架构可包含模型、工具、检索系统、专用求解器、规划机制、内存、权限和编排层(orchestration layer)。

Roth指出:有些问题需要LLM不具备的计算能力;不同任务需不同上下文;隐私和治理要求可能限制信息访问。即便上下文窗口不断扩大,把一切塞入单一上下文也无法造就最强系统。因此,核心问题不仅是底层模型能力,更是责任如何在系统组件间分布。

检索为何是难题

当AI需要的信息不在模型权重内,检索便至关重要。**Roth认为检索困难在于:用户表达信息需求的方式,与信息在数据源中的呈现方式常常不一致。**企业数据加剧了问题:表格名称复杂、重要信息分散且可能相互矛盾等等。

一种方法是语义增强(semantic enrichment) :在运行时前向数据添加描述、摘要、元数据,使检索系统拥有更优表征。这引出了关键的系统设计问题:哪些工作应离线准备,哪些应由智能体在运行时执行?

评估的转向:从模型到编排层

**在对谈中,Roth提出"失败可见性"的问题:**若模型答错已知答案的问题,失败是显而易见的;但若智能体执行诸如财务分析、多系统查询等用户无法独立验证的信息,同样的失败可能根本不可见。

这要求系统不仅依赖离线基准测试,还需运行时监控(runtime monitoring)与验证。**随着智能体系统纳入更多组件,仅评估最终模型输出已不足以揭示成败原因:**路由决策、工具选择、检索、上下文构建、模型选择、验证等环节都是至关重要的。智能体评估正逐步转向对编排层本身的评估。

相关推荐
EchoMind-Henry38 分钟前
Muse外设两条接入路,成本该怎么算
人工智能·ai
Zootopia62643 分钟前
飞行力学知识梳理1|飞行性能与稳定性
人工智能·python·算法·机器学习·无人机·学习方法·信息与通信
阿部多瑞 ABU2 小时前
空能指的再生产:一个符号政治经济学的分析框架
人工智能·ai写作
xx_xxxxx_2 小时前
论文阅读-SAR
人工智能·深度学习·机器学习
桃西西呀2 小时前
LangChain 之七:回调与可观测
人工智能·langchain·llm
2601_960356382 小时前
2027校招采购岗解析:数学基础如何迁移到需求预测、成本与供应商分析
人工智能·算法
桃西西呀2 小时前
LangChain 之六:记忆与历史
人工智能·langchain·llm
周杰伦fans2 小时前
8GB显存下模型量化实战指南
人工智能·后端·c#
秦先生在广东2 小时前
gstack 深度解析:AI 驱动的单人虚拟工程团队与端到端自动化
人工智能
Yyyyyy~2 小时前
【Anaconda】安装
人工智能·python