AppenTalk | 当AI推理不再只是模型的事:Dan Roth谈智能体的真正边界

Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与"推理"的形式意义之间存在根本区别。

推理与生成:一条严格的界线

Roth对推理的定义极窄:一个推理问题,必须存在可以通过形式系统推导或证明的答案。 在此定义下,仅靠LLM无法解决所有类型的推理问题,但一个AI系统可以。

区别在于: LLM可理解问题、将其转化为合适表征,并将计算委托给求解器(solver),应被理解为完整系统的能力,而非模型本身的属性。这要求提问方式从**"这个模型能推理吗?"** 转向**"这个系统能可靠判断何时需推理、调用正确机制并验证结果吗?"**

推理问题必须有一个能通过形式系统推导或证明的答案。

------Oracle首席AI科学家 Dan Roth

从模型到系统:智能体的架构演进

**当前AI智能体正将模型与外围架构分离。**架构可包含模型、工具、检索系统、专用求解器、规划机制、内存、权限和编排层(orchestration layer)。

Roth指出:有些问题需要LLM不具备的计算能力;不同任务需不同上下文;隐私和治理要求可能限制信息访问。即便上下文窗口不断扩大,把一切塞入单一上下文也无法造就最强系统。因此,核心问题不仅是底层模型能力,更是责任如何在系统组件间分布。

检索为何是难题

当AI需要的信息不在模型权重内,检索便至关重要。**Roth认为检索困难在于:用户表达信息需求的方式,与信息在数据源中的呈现方式常常不一致。**企业数据加剧了问题:表格名称复杂、重要信息分散且可能相互矛盾等等。

一种方法是语义增强(semantic enrichment) :在运行时前向数据添加描述、摘要、元数据,使检索系统拥有更优表征。这引出了关键的系统设计问题:哪些工作应离线准备,哪些应由智能体在运行时执行?

评估的转向:从模型到编排层

**在对谈中,Roth提出"失败可见性"的问题:**若模型答错已知答案的问题,失败是显而易见的;但若智能体执行诸如财务分析、多系统查询等用户无法独立验证的信息,同样的失败可能根本不可见。

这要求系统不仅依赖离线基准测试,还需运行时监控(runtime monitoring)与验证。**随着智能体系统纳入更多组件,仅评估最终模型输出已不足以揭示成败原因:**路由决策、工具选择、检索、上下文构建、模型选择、验证等环节都是至关重要的。智能体评估正逐步转向对编排层本身的评估。

相关推荐
Mr数据杨1 小时前
二手车价格预测实战解析 从 Kaggle 回归赛题到可落地估价方案
人工智能·数据分析·kaggle竞赛
Zzj_tju1 小时前
Embodied Agent 小环境:用状态日志解释成功、绕路与超时
人工智能·深度学习·机器学习·自然语言处理
微财经观圈2 小时前
AI 3D生成角色怎样套用预设动作?自动绑骨与动作测试步骤
人工智能·3d
是翎2 小时前
图解大语言模型部署
人工智能·驱动开发·深度学习·开源协议·imagen
joinwell522 小时前
写了“始终审批”,AI 为什么还是执行了?
人工智能
腾渊信息科技公司2 小时前
腾渊科技重磅出品——智能体交易信任架构实战:从KYA到可追溯审计的完整方案
人工智能·科技·aiagent·腾渊科技·腾渊信息科技
知几蜗牛2 小时前
AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层
人工智能
CIO_Alliance2 小时前
AI微调系列(2)| QLoRA:一张卡微调700亿参数,显存是怎么省下来的
大数据·人工智能·深度学习·ai·企业ai转型·企业cio联盟
段一凡-华北理工大学2 小时前
高炉智能布料技术与炉料分布优化~系列文章14:布料制度与送风制度的协同匹配
人工智能·高炉布料·高炉料面·布料制度·送风制度