让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。------这是来自《我的世界》最经典的开局。

此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:"黄昏、有怪物,面临威胁。"

我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么?

为了深入探索,美团 LongCat 团队构建了MineExplorer ------首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。

MineExplorer 核心看点:

  • 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。
  • 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。
  • 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。

01 MineExplorer设计解密:让AI离开温室,走向动态世界

MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。

1.1 创新设计:构建一个动态开放的世界

创新点一:构建一个具备完整物理规则、会动态演化的世界

MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。

创新点二:隐藏前置条件的长程多跳任务

这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量:

  • 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。
  • 困难任务 :由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。

我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。

创新点三:知识解耦------我们测的是「通用探索」,不是「背 Minecraft Wiki」

这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI 会不会玩 Minecraft」,而是「AI 能不能在一个动态物理世界里自主探索」。

1.2 构建方法:一套可复用的多智能体数据合成范式

构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序:

整个流程分初始化和辩论(debate)两个阶段,先生成初稿,再由专家和验证器找出问题并修订。

下表所示,人工评估结果显示,多智能体流程把有效率拉高了约 30 个百分点,质量分提升约 0.5 分,在最难的4-hop任务上优势尤其明显。最终,我们保留了 813 个通过人工验证的高质量复合任务实例。

1.3 能力覆盖:MineExplorer 到底在测什么?

MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:

  • 感知(Perception): 空间、时序、实体、状态、资源。
  • 推理(Reasoning): 常识、因果、关系。
  • 行动(Action): 移动、跳跃、采集、放置、合成、攻击。

如图所示,最终的基准在三大维度上都有充足的覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。

02 核心洞察:18款顶级大模型测试,为何集体"考砸"了?

MineExplorer不仅定义了考题,更给出了18个顶级模型的真实分数。如下表所示,这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率(TSR)上的排行榜。

我们发现,即便是表现最好的 Claude-Opus-4.6,整体成功率也只有 41 分。

| 洞察一:单跳尚可,多跳崩盘------问题就在隐藏前置条件

如图所示,最强模型Claude-Opus-4.6的表现,从1跳任务的77分,一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖,模型就掉一个台阶。

| 洞察二:会看,但不会想 ------ 感知强于推理

在几乎所有被测模型上,我们都观察到同一个规律:感知分数 > 行动分数 > 推理分数。如下图所示,以Claude-Opus-4.6为例,其整体感知分61.91,推理分54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。

| 洞察三:近60%的失败原因,都是因为走不到目标

我们对 Claude-Opus-4.6 的失败案例进行了归因分析。如下图所示,导航失败是最大的错误来源,占比近 60%。

| 洞察四:给它更多步数、更多记忆,都不是解药

我们进一步做了消融实验,发现模型失败并非因为资源不足。

  • **步数:**如图所示,能解的任务,模型在早期就解出来了;解不了的,给到 1800 步上限照样解不了。
  • **记忆:**如图所示,增加历史画面帧数到一定程度后,性能反而会下降,因为过期的观察会干扰对当前局面的判断。

核心结论:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。

03 总结:从看见世界到探索世界的鸿沟

MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型,已经具备了不错的感知力,但严重缺乏在动态世界中持续行动的探索力。

这对正在快速升温的具身智能赛道有几个直接的启示:

  • 感知层基本就绪,规划层是瓶颈。 模型能看懂环境,但把感知转化成长程、含隐藏前置的行动计划,才是从能看到能做之间真正的鸿沟。
  • 行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令,不足以宣布AI能行动了。真实世界是动态的,充满未说明的前置条件,需要持续、长久化的探索。
  • 我们不仅提供了评测,还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库,它还带着一整套自动合成长程任务的流程,和一个能直接拿来训练的Minecraft环境。评测、造题、训练,用的是同一套基础设施。

我们不是要给具身智能泼冷水。恰恰相反,把瓶颈定位清楚,比盲目乐观更有价值。MineExplorer提供的,正是这样一条诚实、可量化的能力基线。

看得见世界,不代表能探索世界。在一个会变化的世界里持续推理、持续行动------这才是AI走向真实世界,必须先跨过的那道门槛。MineExplorer 已全面开源,欢迎各大模型前来挑战开放世界。

🚀 开源链接

| 关注「美团技术团队」微信公众号(meituantech)或访问: tech.meituan.com/ ,阅读更多技术干货!>

| 本文系美团技术团队出品,著作权归属美团。欢迎出于分享和交流等非商业目的转载或使用本文内容,敬请注明"内容转载自美团技术团队"。本文未经许可,不得进行商业性转载或者使用。任何商用行为,请发送邮件至 tech@meituan.com 申请授权。

相关推荐
Litluecat1 小时前
2026年7月23日科技热点新闻
人工智能·科技·新闻·每日·速览
美团技术团队1 小时前
下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知
人工智能
武子康1 小时前
Token 单价更低,Agent 任务为什么反而更贵:4 层成本口径 + 最小事件账本 + 3 个决策问题
人工智能·agent·ai编程
叫我Paul就好2 小时前
RAG 入门到精通 - 构建评估系统
人工智能·rag
学术小李2 小时前
基于Pytorch,如何用CUDA自己写算子?(一)
人工智能·pytorch·python
九硕智慧建筑一体化厂家2 小时前
直流照明降损节能,智慧路灯点亮智慧城市脉络
人工智能·智慧城市
秦先生在广东2 小时前
Block Buzz:用 Nostr 协议把 AI Agent 变成真正的队友,而非自动化幽灵
人工智能
观测云2 小时前
观测云基于 AI Agent Teams 能力的场景实践
人工智能
小程故事多_802 小时前
算力工厂与安全沙箱,企业AI规模化落地的两条核心生命线
人工智能·安全