Anthropic模型36小时突破46年数学进展,同日三家前沿模型上新:当AI抽象智能逼近极限,“表现力“为什么仍是结构性空白

Anthropic模型36小时突破46年数学进展,同日三家前沿模型上新:当AI抽象智能逼近极限,"表现力"为什么仍是结构性空白

2026年8月12日到13日,AI行业经历了极为密集的48小时。

一边是Anthropic宣布,一款尚未公开发布的内部模型在36小时内将黎曼猜想的零点下界从41.6%提升至67.2%------这个数字意味着,AI在一天半里超越了人类数学家46年在这一子问题上的累积进展。另一边,DeepSeek、阿里巴巴和xAI在同一天发布了三款前沿大模型,参数规模从1.6万亿到2.4万亿不等,定价从0.43美元到2美元每百万token,性能差距却在个位数之内。

抽象智能正在以周为单位刷新天花板,但一个看似更"简单"的问题------让AI像真人一样自然地说话、表情同步、情绪到位------却依然是整个行业的结构性空白。

一、"Models Day":三家前沿模型同日上新,能力趋同比降价更值得关注

8月12日,DeepSeek V4 Pro正式版悄然上线API文档。这是一款1.6万亿总参数、490亿活跃参数的MoE架构模型,上下文窗口达到100万token,定价为每百万token 0.435美元(输入)/0.87美元(输出),并以MIT协议开放了权重下载。

同一天,阿里巴巴发布了Qwen3.8-2.4T-A95B的开放权重版本。这是阿里首次将Max级旗舰模型对外开放,总参数量超过2.4万亿。不过需要注意的是,开放权重版本并不包含视觉能力和100万上下文窗口------这些能力仍然保留在托管的Qwen3.8-Max API中。

xAI在同一天发布了Grok 4.6,这是一个增量更新版本,在Artificial Analysis Intelligence Index上的得分与GPT-5.6 Sol持平,均为61分,仅比Claude Opus 5的63分低2分。

三家模型、三种架构、三种商业模式,但性能曲线已经高度收敛。有开发者在Hacker News上做了一个对比测试:用同样的编程任务通过Codex CLI分别调用DeepSeek V4 Pro和Grok 4.6,前者耗时12分钟、花费0.12美元,但输出代码带有一个bug;后者耗时3分钟、花费1.41美元,输出代码无bug。

这个测试结果很有代表性:DeepSeek便宜了约10倍,但速度和稳定性有差距;Grok更快、更省token,但价格明显更高。Qwen3.8在理论能力上可能最强,但4.9TB的BF16权重让普通开发者几乎无法本地部署------即便Unsloth已经推出了1-bit量化版本(397GB),对硬件的要求仍然远超个人玩家的承受范围。

当模型的"智商"差距缩小到个位数,竞争维度正在不可避免地转移。开源权重和API定价只是前奏,真正的分水岭将出现在"这些模型被用来做什么"以及"它们以什么形态出现在用户面前"。

二、36小时、60个子智能体、650次失败:AI攻克数学世纪难题的范式启示

与三家模型同日发布的喧嚣相比,Anthropic的黎曼猜想实验更像是投下了一枚深水炸弹。

黎曼猜想由德国数学家波恩哈德·黎曼于1859年提出,是数学史上最重要的未解难题之一,克雷数学研究所为此悬赏100万美元。该猜想的核心命题关乎素数分布的规律性------所有非平凡零点都位于复平面上的一条特定直线上(临界线)。一个关键的子问题是:到底有多大比例的零点可以证明位于这条线上?此前数学家们花了46年时间,将下界从0%逐步提升至41.6%。

Anthropic的实验由一个不具备深厚数学背景的员工发起。他向未发布的Claude模型发出指令:"认真尝试证明黎曼猜想。"随后他基本退后,只是偶尔发几条鼓励消息------"不要放弃""相信你自己"。

在接下来的36小时里,模型展开了惊人的自主探索:它测试了650种不同的解题思路,协调了约60个子智能体分工协作,执行了2400次shell命令,编写了数百个Python脚本进行数值验证。这些子智能体的分工包括:2个负责开发核心数学思路,13个提供辅助性想法,30个尝试开发新思路但未能成功,13个承担验证者角色,最后2个协助撰写论文初稿。

最终,模型并未证明黎曼猜想------Anthropic也明确表示不预期现有技术能导向完整证明。但它发现了一个关键的突破口:将几位数学家(Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh)的近期成果与Bombieri的经典思路结合起来,构建了一种新的二次型方法,将零点下界从41.6%一举提升至67.2%。

这个结果已经过Anthropic内部数学家Levent Alpöge和Ralph Furman的审核,外部专家Brian Conrey和Dan Goldston也参与了评估。模型还通过Lean证明助手生成了形式化验证版本,通过了标准验证工具的检查。

不过,这里需要保持清醒。67.2%不等于"完成了67.2%的证明"------它仅仅意味着"至少67.2%的非平凡零点是简单的且位于临界线上",这是一个技术性子问题的进展,距离100%的完整证明仍然遥远。而且,Anthropic既没有公开模型版本,也没有公开完整的运行过程记录,外部研究者无法独立复现或验证AI到底"想"了什么。Lean证明是存在的,但产生它的"思考过程"仍然是一个黑箱。

即便如此,这个实验释放的信号是明确的:前沿AI系统已经能够作为自主探索型协作者,整合现有研究、计算探索和形式化验证,产出可能具有原创性的数学结果。菲尔兹奖得主、剑桥大学教授蒂莫西·高尔斯在回应声明时提出了一个富有洞察力的类比:"如果我们最终进入一个数学定理不再与特定数学家相关联的世界,或许这并不会比恒星不再以天文学家的名字命名更具问题性。"

三、抽象智能与表现智能:两个世界的速度差

把数学突破和同日模型发布放在一起看,一个有趣的不对称浮现出来:AI在抽象推理、符号运算、形式化证明这些人类花费数百年才积累起来的领域,正在以"小时"为单位取得进展;但在另一套能力上------自然对话时的微表情变化、说话时的口型同步、情绪表达时的面部肌肉协调------它的进步曲线却相当平缓。

这不是因为后者"更简单"。恰恰相反,数学证明有一个明确的评判标准:对就是对,错就是错。但"表现力"没有单一的对错标准。同一句话,在不同的文化语境、不同的社交关系、不同的镜头角度下,最佳的表达方式是截然不同的。一个微笑在东亚职场可能是礼貌,在欧美创业圈可能是自信,在纪录片采访里可能是掩饰------这些微妙的区分依赖于语境、文化和实时互动,而非单纯的参数规模或token计算。

更重要的是,数学问题可以分解为子任务(60个子智能体各司其职),但"表演"是一个不可分割的整体。声音、口型、表情、眼神、肢体语言必须在同一个时间切片内高度一致,任何一部分的延迟或错位都会立刻被人类感知系统捕捉。这种"联合一致性"要求的是端到端的联合生成,而非先分别生成画面和音频再进行拼接的级联式架构。

当前主流的视频生成和数字人方案大多采用级联式架构:先由文本生成视频画面,再由独立的语音模型生成旁白或对白,最后通过口型同步算法将两者对齐。这种架构在工业流水线中被反复验证------成本低、模块化好、易于调优。但它的本质问题是:每一层都在优化自己的局部目标,而全局目标("这个人看起来是否在真正说话")没有人负责。

相比之下,联合生成架构试图将声音、表情、口型放在同一个优化目标下同时生成。这意味着模型需要同时理解语言学(说什么)、语音学(怎么说)、面部解剖学(肌肉怎么动)和表演理论(情绪怎么传递)。这种跨模态的联合建模,在数据和架构层面都比单一模态任务复杂得多,但它指向的方向更贴近人类感知的真实标准。

四、Agent生态爆发:从"能做什么"到"看起来怎么样"

8月12日的AI新闻不止于模型发布。同一天,xAI推出了Grok Bot,一个可以登录用户应用、在云端桌面运行多步任务、随时间学习用户工作流的"AI同事"。Cognition(Devin的母公司)被报道正在以400亿美元估值进行新一轮融资------距离上一轮260亿美元的估值仅过去三个月。微软的Agent Plugins 1.0也在这一天宣布全量可用,接入Copilot生态。

Agent赛道的集体爆发,本质上是在回答一个问题:当模型的底层能力已经趋同,竞争的下一个维度是什么?

答案是"前台体验"。Grok Bot、Devin、Copilot Agent Plugins,这些产品之间的差异并不在底层模型的智商(它们很可能调用的是类似的API),而在于交互形态、任务编排能力、用户信任感和"在场感"。一个Agent能否让用户觉得它"真的在理解我",而不是"在执行一个脚本",取决于它如何呈现自己的思考过程、如何表达不确定性、如何在多轮对话中保持人格一致性。

这些要求最终都指向同一个技术缺口:表现力。当Agent需要向用户展示它正在"思考"、"犹豫"或"兴奋"时,它需要的不是文本输出,而是可信的多模态表达。文本Agent可以用打字动画来模拟"思考中",但视频Agent、数字人Agent、虚拟助手Agent则需要真实的表情、口型和声调变化来传递同样的信息。

这也解释了为什么Cognition能在三个月内估值从260亿跳到400亿------市场已经意识到,在模型能力趋于平权的时代,率先构建出"可信前台体验"的公司将获得巨大的产品溢价。但"可信前台体验"的底层技术------声形戏一体化的联合生成------仍然是一个开放的工程难题。

五、当"智商批发"成为常态,产业竞争正在换赛道

回顾8月12日到13日的这一系列事件,可以梳理出一条清晰的产业逻辑:

模型能力的收敛速度远超预期。三家前沿模型在24小时内同台竞技,性能差距缩小到个位数,而价格差距却达到10倍。这种"智商批发"的景观意味着,拥有最好模型的公司不再自动拥有最好的产品。模型的竞争正在从"训练阶段"转向"部署阶段",从"能回答什么"转向"怎么呈现答案"。

与此同时,AI在抽象世界的突破(黎曼猜想的下界提升)与在日常世界的笨拙(多模态表现力的滞后)形成了强烈反差。前者需要的是符号推理和形式化验证,后者需要的是跨模态联合建模和端到端优化。这两种能力的发展曲线并不天然同步,事实上,它们在训练数据、架构设计和评估标准上都是完全不同的赛道。

Agent生态的爆发正在加速这种分化。Agent不需要比人类更聪明,它需要比人类更可信、更自然、更"像人"。当Agent进入客服、教育、医疗、娱乐这些高接触场景时,"表现力"不是锦上添花,而是准入门槛。一个客服Agent如果说话口型对不上、表情僵硬、声音没有情绪变化,用户会在几秒钟内失去信任------无论它背后的模型能解多复杂的数学题。

在国内,已经有少数团队开始沿着声形戏一体化的方向进行探索。这些尝试的核心不是追求更大的参数规模,而是重新设计多模态生成的目标函数------把"听起来自然""看起来可信""情绪传达到位"作为联合优化的目标,而不是分别优化语音清晰度和画面清晰度。这条路线的技术难度很高,但它指向的需求是真实的,而且正在变得越来越紧迫。

结语:从"能力竞赛"到"可信度竞赛"

8月12日,AI同时触碰了数学的深渊和产业的表面。Anthropic的模型在36小时里超越了46年的人类数学积累,DeepSeek、阿里和xAI在同一天把前沿模型的性能差距压缩到个位数。这些进展共同说明一件事:AI的"智商"正在以不可阻挡的速度趋同和廉价化。

但智商的平权不等于体验的平权。当Agent成为人机交互的主要界面,当视频内容的生产和消费越来越依赖AI生成,"表现力"------那种让AI看起来像是在真正思考、真正感受、真正对话的综合素质------正在成为新的稀缺变量。它不是参数竞赛的产物,而是架构设计和跨模态理解的产物。

产业的下一章,可能不是谁训练出了最大的模型,而是谁最先让AI在与人打交道时,不再像一个精通数学但不懂微笑的优等生。

相关推荐
fthux2 小时前
不必下载整个仓库:GitZip Pro 让 GitHub 文件与文件夹批量下载更简单
前端·chrome·ai·edge·开源·github·firefox
knqiufan2 小时前
DeepSeek Harness 插件玩法第一步:先把项目上下文装进去
agent·oceanbase·powercontext
九里九里2 小时前
内容加密,代码可运行:ailatch——AI 时代安全锁
ai·代码加密·ai安全
dozenyaoyida2 小时前
AI与大模型新闻日报 | 2026-08-13
人工智能·ai·大模型·新闻
艾德克斯2 小时前
从OCP APAC Summit 2026看AI数据中心供电架构演进与测试挑战
人工智能·ai·架构·数据中心·开闭原则·供电测试
HIT_Weston3 小时前
173、【Agent】【OpenCode】TuiThreadCmd(cmd工厂)
人工智能·agent·opencode
盗理者3 小时前
AI Agent 技能分享|从零实现一个 MCP Server,让 AI Agent 安全调用内部系统
网络·人工智能·安全·agent
爆写加倍3 小时前
2026年3款视频转文字软件测评技术升级让转写整理更准更省心
人工智能·ai