Qwen3.8-Max 模型亮点

是阿里巴巴于 2026年8月3日 正式发布的新一代基座大模型。作为千问系列中规模最大、性能最强的旗舰版本,本次更新在模型架构、核心能力以及商业生态上均实现了显著突破。以下是本次更新的核心亮点及对应的测试指标数据:

一、 本次核心更新亮点

1. 架构与参数规模跃升

模型基于 Qwen3.5 架构构建,采用前沿的稀疏混合专家(MoE)架构与混合注意力机制。总参数量突破 2.4 万亿(2.4T),但在实际推理时仅激活 950 亿(95B)参数。这种创新设计使模型推理效率提升 30%,推理速度加快 25%,在保持顶尖性能的同时有效控制了计算成本。

2. 支持原生多模态与超长上下文

Qwen3.8-Max 首次支持视觉理解功能,实现了多模态视觉生产力(涵盖教育解题、视频理解与三维创作等)。同时,上下文处理长度扩展至 1M Tokens,大幅提升了长文本处理与复杂多轮对话的连贯性。

3. 长周期自主编程与办公能力突破

模型的能力重心向长周期自主任务倾斜。在编程方面,实现了从零自主开发完整项目的突破,可基于空文件夹自动完成持续十余天的真实项目开发,全程无需人工干预。在专业办公方面,通过真实环境与算力的联合强化训练,模型在法律咨询、金融分析、文档处理等 200 余种高频专业任务中表现出色,能稳定输出符合生产标准的成果。

4. Max 级别模型首次开源

与历代 Max 级模型仅通过 API 提供服务不同,官方宣布 Qwen3.8-Max 将于下周正式开放源代码(权重在 Hugging Face 和 ModelScope 发布),同期还将开源 270 亿参数的 Qwen3.8-27B 版本。

二、 核心测试指标与基准测试数据

根据官方自测及第三方权威榜单数据,Qwen3.8-Max 在多项核心指标上表现优异:

1. 第三方权威榜单排名

  • Text Arena(文本综合评测):综合性能跻身全球顶尖行列,排名第五,仅次于 Anthropic 的 Claude 系列。
  • Vision Arena(视觉评测):排名全球第二。
  • Frontend Code Arena(前端代码评测):排名全球第四。
  • Artificial Analysis Agentic Index(智能体能力):以 55.4 分位列全球第一,超越 Claude Opus5 和 GPT5.6,首次为中国模型拿下该榜单冠军。

2. 核心基准测试(Benchmark)得分

  • PaperBench(科研复现/论文能力) :得分 93.0,较上代大幅提升 28.2 分,超越 Anthropic Fable 5(88.8)和 GPT-5.6 Sol(90.5)。
  • IFBench(指令遵循) :得分 82.8,大幅领先 Fable 5(63.5)。
  • OSWorld-Verified(智能体电脑操作能力) :得分 86.1,位居主流模型首位,超越 Fable 5(85.0)。
  • GPQA Diamond(科学推理) :取得 92.6 分。
  • BabyVision(视觉推理) :在无工具条件下取得 82.0 分,超出部分主流模型近两倍。
  • CoWorkBench(通用协作) :得分 74.8,与 Fable 5(75.9)差距极小。
  • WideSearch(通用智能体评测) :得分 81.9

3. 部分工程实现基准(存在差距)

  • SWE-bench Pro(真实软件工程) :得分 67.7,低于 Claude Fable 5 的 80.0。
  • Terminal Bench 2.1 :得分 86.6,低于 GPT-5.6 Sol 的 88.8。

4. 长周期任务实战指标

  • 自主编程 :在完全无人工干预的环境下独立运行约 16 天 ,留下 265 次 commit 与 127 个 PR,产出名为"oh-my-cli"的自进化智能体框架。
  • 科研复现 :连续工作约 125 小时 、编写约 7,600 行 代码、完成 33 轮 GPU 训练,先复现目标论文结论,再经四轮探索取得高于原方法 2.71 分的结果。
  • 芯片设计优化 :在芯片设计沙箱内历经约 500 轮交互,将硬件门数由 8,298 门精简至 678 门。

三、 API 定价与商业化更新

Qwen3.8-Max 的 API 服务已同步登陆千问AI平台。国内市场定价为每百万 Tokens 输入 12 元 ,输出 36 元 ,隐式缓存命中价格低至 1.5 元。国际市场定价极具竞争力,输入与输出价格分别仅为 Opus5 的 40% 和 24%,在保持相近智能水平的同时提供了更高的性价比。

相关推荐
lifallen2 小时前
Emdash 拆解:多 Agent 并行开发桌面端的实现思路,兼谈 ACP 与 A2A
人工智能·学习·ai·ai编程
BBsays2 小时前
AI 数字人合规安全完全手册(2026年8月最新版)
人工智能
AI服务老曹2 小时前
NVIDIA GPU部署AI视频分析常见问题和排查清单
人工智能·音视频
深圳市快瞳科技有限公司3 小时前
个体识别、行为解读、健康管理:多模态宠物AI大模型的场景化落地
人工智能·算法·计算机视觉·大模型·多模态·宠物·宠物ai识别
安逸sgr3 小时前
AI 编程工具在真实项目中适合做什么?不适合做什么?
人工智能·ai·大模型·agent·智能体
stevenzqzq3 小时前
opencode设置项
人工智能
liulilittle3 小时前
归一化:激活函数
人工智能·算法·机器学习·llm
fthux3 小时前
装闭 RenoPit 源码解析(02):AI装修闭坑系统数据库与模型设计
人工智能·ai·开源·github·open source·renopit
2601_956456343 小时前
AI巡检机器人实战评测:3款室外产品算法自研能力与真实场景表现横评(2026)
大数据·人工智能·机器人
mtouch3333 小时前
全球水面海面动态仿真规划生成数字沙盘电子沙盘系统
人工智能·机器人·无人机·虚拟现实·电子沙盘·数字沙盘