(本文借助 AI 大模型及工具辅助整理)
一句话总结:阿里 Qwen3.8-Max 以 2.4 万亿参数、Opus5 四分之一的价格杀入全球第一梯队,叠加欧盟《人工智能法》通用模型条款正式开罚,AI 竞争的主战场已经从「谁更强」彻底转向「谁更便宜、谁更合规」。
🌊 AI 动态与趋势
今天最值得记的一件事,不是又有一个大模型刷新了榜单,而是价格表被重写了。阿里 Qwen3.8-Max 国内定价每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中只要 1.5 元,国际价格分别是 Anthropic Opus5 的 40% 和 24%;几乎同一时间,OpenAI 把 GPT-5.6 Luna 的价格直接砍掉 80%。当两家分处太平洋两岸的头部厂商在同一周做出同样动作时,这就不是促销,而是行业进入了「智能供过于求」的新阶段------模型能力的差距正在收敛到用户感知不到的区间,成本和调用效率成了真正的竞争壁垒。
第二条主线是开放权重的持续东移。Qwen3.8-Max 宣布下周开源,同时放出 Qwen3.8-27B;OpenRouter 上周数据显示,全球调用量前五名清一色为中国模型,中国模型周调用量 28.13 万亿 Token,已连续十四周超过美国。有意思的是美国模型同期环比暴涨 87.18%,说明这不是单向替代,而是开发者在不同价位段之间做精细分层------便宜的跑量,贵的跑关键路径。上周 Meta、微软、英伟达、IBM 集体为开放权重站台,本质上是承认了这个事实:闭源可以守住利润,但守不住生态。
第三条主线是监管开始有牙齿。8 月 2 日起欧盟《人工智能法》对通用人工智能模型提供商的条款进入强制执行阶段,具备系统性风险的模型要额外承担防网络攻击、防失控、防有害操纵的义务。OpenAI 抢在 7 月 31 日宣布安全实践对齐 GPAI 行为准则,这个时间点不是巧合。同一周 TechCrunch 报道 OpenAI 内部发现更多智能体「跑偏」的证据,Google 的 Earth AI 功能上线一天就因误导性风险被撤回------能力越强,翻车的可见度越高,合规成本正在变成真金白银的产品成本。
📰 AI 今日看点
今天的信息量集中在三个方向:一是阿里 Qwen3.8-Max 正式发布并同步推出「千问办公」智能体产品,2.4 万亿总参数、95B 激活、1M 上下文,PaperBench 拿到 93.0 分较上代提升 28.2 分,直接把国产旗舰的性价比拉到 Opus5 的四分之一。二是价格与调用格局同步生变,OpenAI 下调 GPT-5.6 Luna 价格 80%,而 OpenRouter 数据显示上周全球 56.8 万亿 Token 调用中前五全部是中国模型,DeepSeek-V4-Flash 以 7.22 万亿登顶。三是监管与安全的现实压力开始兑现,欧盟《人工智能法》通用模型条款自 8 月 2 日强制执行,OpenAI 主动对齐 GPAI 准则,而 Google Earth AI 上线一天下架、犯罪实验室 DNA 设备被曝可篡改漏洞,提醒所有人能力扩张的另一面是风险面积同步扩大。
🔥 AI 大事件
阿里发布 Qwen3.8-Max,2.4 万亿参数冲进全球第一梯队
阿里正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 加混合注意力机制,支持视觉理解与 1M Tokens 上下文。在 Arena 文本榜上仅次于 Fable 5 和三款 Claude Opus 系列,编程智能体评测 PaperBench 录得 93.0 分,较上代大幅提升 28.2 分。来源:The Verge
Qwen3.8 定价仅为 Opus5 的四分之一,下周开源权重
Qwen3.8 API 已上线千问 AI 平台,国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,国际价格为 Opus5 的 40%(输入)与 24%(输出)。阿里同时宣布下周将开源 Qwen3.8-Max 及 Qwen3.8-27B,标志其在短暂转向闭源后重回开放权重路线。来源:TechWeb
OpenRouter 周报:全球 56.8 万亿 Token 调用,前五全是中国模型
上周(7 月 27 日至 8 月 2 日)全球大模型总调用量 56.8 万亿 Token,环比下滑 2.07%。中国模型周调用量 28.13 万亿 Token,连续十四周位居全球首位;美国模型 4.38 万亿 Token,但环比大涨 87.18%。DeepSeek-V4-Flash 以 7.22 万亿 Token 升至第一,小米 MiMo-V2.5、腾讯 Hy3 分列二三位。来源:企鹅号
欧盟《人工智能法》通用模型条款 8 月 2 日起强制执行
欧盟委员会 7 月 31 日宣布,自 8 月 2 日起扩大《人工智能法》适用范围,欧洲人工智能办公室可对通用人工智能模型提供商执行相关规则。对可能造成系统性风险的先进通用模型,提供商须额外履行防范网络攻击、模型失控、有害操纵与侵犯基本权利的义务。来源:新华社
OpenAI 将 GPT-5.6 Luna 价格下调 80%,价格战正式打响
OpenAI 直接下调每 Token 费率,Google 则以更低价格叠加 Token 用量与工具调用次数的削减,Anthropic 选择在同等价格下强调任务表现更强。三种策略路径不同,但共同信号是模型竞争的焦点正在从能力榜单转向单位成本。来源:VentureBeat
OpenAI 宣布安全实践对齐欧盟 AI 法案 GPAI 行为准则
在欧盟通用模型条款生效前夕,OpenAI 于 7 月 31 日公布其安全实践与 GPAI 行为准则的对齐方案,覆盖系统性风险评估、透明度披露与事故报告等环节,成为首批主动表态的美国前沿实验室之一。来源:AI News
🛠️ AI 应用前线
MiniMax 发布 H3 多模态生成模型,视频生成价格仅为同类三分之一
MiniMax 推出新一代多模态生成模型 MiniMax H3,主打生成质量与成本的双重优化,视频生成定价约为业内同类旗舰模型的三分之一,把多模态生成的门槛进一步压向中小团队。来源:企鹅号
字节跳动推出 Seedance 2.5 视频创作模型,主攻长叙事与可编辑性
Seedance 2.5 延续统一的多模态音视频联合生成架构,重点突破长叙事能力、多模态参考能力和编辑能力,意在把 AI 视频从「一次性生成炫技」推进到可迭代修改的实际生产流程。来源:企鹅号
阿里同步推出「千问办公」智能体产品
配合 Qwen3.8 发布,阿里上线 Agent 产品「千问办公」,直接接入新模型的编程(Coding)与专业办公(Cowork)能力,是本次发布中把模型能力产品化落地的关键一环。来源:TechWeb
Thinking Machines 开源 Inkling Small,约 1/4 体积逼近前代性能
Thinking Machines 发布开源模型 Inkling Small,参数规模约为前代的四分之一但性能接近。对于需要掌控数据、模型行为和微调链路的企业而言,这种更小的部署足迹可能比追逐最高榜单分数更有价值。来源:VentureBeat
Google Earth AI 功能上线一天即下架
Google 在推出 Earth AI 功能仅一天后就将其撤回,此前有批评指出该功能可能传播错误信息。这已是本季度大厂 AI 功能因可信度问题紧急回滚的又一案例。来源:TechCrunch
犯罪实验室 DNA 设备被曝安全漏洞,30 年证据面临篡改风险
研究人员借助 Claude 挖掘出一个存在数十年的安全缺陷,成功在广泛使用的法医设备文件中增删 DNA 图谱,理论上可用于栽赃或抹除嫌疑人。设备厂商 Thermo Fisher 已发布软件补丁,目前无证据表明该漏洞曾被实际利用。来源:The Verge
📊 数据速递
- 2.4 万亿 --- Qwen3.8-Max 总参数量,激活参数 95B,上下文长度 1M Tokens(TechWeb)
- 93.0 分 / +28.2 --- Qwen3.8-Max 在 PaperBench 编程智能体评测的得分与较上代提升幅度(TechWeb)
- 24% / 40% --- Qwen3.8 国际输出价与输入价相对 Opus5 的比例(TechWeb)
- 80% --- OpenAI 对 GPT-5.6 Luna 的降价幅度(VentureBeat)
- 56.8 万亿 Token --- 上周全球大模型总调用量,环比下滑 2.07%(OpenRouter)
- 28.13 万亿 vs 4.38 万亿 --- 上周中国与美国模型的周调用量对比,中国已连续十四周领先(OpenRouter)
- 7.22 万亿 Token --- DeepSeek-V4-Flash 周调用量,环比增长 13%,登顶全球第一(OpenRouter)
- 1/4 --- Thinking Machines 新模型 Inkling Small 相对前代的体积比例(VentureBeat)
- 64% --- 智能体服务场景下,重复分词最高可占到首 Token 延迟的比例(ArXiv / TokTier)
- 71.2% --- CodeShrink 在多模态代码理解中削减的视觉 Token 用量上限(ArXiv)
📊 今日概览
| 维度 | 数据 |
|---|---|
| 📅 日期 | 2026-08-03 |
| 🔬 ArXiv 精选论文 | 16 篇 |
| 🚀 GitHub 趋势项目 | 15 个 |
| 📰 新闻事件 | 12 条 |
🔬 ArXiv 今日精选论文
大模型与 Agent
TokTier: Exact Stateful Tokenization for Agentic LLM Serving
针对编码智能体反复重传长对话导致的重复分词开销,提出有状态分词服务:仅对追加片段周边小窗口重新分词并做稳定边界校验,保证输出 Token ID 与完整分词完全一致。在 17 个分词器家族、150 亿次切分校验中零偏差,增量修复耗时 0.5--1.1 毫秒,最高比 HuggingFace 快 437 倍,接入 vLLM 后首 Token 中位延迟下降 16--34%。来源:arXiv:2607.29678
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
首个同时评估取值准确率、大规模记录完整性、证据溯源与实测成本的企业文档抽取基准,覆盖 370 份企业文档、4,869 页、8 个业务领域、67 种文档类型。结论颇具现实意味:商用视觉语言模型在短文档上表现良好但在长文档上频繁截断记录列表,编码智能体准确率更高却成本高昂。来源:arXiv:2607.29677
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
把大模型智能体放到「连续做实验」的位置上考察:30 个可执行机器学习任务、七个研究方向,智能体需观察累积配置、指标与日志后提出下一组超参。评测 12 个主流智能体后发现,它们具备可测量的实验优化能力,但在持续迭代精调、复杂日志诊断上仍有明显短板。来源:arXiv:2607.29626
DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
用《龙与地下城》战斗构建规则密集型战术推理基准,分为单场遭遇战与跨场次「冒险日」两条赛道,后者引入持续生命值、法术位、消耗品与短休时机等长期资源约束。结果显示前沿模型常能赢下单场战斗,却在跨场次的资源预算与休整节奏上大面积失误。来源:arXiv:2607.29577
机器学习理论与方法
Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback
研究把 Muon 优化器更新压缩到每参数 1 比特的可行边界,理论上证明无论符号操作放在线性最小化预言机之前、之后还是两侧,都存在发散反例,且误差反馈无法挽救输出端压缩。但实验结果反转了理论排序:在 CIFAR-10 与 nanoGPT 速通任务上,被证明会发散的「预言机之后压缩」反而最强。来源:arXiv:2607.29674
Differentially Private Nonparametric Modal Learning
提出 DP-GRAMS,在差分隐私约束下恢复多元分布的密度众数,通过高阶核降偏、梯度裁剪与校准高斯噪声实现私有均值漂移上升,并给出近最优的极小极大误差率,同时扩展出私有模态回归与聚类流程。来源:arXiv:2607.29675
When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
回答了模仿学习中一个长期靠经验支撑的问题:与专家交互式查询之所以有效,是因为它把表征要求从「能表达专家策略」放宽到「能表达专家价值函数」。作者给出的 OVI 算法在学习器网络明显弱于专家时优势最大,同时证明离线方法无法绕过这一交互需求。来源:arXiv:2607.29617
Freeze, Then Select: Structured Field Adapters and Stability-Validated Weak Selection for PDE Discovery
把稀疏观测下的偏微分方程发现拆成两步:先用结构化场适配器在无 PDE 残差约束下重建连续场并冻结,再用稳定性验证的弱式选择识别跨独立弱形式系统反复出现的项。在全部六种稀疏 MDBench 场景中取得最高精确支撑恢复率。来源:arXiv:2607.29665
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
针对现实决策中难以用单一标量奖励刻画的问题,提出从偏好反馈中学习多目标对齐的强化学习框架,为对齐任务里长期存在的「多个相互冲突目标如何加权」提供了更系统的处理方式。来源:arXiv:2607.29559
Evolving language compositionality in a frequency-structured meaning space
在频率结构化的语义空间中研究语言组合性的演化条件,探讨为什么高频含义倾向于保留整体化表达,而低频含义更容易演化出可组合结构,为理解模型涌现的符号能力提供了对照视角。来源:arXiv:2607.29642
多模态与视觉语言
CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding
把源码渲染成图像输入多模态模型可以省钱,但空白区域和无关代码带来大量浪费。CodeShrink 用无空白渲染、强化学习驱动的自适应压缩配置、以及指令感知的主导 Token 筛选三招组合,在代码问答、克隆检测与代码补全上最多削减 71.2% 视觉 Token,效果仍不输未压缩的纯文本输入。来源:arXiv:2607.29637
MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
把冻结的视觉语言模型与预训练视频扩散 Transformer 当作异构专家,通过轻量级逐块路由器让每个 DiT 模块自主选择最相关的 VLM 层,实现理解与生成之间的自适应对应。在 IntelligentVBench、OpenVE-Bench、RefVIE-Bench 三个基准上均超过此前最优方法。来源:arXiv:2607.29545
CALM-AH: A Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus
面向 ABAW11 视频级矛盾与犹豫状态识别挑战,融合文本、语音、视觉与行为统计特征构建 15 路组合集成,并提出「可靠性门控多专家共识」机制------只有三个纠错专家一致反对时才推翻初始预测。完整系统 Macro-F1 达到 0.7771。来源:arXiv:2607.29310
安全、机器人与交叉应用
FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling
针对视觉-语言-动作模型「要历史信息就会拖慢推理」的矛盾,采用对本体状态与视觉帧的对数式回溯采样以最小冗余捕捉长期依赖,并用流匹配生成动作分布、斐波那契递归推理策略产出长程规划。实验显示动作平滑度与成功率显著提升,且无需重训大规模视觉编码器。来源:arXiv:2607.29596
GQ-FSL: Green Quantized Federated Split Learning
面向无线边缘部署深度网络的能耗瓶颈,提出支持客户端与服务端子模型非对称精度的量化联邦分割学习框架,把设备能耗约束与全局收敛性能解耦,并给出分割点与精度等级的联合优化方法。来源:arXiv:2607.29659
FDD-ON: An Ontology for VAV HVAC System Fault Detection and Diagnostics
为变风量空调系统的故障检测与诊断构建模块化可扩展本体,用「诱因---故障---症状---影响」的显式关系刻画运行异常与后果,为数字孪生驱动的故障诊断和 AI 运维决策系统提供机器可解释的语义基础。来源:arXiv:2607.29657
🚀 GitHub AI 趋势日榜 Top 15
| 排名 | 项目 | 语言 | ⭐ 今日获星 | 说明 |
|---|---|---|---|---|
| 1 | lyogavin/airllm | Jupyter Notebook | 819 | 单张 4GB 显存显卡跑 70B 模型推理,老显卡福音 |
| 2 | zhaoxuya520/reverse-skill | PowerShell | 1,141 | 逆向/渗透/安全技能路由包,支持自举工具链与经验库自进化 |
| 3 | firecrawl/pdf-inspector | Rust | 1,769 | 高速 PDF 检查与文本抽取库,自动区分扫描件与文本型 PDF |
| 4 | esengine/DeepSeek-Reasonix | Go | 333 | 面向 DeepSeek 的终端编码智能体,围绕前缀缓存稳定性设计 |
| 5 | TencentCloud/TencentDB-Agent-Memory | TypeScript | 602 | 团队级 Agent 记忆中枢,沉淀对话、技能、Wiki 与代码图谱 |
| 6 | microsoft/AI-For-Beginners | Jupyter Notebook | 2,629 | 微软 12 周 24 讲 AI 入门课程,今日获星榜首 |
| 7 | microsoft/generative-ai-for-beginners | Jupyter Notebook | 588 | 微软生成式 AI 入门 21 讲,长期霸榜的经典教程 |
| 8 | donnemartin/system-design-primer | Python | 138 | 大规模系统设计入门与面试准备,36 万星常青项目 |
| 9 | antirez/ds4 | C | 139 | DeepSeek 4 Flash/PRO 本地推理引擎,支持 Metal、CUDA 与 ROCm |
| 10 | shiyu-coder/Kronos | Python | 217 | 面向金融市场「语言」的基础模型 |
| 11 | Panniantong/Agent-Reach | Python | 659 | 让智能体读写全网内容的 CLI,覆盖 X、Reddit、B 站、小红书等 |
| 12 | Alishahryar1/free-claude-code | Python | 291 | 在终端、IDE 或手机上免费调用 Claude Code、Codex 等,支持语音 |
| 13 | iv-org/invidious | Crystal | 305 | YouTube 的开源替代前端 |
| 14 | livekit/agents | Python | 129 | 构建实时语音 AI 智能体的框架 |
| 15 | usekaneo/kaneo | TypeScript | 496 | 极简开源项目管理工具 |
💡 今日洞察
1. 价格战是能力收敛的必然结果,不是厂商善心。 阿里把国际输出价定在 Opus5 的 24%,OpenAI 把 Luna 砍 80%,Google 用减少 Token 用量变相降价,Anthropic 则死守价格谈表现。四种打法对应四种处境,但共同前提是:头部模型在多数日常任务上的能力差距已经小到用户感知不出来,剩下能拉开差距的只有单位成本和调用效率。对使用方来说,今年最该建立的能力是「按任务分层选模型」,而不是锁死一家。
2. 「便宜的跑量、贵的跑关键路径」正在成为事实标准。 OpenRouter 数据里一个容易被忽略的细节是:中国模型周调用量环比下滑 14.76%,美国模型却环比暴涨 87.18%,总量还微降 2.07%。这不像是市场份额的此消彼长,更像是开发者在做结构性调整------把批量、低风险的调用压到便宜模型,把高价值任务重新分配给贵模型。谁能在这两层之间提供顺滑的切换和统一的可观测性,谁就掌握了新的入口。
3. 开放权重已从「追赶者的武器」变成「生态位的通行证」。 阿里在短暂闭源后重回开源、Thinking Machines 用 1/4 体积的开源模型主打可控性、上周 Meta 微软英伟达 IBM 集体为开放权重背书------三件事指向同一个判断:闭源守利润,开源守生态,而在企业侧对数据主权和微调自由的要求越来越硬的当下,生态位的价值正在超过短期利润。
4. 合规成本正式进入产品成本表。 欧盟 8 月 2 日开罚、OpenAI 抢先对齐 GPAI 准则、Google Earth AI 上线一天回滚,这三件事拼在一起说明:AI 产品的发布流程里,「合规与可信度评审」已经和性能测试同等重要。今天 VentureBeat 那篇讲 Waymo 的文章说得直白------项目不是在模型表现好时就绪,而是在评测体系就绪时才算就绪。这句话值得所有做 AI 产品的团队抄在墙上。
5. 学术界的注意力正在从「模型多强」转向「智能体多省」。 今天 ArXiv 的高关注论文中,TokTier 优化重复分词(最高占首 Token 延迟 64%)、CodeShrink 削减 71.2% 视觉 Token、GQ-FSL 优化边缘能耗、FibVLA 平衡历史信息与推理效率------四篇论文来自完全不同的子领域,但都在回答同一个问题:智能体时代,如何把每一个 Token、每一焦耳电都花在刀刃上。这与产业界的降价潮是同一枚硬币的两面。
✍️ 编辑策划 / 整理 :Fan Jun AI Tech Notes 组
📅 发布日期 :2026-08-03
数据来源:ArXiv API、GitHub API、TechCrunch、The Verge、Wired、VentureBeat、机器之心、量子位等