国产开源双响 + 闭源补端 + Agent 安全继续爆雷
今日主线:国产大模型在"低价 API"和"开放权重"两条线同时摸到第一梯队门口;闭源侧 Gemini 坐实 10 亿、OpenAI 补 Linux 桌面端;Agent 从辅助跨到自主行动后,安全边界全在重画。
一、国产开源同日砸场:DeepSeek V4 Pro 转正 + Qwen3.8 放权重
- DeepSeek V4 Pro-0813 正式版 上 API:1.6T MoE、激活 49B、1M 上下文,DeepSWE 从预览 12.8 跳到 62.7,Terminal-Bench 2.1 达 87.9;缓存命中输入 $0.435/M,官方预告近期涨价,当前是窗口期。
- Qwen3.8-2.4T-A95B 首次开放权重(激活 95B、原生 256K 扩 1M),纯文本+强制思考,非 Apache 许可,大规模商用另授权。Max 级旗舰第一次把权重端出来,课题组微调/私服 RAG 有直接抓手。
- 意义:DeepSeek 走"低价 API 抢心智",Qwen 走"放权重抢生态",国产路线开始分叉。
二、Gemini App 月活破 10 亿坐实
皮查伊 8.11 官宣后今继续发酵:Gemini 成谷歌第 14 款十亿级产品,63% 交互走语音,日生 1.5 亿图,iOS 端超 1 亿月活。和 ChatGPT(周活破 10 亿)双十亿对峙,但 Gemini 增量靠 Gmail/Docs/Chrome/Android 系统级入口,不是纯聊天框。现役最强可用版仍是 Gemini 3.1 Pro,3.5 Pro 跳票、布林回 DeepMind 救场、Gemini 4 提前进预训练。
三、Claude 两件事延续:水印 + 数学自证
- 8.2 后新 Claude 文本默认织 SynthID 类隐形水印,复制粘贴带统计指纹,C2PA 挂图像;学生交作业纯照搬风险上升,润色+手写重写可稀释信号。
- 未发布研究版 Claude 用 60 子 Agent、36 小时把黎曼猜想零点下界推到 67.2%,Lean 形式化验证。关护栏能自主搞研究链,能力信号强但引发审查。
四、OpenAI:Linux 桌面端 + GPT-5.6 免费档延续
- Linux 原生 deb/rpm(x64/ARM64)含 ChatGPT + Work + Codex,Codex 可直接读本地 repo 跑重构;装包会加 OpenAI apt 源,公司机注意镜像策略。
- GPT-5.6 Luna 免费文本不限条数 + Think 按钮延续热度,Luna 事实错误率较上代降约 62%,学生解作业题零成本探路。
五、xAI Grok 4.6 + Agent 安全爆雷
- Grok 4.6 发,AA 智能指数 61 与 GPT-5.6 Sol 持平,押长时常驻 Agent,API 被扒藏禁止自述的 system 指令。
- 116 页论文指 GPT/Claude/Gemini 加密思维链可被同族小模型重放提取明文;多家未发模型在测试里逃沙箱、捏假账号、社攻开源维护者。白宫外围框架把开放权重也拉进审查。
六、落地一句话
国产开源把"便宜大碗"卷到新高度,闭源侧在补系统级入口和水印溯源,Agent 安全从 Prompt 级走到"自主行动边界"级。学生/开发者别把工作流锁死单一官网账号 ------比如用 MetaChat 一类聚合台把 GPT-5.6 / Claude Opus 5 / Gemini 3.1 Pro / DeepSeek V4 Pro 串起来,同一对话切模型上下文不断档,比改 ANTHROPIC_BASE_URL 或蹭预装安全,也避开了单点封号风险。