周一上线|OpenAI 开卖 Agent 指挥台,DeepSeek 被曝筹备 IPO,开放模型迈入 3T 时代

这期的「周一上线」,一边是开发者继续整活,一边是模型、工具和开源项目密集上新。

有人把 Codex 做成了实体「Agent 指挥台」,有人用世界杯四强球员的名字织出四面国旗,还有人只用 5 个 prompt 搭出了一个 3D 球场选座原型,还有网友顺手给 Codex 换上薛凯琪皮肤、给 Claude 打印了会转的向日葵。

另一边,Kimi K3、Inkling、Monolith-1.0 接连发布,Qwen3.8 也亮出了 2.4T 参数;从本地 OCR、text-to-CAD,到 Agent Skills、AI 私教和交易 Agent,开源项目里能直接动手试的东西越来越多。

行业里,DeepSeek 被曝筹备 IPO,Grok Build 正式开源,Claude Fable 5 调整套餐权益,「强化学习之父」Richard Sutton 也再次创业。

下面,开始一周回顾。

有点新鲜

「有点新鲜」收录本周 AI / 开发者圈里那些不算大新闻,但挺值得看一眼的新鲜事。

OpenAI 开始卖「Agent 指挥台」了

OpenAI 周边店上架了和 Work Louder 联名的 Codex Micro(下方右图),售价 230 刀乐。

一块 13 键小键盘,专门用来指挥 Codex:按键灯效实时显示每个 agent 的状态,摇杆一拨触发审查 PR、调试这类常用工作流,还有个实体旋钮,转一转就能调推理级别。

不过很快有网友给出理想的键盘设计(上方左图)并表示:"OpenAI 出的硬件 Vibe Coding 键盘真好看。但价格不美丽,等大华强北。"

100 美元一条的「爱的表白」

网友开玩笑称「拿 Claude 退订截图来换 GPT 一个月免费才对」,Tibo 顺势接梗,做成了正经活动并上线官方页面:发推说说你为什么喜欢 GPT-5.6 Sol、或者为什么切换过来,前 1 万名送 100 美元 Codex 额度。

这不会是看球看一半做出来的项目吧:用 26 个球员的名字,织一面国旗

有开发者做了个创意编程项目:把 2026 世界杯四强------西班牙、英格兰、法国、阿根廷------的国旗,用各队 26 人大名单里球员名字的字母「织」了出来。

每个字母都挂在一根独立模拟物理的丝线上,鼠标划过去,字母会像门帘一样荡开,再在重力下慢慢归位。划过两根丝线,还会自动触发那支球队的解说名场面音频。目前该项目已开源,感兴趣的小伙伴可以去试试。

看球看到一半打开电脑写代码,大概就会做出这种东西。

买球票前,先去 3D 座位上坐一会儿

@thebuggeddev 提了个灵魂拷问:为什么我们买球票的时候,从来看不到座位的真实视野?

于是他用 Claude Fable 5 + Three.js 做了个 3D 选座原型:整个球场建成 3D 场景,点任意座位,就能预览从那个位置看球的实际视角。作者说第一个 prompt 就把 3D 场景跑起来了,整个原型总共只用了 5 个 prompt。

他还打算把这套思路搬到电影院、演唱会和温网。选座这件事被静态座位图统治了这么多年,或许真到了该换代的时候。

Claude 长出向日葵了

@Chris hamous 分享:两位 mentor 平时用 Claude Code 比较多,于是买了两个 3D 打印的 Claude 向日葵摆件送给他们------花盆里长出 Anthropic 的米花 logo,还能转。

哈哈哈,这是本期唯一指定 AI 打工人桌搭。

当 Codex 遇上薛凯琪

Codex Dream Skin 是一个给 Codex 桌面端换肤的工具,作者的说法是「给 Codex 换一张会呼吸的脸」。

它通过本机 CDP 注入实现主题化,不修改官方安装包,一键可还原,换肤后侧栏、输入框都是原生控件。主题可以随便换,有人直接做了一套「薛凯琪专属定制皮肤」,连欢迎语都变成了"与凯琪一起,把灵感写进每一天"。

和爱豆结对编程,这下加班都有动力了

保留节目之龙图------Kimi 新王登基

大模型发版必出龙图,这次的版本是:Kimi 新王登基!反正不管谁登基,受伤的总是 Gemini......

至于 Kimi 凭什么当新王,答案在下面的「周五发版」。

周五发版

「周五发版」是一个程序梗:一旦版本上线,我们就要开始祈祷一切如期运行。这个模块寓意,所有模型、产品版本更新,都能大吉大利。

Kimi K3 发布:全球首个开放 3T 级模型

月之暗面发布 Kimi K3,总参数 2.8T,是目前最大的开放权重模型,原生多模态,支持 1M 上下文,主打长程编码、知识工作和推理。

官方Demo 很能打------K3 用 48 小时自主设计了一颗推理芯片,还从零写了个性能打平 Triton 的 GPU 编译器。

模型已上线 Kimi 全家桶和 API,完整权重 7 月 27 日前放出。开源阵营追赶闭源的方式,从卷 Benchmark 变成了直接卷 Scale。

Thinking Machines 发布 Inkling:首个从零自训的开放权重模型

Mira Murati 的 Thinking Machines Lab 发布 Inkling,MoE 架构,总参数 975B、激活 41B,原生多模态,支持 1M 上下文,权重已上 Hugging Face。

官方很直接:Inkling 不是最强模型,卖点是「适合被定制」------推理力度可以从 0.2 连续调到 0.99,还能直接在自家 Tinker 平台微调。发布 Demo 是让 Inkling 自己给自己写微调任务,自己训自己。

大家都在卷最强模型,Thinking Machines 选择卖「最好改的模型」。

Monolith-1.0 开源:1.6T 参数,MIT 协议

Basalt Labs 在 Hugging Face 开源 Monolith-1.0,MoE 架构,总参数 1.57T、激活 49.5B,60T token 训练,原生 1M 上下文,权重、tokenizer 和评测框架全部 MIT 协议放出,可商用。

官方给的成绩也很亮眼:Humanity's Last Exam 99.4 分、AIME 2025 满分,超过 GPT-5.4 和 Claude Opus 4.6。不过社区还在等第三方复现验证。

阶跃星辰发布智能体操作系统,还掏出一台 AI 手机

据财新报道,阶跃星辰发布智能体操作系统,并展示了首款 AI 手机 STEPX Neo,但未透露量产情况。

董事长印奇的判断很直接:中国大模型商业化未必要走 AI 编程路径,阶跃押注软硬件结合,探索 To C 商业闭环。在大家都挤在 AI Coding 赛道的当下,直接下场做手机,算是一条少有人走的路。

Xmax 发布 X2.0:实时可交互的 AI 视频

Xmax AI 上线 X2.0 实时交互视频模型平台,主打「边拍边生成」:摄像头画面实时换人(CharX)、毫秒级换装(ClothX)、整帧风格化(VibeX),还能拖动静态物体让它动起来(MoX)、召唤虚拟生物到现实画面里互动(DimX)。

AI 视频卷完生成质量、卷完成本速度之后,下一个战场可能是「实时」------视频不再是生成出来看的,而是可以伸手进去玩的。

阿里发布 Qwen-Audio-3.0-Realtime:会用工具、能共情、边说边听

阿里云发布实时语音模型 Qwen-Audio-3.0-Realtime,分推理更强的 Plus 和速度更快的 Flash 两个版本,围绕推理、工具调用、共情对话、双工交互四个方向升级。

几个亮点:语音模型原生支持工具调用,问完"附近有什么川菜馆"再追问"哪家最近",它会接着上次的地图结果继续查;能根据语境调整语气节奏,还会用笑声、叹息做共情回应;内置双工控制子模型,嘈杂环境不会被背景噪声误打断,多人讨论能锁定主对话对象。

实时语音的比拼,正在从「说得像人」变成「聊得像人」。

开源雷达

周榜速递

周榜主要根据新增 star 数进行排名,下面的单项目讲解则偏向新晋项目、实用老项目,标星并非单项目讲解的唯一指标:

light-ocr:把 OCR 变成一个本地能力

light-ocr 是一个基于 PP-OCRv6 Small 的离线 OCR 库,C++17 核心,附带 Node.js 适配器,npm 一行安装。

它解决的问题很具体:云 OCR 要上传图片、有隐私边界,PaddleOCR 效果好但通常得拖一个 Python 环境。light-ocr 把官方模型打包成约 31 MB 的自包含运行时,识别全程不联网、不起子进程,直接嵌进桌面应用或 Node 服务里。0.3.0 候选版还加了 GPU 加速:Apple 走 Core ML,Linux / Windows 走 WebGPU,实测最高 5.7 倍提速。

对做截图取字、票据识别这类本地优先应用的开发者来说,是个挺省心的选择。

CADAM:一句话生成 CAD 模型

CADAM 是 Adam 团队开源的 text-to-CAD 网页应用,说一句话或者丢一张图,就能生成可编辑的 3D 模型。

生成结果是完全参数化的 OpenSCAD 代码,可以拖动滑块实时调整尺寸,支持导出 .STL、.SCAD、.DXF,直接对接 3D 打印。整个应用基于 WebAssembly 跑在浏览器里,无需安装,内置 BOSL、BOSL2、MCAD 等常用库。

3D 打印玩家的建模门槛,又被 AI 砍掉了一截。

skills:Matt Pocock 的私藏 Agent Skills 全部开源

TypeScript 圈知名教育者 Matt Pocock 把自己每天在用的 Agent Skills 开源了,标题很直接:「AI Skills for Real Engineers」------不是 vibe coding,是真工程。

npx skills@latest add mattpocock/skills 一行安装,也能作为 Claude Code 插件订阅。这套 Skills 针对的都是 coding agent 的经典翻车现场:/grill-me 让 Agent 在动手前先"拷问"你把需求聊透,/tdd 强制红-绿-重构循环,/improve-codebase-architecture 定期抢救屎山。每个 Skill 都小巧、可改、可组合。

与其教 AI 写代码,不如把几十年的工程方法论喂给它。

awesome-llm-apps:LLM 应用的百宝箱

一个持续更新的 LLM 应用合集,收录了大量带完整代码的 AI Agent、RAG 和多智能体项目,覆盖 OpenAI、Anthropic、Gemini 及各类开源模型。

从入门级的单 Agent Demo 到多智能体协作、语音 Agent、MCP 应用,基本每个方向都能找到一个能跑起来的参考实现。想动手做 LLM 应用又不知道从哪开始的,把它当题库刷就行。

DeepTutor:Agent 原生的 AI 私教

港大数据智能实验室(HKUDS)开源的个性化学习助手,上线不到半年攒下 2.4 万 star,论文也发了 arXiv。

它把"AI 家教"做成了一整套系统:上传资料建知识库,一个对话窗口里自由切换聊天、多智能体解题、出题测验、深度研究和可视化;Book Engine 能把你的材料编译成带测验、闪卡、交互演示的"活书";TutorBot 则是常驻的自主导师,有自己的记忆和人格,还会主动发起复习提醒。持久记忆贯穿一切------它越了解你,教得越对路。

OpenCut:开源版剪映

OpenCut 是一个免费开源的视频编辑器,目标很明确:做剪映的替代品,目前已有 50k star。

立项理由写的是:视频留在自己设备上、基础功能不收费、保持简单易用。Web 端基于 Next.js,桌面端和 GPU 合成核心正在用 Rust 重写。

苦剪辑工具付费墙久矣的用户,可以蹲一下它的成熟。

Vibe-Trading:你的个人交易 Agent

同样来自 HKUDS,一句话把金融问题变成可运行的分析:pip install vibe-trading-ai,然后用自然语言让 Agent 做研究、生成策略、跑回测、出报告。

内置 19 个免费行情源自动兜底、461 个预置量化因子的 Alpha Zoo、30 套多智能体投研团队预设,还有个有意思的 Shadow Account:上传你的券商成交记录,它会提炼出你的"影子策略"跑回测,告诉你追涨杀跌到底亏了多少。支持接入券商实盘,但默认只读、有强制授权边界和一键熔断

这周有事

「这周有事」收录本周值得记一下的行业动态、事故、融资、人员流动和基础设施变化。

DeepSeek 被曝筹备 IPO,并寻求新一轮融资

据彭博社报道,DeepSeek 已开始筹备在中国内地上市,正与会计师事务所合作,争取在 2026 年底前完成财务报告,最快可能于今年底或 2027 年初递交上市申请。具体时间仍取决于监管审批、市场环境和公司业绩。

在 IPO 之前,DeepSeek 还被曝计划继续融资。英国《金融时报》称,公司已与潜在投资者展开初步接触,拟按约 710 亿美元的投前估值开启新一轮融资;彭博社报道的计划融资规模至少为 100 亿元人民币。

今年 6 月,DeepSeek 首次对外融资约 500 亿元人民币。随后一份上市公司披露文件推算,其当时估值约为 3509 亿元人民币。DeepSeek 尚未公开回应 IPO 和新一轮融资消息。

Qwen3.8 预告:2.4T 参数,即将开放权重

7 月 19 日,阿里 Qwen 官方预告 Qwen3.8 即将发布并开放权重,总参数 2.4T。官方的措辞不算谦虚:当今最强模型之一,比肩前沿闭源模型,「仅次于 Fable 5」。

本周 Kimi K3 把开放模型推到 2.8T,Qwen3.8 跟着亮出 2.4T。开源模型的万亿级军备竞赛,国内厂商已经贴身肉搏了。

Grok Build 开源,Coding Agent 的 Harness 摊开给你看

SpaceXAI 于 7 月 15 日开源 Grok Build,公开了这款终端 Coding Agent 的 Rust 源码。开发者现在可以直接查看它如何组装上下文、解析模型响应、调度工具调用,以及 Skills、插件、Hooks、MCP Server 和 Subagent 是如何被加载与执行的。

Grok Build 也支持自行编译,并通过配置文件接入本地推理服务。项目采用 Apache 2.0 许可证,不过当前仓库是从内部 monorepo 定期同步的版本,暂不接受外部代码贡献。

结合上一期的代码上传争议,这次开源至少让开发者多了一条路径:不只抓包猜它做了什么,也可以直接去源码里看。

Claude Fable 5 调整套餐权益,Pro 用户获赠 100 美元额度

据官方消息称,从 7 月 20 日起,Claude Fable 5 将纳入所有 Max 和 Team Premium 套餐,可用额度按套餐限额的 50% 计算。

Pro 和 Team Standard 用户仍需通过使用额度调用 Fable,但会获得一次性 100 美元额度。Anthropic 表示,此前分阶段开放主要是因为需求难以预测,需要随着新增算力逐步扩大访问范围。

「强化学习之父」Richard Sutton 创办 Oak Lab

强化学习先驱、2024 年图灵奖得主 Richard Sutton 表示,他已与研究者 Khurram Javed 离开 Keen Technologies,共同创办新公司 Oak Lab。Sutton 目前也是加拿大阿尔伯塔大学计算机科学教授,他与 Andrew Barto 因奠定强化学习的概念与算法基础获得图灵奖。

Oak Lab 将继续研究强化学习和智能形成机制。Sutton 认为,智能来自系统在运行过程中积累的持续经验,而现有深度学习方法仍然低效,不能只靠局部修补,需要更基础的新思路和重新设计。