这期的「周一上线」,一边是模型和 Agent 继续往长程执行、真实任务里走,另一边是围绕 AI 的算力、资本和公司关系也在重新排兵布阵。
Grok Bot 开始给 Agent 配上云端电脑,WeLM 走进微信「小微」,GLM-5.3、Gemini 3.7 Flash、DeepSeek V4 Pro 正式版等轮番上阵,继续围绕 Coding、Agent 和端侧能力往前推。另一边,Manus 准备恢复独立运营,林俊旸重新创业,NVIDIA 更是拉上华尔街,准备长期撬动超过 5000 亿美元第三方资本建设 AI 基础设施。
当然,开发者们还是照常整活:手搓雷击探测器、3D版 H100 教学小工具,还有越来越"精简"的软件工程师技能树,一个都没落下。
下面,开始一周回顾。
有点新鲜
「有点新鲜」收录本周 AI / 开发者圈里那些不算大新闻,但挺值得看一眼的新鲜事。
给日历贴点贴纸
日历不只是负责提醒你"今天又有会"。网友 @AlexWeichart 做了个 Hibi Calendar:可以直接在日历上涂鸦、制作日式和纸胶带和贴纸,把每天记成一本电子手账。
把 H100 拆开给你看
GPU 看不懂?那就直接做个 3D H100 拆着学。@kylejeong 让 GPT-5.6 Sol 根据 Modal 的 GPU Glossary,用 Three.js 搭了一个可交互的 H100,边玩边看 GPU 到底是怎么工作的。
手搓雷击探测器
别人两天写个 Demo,网友 @p1nosaur 和 @embedder_dev 两天直接搓出了一个雷击探测器,还把硬件文件全开源了。
整个项目实际投入约 10.5 小时,成品能探测雷电无线电脉冲、估算风暴距离,并通过蜂鸣器提醒。
大模型发版,先过网友这一关
上周 Gemini 3.7 Flash 和 DeepSeek V4 Pro 正式版刚上线,网友二创就跟上了:Gemini 被画成"排名垫底也要独自开香槟",V4 Pro 则被 Flash0731 小鲸鱼一句"姐姐,你好区啊"直接整沉默。
Benchmark 还在看,梗图已经出完了。
一边摇人,一边走人
DeepSeek Harness 组还在杭州继续摇人,研究员、研发、产品、设计、开发者关系等岗位全都招;另一边,OpenAI GPU 老将 Scott Gray 宣布离职。
网友已经开始替未来模型操心了:"GPT-6.7 不会要慢两倍吧......"
软件工程师的技能树,砍到只剩 3 个了?
十年前 VS 现在:
周五发版
「周五发版」是一个程序梗:一旦版本上线,我们就要开始祈祷一切如期运行。这个模块寓意,所有模型、产品版本更新,都能大吉大利。
LFM2.5-VL-3B:把视觉模型继续塞进端侧
Liquid AI 发布 LFM2.5-VL-3B ,一款面向端侧部署的 3B 视觉语言模型,重点提升 屏幕 / UI 理解、Grounding、Function Calling 和多图输入。官方测试中,ScreenSpot-v2 平均得分 80.7,ToolSandbox 从上一代的 26.4 提升到 59.5。
模型运行时内存约 3GB,在 Galaxy S26 Ultra 上可达到约 20 Token/s,并已支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX。目前模型权重已开放,可直接下载和本地部署。
Grok Bot 和 Grok 4.6 连发:一边造 Agent,一边补底座
SpaceXAI 连续更新 Agent 产品线。先发布 Grok Bot:每个 Bot 都有自己的云端电脑,可以登录网站和应用、跨工具执行任务,还能学习并重复用户的工作流程;目前仍处于 beta 阶段。
随后发布的 Grok 4.6 则继续补强 long-running agents,重点提升长程研究、跨代码库开发和持续验证能力。模型支持 500K Context;在 Artificial Analysis Intelligence Index 中与 GPT-5.6 Sol 基本持平,仍低于 Fable 5。短上下文 API 价格为 2/百万输入、6/百万输出 Token。
WeLM 新进展:80B 已进小微,617B 继续向上扩
微信 WeLM 团队近期披露了 80B / 3B 激活和 617B / 23B 激活两种 MoE 规模的进展。其中,80B 模型已用于微信 AI 助手「小微」;617B 则更多出现在团队最新的 Hidden Decoding 研究与评测中,目前仍处于研究和开发阶段。
WeLM 这一名称最早可追溯至微信团队 2022 年发布的 10B 中文模型,但目前尚不能确认两代模型是否存在直接架构继承关系。
GLM-5.3 亮相:继续靠后训练补强 Agent
智谱公布 GLM-5.3。这次没有更换基座,能力提升主要来自更大规模的后训练,重点强化 Coding、长程 Agent 和 Cyber。智谱公布的 Benchmark 中,Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,GDPval-AA v2 从 1508 提升到 1769。
目前 GLM-5.3 首批访问主要面向部分 launch partners。智谱表示,计划在完成安全评估和防护强化后,约两周后公开发布模型;其中更敏感的 Cyber 能力将通过 trusted access 向验证用户开放。
Gemini 3.7 Flash:继续补强 Coding 和 Agent
距离 3.6 Flash 发布仅 3 周,Google 又推出 Gemini 3.7 Flash。这一版继续强化 Coding、Web Development 和 Agent Workflow,官方模型卡显示,DeepSWE、FrontierCode、AutomationBench 等开发者相关评测都有明显提升。
模型支持约 1M 上下文、64K 输出。截至 2026 年底,API 价格为 0.75/百万输入、3.75/百万输出 Token,相当于 3.6 Flash 原始价格的一半。
DeepSeek V4 Pro 正式版:继续补强 Agent
DeepSeek 发布 V4 Pro 正式版,重点提升 Agent 能力,尤其是生产环境中的表现。模型已同步上线 App、网页端和 API,并原生支持 Responses API、适配 Codex。
V4 Pro 和 V4 Flash 的 Thinking 现支持 low / high / max 三档。与此同时,DeepSeek API 自 8 月 17 日起启用峰谷定价,闲时价格为高峰时段的一半。
DeepSeek 还开源了自研的 DeepSeek Harness(dsh),采用"Everything is a Plugin"的架构,模型适配、工具、Session 和 Agent Loop 等都可以通过插件替换。目前项目仍处于 Developer Preview 阶段。
Newton 1.5.0:机器人仿真继续补控制与多物理能力
由 Disney Research、Google DeepMind 和 NVIDIA 发起的开源机器人物理引擎 Newton 发布 1.5.0。它基于 NVIDIA Warp,主打 GPU 加速、可微分物理和机器人仿真,目前由 Linux Foundation 管理。
这一版新增实验性的 GPU 向量化关节阻抗控制器、ONNX 策略推理,以及更完整的刚体---软体接触、相机深度输出等能力,也继续扩展 Kamino、VBD、MuJoCo Warp 等求解器。
开源雷达
周榜速递
周榜主要根据新增 Star 数进行排名,下面的单项目讲解则偏向新晋项目、实用老项目,标星并非单项目讲解的唯一指标。
Semantica:给 Agent 决策补上可追溯链路
Semantica 是一套面向 AI Agent 的图基础设施,可以把多源数据构造成 Context Graph / Knowledge Graph,并将记录进去的决策、因果关系和来源变成可查询、可追溯的图。项目支持自托管,并提供 REST API、MCP 和 CLI,采用 MIT License。
Diagram Design:让 Coding Agent 顺手把图也画了
Diagram Design 是一个面向 Claude Code、Codex 和 Pi 的 Agent Skill,提供 27 种图表类型,从架构图、流程图到时序图、ER 图都能生成。它还可以从网站提取品牌色和字体,让后续生成的图表跟着自己的视觉风格走。
Switchyard:给不同模型的 API 加一个「换乘站」
NVIDIA NeMo 开源的 Switchyard 是一个 LLM 流量代理,可以在 OpenAI Chat、Responses 和 Anthropic Messages 等格式之间转换,再把 Coding Agent 的请求转给 vLLM、NVIDIA NIM、Ollama 等不同模型后端,也支持按规则进行多模型路由和 A/B 测试。
不过项目目前仍处于 pre-alpha 阶段,官方明确标注为实验软件,不建议用于生产环境。
Code-Graph-RAG:先把代码库变成一张知识图谱
Code-Graph-RAG 用 Tree-sitter 解析代码,把函数、类、模块和它们之间的关系存进 Memgraph,再让 Agent 基于这张图查询、理解和修改代码。它支持 Python、TypeScript / JavaScript、Go、Rust、Java、C/C++ 等多种语言,并提供 MCP Server,可以接入 Claude Code 等客户端。
相比只靠关键词或向量去「搜代码」,它更强调先把代码之间的结构关系搞清楚。
Needle 2:14MB,也能在端侧调用工具
Needle 2 是一个专门处理 Tool Calling、设备控制和结构化信息提取的 45M 参数模型,整个模型压进单个 14MB binary,完整 session 约占 28MB RAM。
模型推理过程无需联网,还自带 confidence gating:置信度够高就执行,不够则可以交给更大的模型或其他流程继续处理。
ToolJet:拖拖拽拽,搭一个自己的内部工具
ToolJet 是一个开源低代码平台,可以通过可视化组件搭 UI,再连接数据库、API、SaaS 和对象存储。Community Edition 提供 60+ UI 组件、80+ 数据源连接,并支持 Docker、Kubernetes 等方式自托管。
需要注意,AI App Generation、AI Query Builder 和 Agent Builder 等能力属于 ToolJet AI(Enterprise),不属于开源 Community Edition;开源版本采用 AGPL-3.0。
这周有事
「这周有事」收录本周值得记一下的行业动态、事故、融资、人员流动和基础设施变化。
Mistral AI 开放第三方模型,首个接入 GLM-5.2
Mistral AI 宣布平台开始支持第三方开放模型 ,首个接入的是智谱 GLM-5.2。第三方模型将与 Mistral 自家模型运行在相同的基础设施和区域控制体系下,企业无需更换平台就能扩展模型选择。
同时,Mistral AI 新增美国 / 欧洲推理区域选择,并启动 European Compute Unit alliance program(欧洲算力联盟计划),继续强化其「主权 AI」路线。
NVIDIA 拉上华尔街,要给 AI 算力建一个「资本市场」
黄仁勋宣布,NVIDIA 将与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作建立独立融资平台,计划长期撬动 超过 5000 亿美元第三方资本,用于 AI 基础设施建设。
这里的 5000 亿美元不是 NVIDIA 收入,也不是一个单独基金,而是这些融资平台计划逐步动员的第三方资本。黄仁勋想推动的是:以后 AI Factory 不只是一笔数据中心支出,也可以像电力、交通基础设施一样,成为能够长期融资和投资的资产。
IBM 拿下 2.4 亿美元 AI 算力大单
IBM 与 Together AI 达成一项多年期 2.4 亿美元协议,将在 IBM Cloud 部署 NVIDIA HGX B300 集群,为 Together AI 的开源模型推理服务提供算力,预计 2027 年第一季度投入使用。
Together AI 近期刚以 83 亿美元估值完成 8 亿美元 C 轮融资。模型竞争背后,推理基础设施这门生意也越来越大。
Manus 恢复独立运营:Meta 收购进入撤销收尾
近日,Manus 宣布将重新以独立公司形式运营。中国监管部门此前已要求相关方撤销 Meta 对 Manus 的约 20 亿美元收购,目前双方正在推进交易回滚和业务拆分。作为分离的一部分,Manus 还将删除部分收购期间产生的用户数据,并开放备份和后续恢复安排。
这场收购从去年底官宣,到今年 4 月被叫停,再到如今进入拆分收尾,兜了一圈,Manus 又回到了独立运营的轨道。
林俊旸创业了:做横跨数字与物理世界的 Agent
从阿里离职约 5 个月后,林俊旸宣布在上海创办 Pragmatik Labs(语用科技,简称 p7k),研究方向是横跨数字世界和物理世界的下一代 Agent。
林俊旸同时确认,本轮融资由高榕创投和红杉中国共同领投,腾讯和上海未来产业基金提供支持。据 The Information 此前报道,此轮融资规模达数亿美元,公司投后估值约 20 亿美元;具体金额尚未由公司正式公布。