2026年10月6日 AI重要新闻:Hinton首发RSI论文、陶哲轩转AI减速派、ChatGPT伪造漫画家签名

2026年10月6日 AI重要新闻

数据来源:量子位 / Nieman Lab / Vals AI / Q Labs / StormZhang AI Daily / Hacker News / Reddit / Product Hunt / OpenAI / Anthropic 更新时间:2026年10月6日


一、AI 热点信息

1. Hinton、Bengio 等 22 人发布首篇 RSI 论文:AI 自主研发比例半年从 1% 涨到 26%

来源: 量子位

论文题目直接问出了最不客气的问题------《What if automating AI R&D triggers an intelligence explosion?》 (如果 AI 研发自动化触发智能爆炸会怎样)。22 位作者里包括两位 AI 教父 Geoffrey Hinton 与 Yoshua Bengio、强化学习先驱 Andrew Barto、OpenAI 首席科学家 Jakub Pachocki。真正让这篇论文有分量的是它引用的内部数据 ,而不是论证本身:Anthropic 方面,2025 年 1 月 AI 生成的获批代码还只占低个位数百分比,到 2026 年 5 月已超 80% ;2026 年 3 月 Claude 能在高层次人类监督下自主完成约 1% 的 AI 研发工作,到 8 月升到 26%------半年翻了二十多倍。OpenAI 方面,截至 2026 年 9 月,其内部 AI 系统已能经常完成原本需要人类员工数天完成的研发任务。

论文的核心论断分三层:一旦 AI 能完整参与造下一代 AI ,递归自我改进就可能真正闭环;越过某个临界点后,原本需要数年的进步可能被压缩到几个月甚至更短 ,极端情况下「今天一年的进步未来只需约 5 周」;实验室的研发规模理论上可能从几千人跳到数百万研究员 。同时它也给了关键的降调:智能爆炸未必需要 AI 先变成超级智能 ,只要研发自动化的效率足够高,反馈回路就可能先启动。把这条和本月前面的线索接起来读------9/27 因 Agent 逃逸暂停前沿训练、10/1 特朗普方案让大科技自我监管、10/4 Anthropic CEO 说 5 年内 50% 初级白领岗位消失------「AI 造 AI」已经从科幻命题变成了需要写进论文的工程问题,而它的燃料正是各家实验室自己的内部数据。

2. 陶哲轩转向「AI 减速派」:SAIR 演讲喊话模型公司「别解数学问题了」

来源: 量子位

就在几个月前,陶哲轩还是硅谷最推崇的「AI 课代表」:2026 年 3 月他在 IPAM 会议上说 AI 在数学和理论物理领域已经「ready for primetime」,同月接受《MIT 科技评论》专访时断言数学正经历一场哥白尼革命 。而在 SAIR 最新演讲里,他直接向模型公司开火:「简直是疯了,AI 公司无休止地加速,却对那之后会发生什么一无所知。必须慢下来。完全没理由这么快。」同场的菲尔兹奖得主 Cédric Villani 在看到 OpenAI 拿下千禧难题后形容这是「数学界有史以来从未见过的浩劫」。

陶哲轩给的核心概念叫 Proof Indigestion(证明消化不良) 。他把数学证明的完整生命周期拆成五步:提出解答 → Lean 形式化验证 → 阐释工作(把推导翻译成人能看懂的语言)→ 同行评审 → 写入教科书。问题在于,AI 在前两步疯狂加速,后三步的进度几乎为零 :没有人做报告,没有人写论文,甚至按下回车生成证明的人都搞不明白刚才发生了什么。他用了两个比喻------未解决的数学问题像灯塔 ,照亮整片海域,本身并不是终点;而当下的状态像 20 世纪初为马车设计的街道突然涌入汽车 ,产出暴增而成理解、发表、解释的通路全部瘫痪。他还补了一层对模型公司的体谅:这可能不是本意,「AI 做不了洞见,因为洞见不可验证,刷不了分,很难被当作目标函数训」。这条与第 1 条构成今天的正反面:一边在论证自动化的复利有多快,一边在指出复利只发生在可验证的环节上。

3. ChatGPT 给伪造的《纽约客》漫画签上真实漫画家的签名

来源: Nieman Lab · StormZhang · Hacker News

一条在 8 月底走红的漫画里,Dolly Parton 与 Tim Curry 手挽手站在天堂前台,右下角签着 「BLOPER」 ------那是《纽约客》漫画家 Brendan Loper 的笔名。但 Loper 没画它,也没签它。发帖者只是在评论里说,她让 ChatGPT 做了一张「《纽约客》风格的漫画」。随后 Loper 陆续收到兄弟、陌生人、私信与邮件的询问:「我并非领地意识强的人,但我的名字就是我的名字。这非常像对我人格的侵犯。」

Nieman Lab 的测试把范围拉大:记者记录到超过 15 位《纽约客》漫画家 的签名被 OpenAI 图像生成器在未获许可、未付报酬的情况下使用,包括 Harry Bliss、Emily Flake、Joe Dator、Pat Byrnes、Jason Adam Katzenstein、George Booth、Liza Donnelly、Saul Steinberg 等。Pat Byrnes 的签名有个习惯------结尾带句点,而十几张伪造漫画每一张都精准复刻了那个句点 。值得注意的是法律上的分割带:Cornell 法学院的 James Grimmelmann 指出,签名是真实性的标记 ,但「署名只是合理使用分析中很小的一部分」,版权主张的真正难点在于 ChatGPT 通常并不复制某张具体作品,而是模仿更通用的风格 ;漫画家们更现实的路子或许是 right of publicity (公开权)诉讼,但需要证明这些漫画被用于商业目的。另一个背景是 Condé Nast 2024 年与 OpenAI 签了多年授权协议,而《纽约客》明确表示从未授权任何 LLM 开发商用其漫画训练模型。行业侧的证据也在堆积:去年《巴尔的摩太阳报》解雇了在该报发表 30 多年漫画的普利策入围者 Kevin Kallaugher,今年开始常态化刊发 AI 生成漫画,美国社论漫画家协会发公开信谴责。

4. OpenAI「疯狂28天」首日:提速 50% 无人喝彩,同时给 ChatGPT 塞广告、给文本加隐形水印

来源: 量子位

Codex 负责人 Tibo 立了个「军令状」:接下来 28 天,每天要么交付一项 Codex/Work 的改进,要么来一次完整的额度重置 。第一天他宣布的成果是------GPT-6 Astra 和 GPT-6.1 Sol 的默认推理速度提升约 50% ,达到 50TPS ,官方订阅与「Sign in with ChatGPT」接入的第三方生态(OpenCode、Pi、Amp、Devin 等)同样受益。选速度开刀是因为前面翻过车:9 月 29 日 GPT-6.1 Sol 上线后即使开 Fast 模式也巨慢,被用户起了个外号叫 GPT-6.1 Turtle,Tibo 公开道歉并承诺恢复速度、重置付费账户额度。但评论区的反应说明这刀砍错了地方------满屏冷嘲热讽,无人在意提速。

真正的争议来自同一时间的两件事。其一是给 ChatGPT 塞广告 :官方宣布在图像生成过程中测试全新的视觉广告形式,用户等待生图时会看到赞助商品牌展示图加「了解更多」跳转按钮,并称正与全网几十家归因监测平台合作帮广告主算 ROI。其二是给生成文本加隐形水印 :为满足欧盟 AI 法案要求,未来几周对欧盟地区的 ChatGPT 和 Codex 生成文本添加隐形统计水印,公告里也坦承当前文本水印技术存在巨大局限性 。第三条线是 SemiAnalysis 的最新报告,把订阅商业模式算得很直白:月费订阅本质是高度补贴产品 ,以 Anthropic 为例,订阅费只占总收入的 10% ,却吃掉超过 40% 的推理算力,导致每兆瓦收入减少约 3600 万美元 ;两家公司的应对策略完全分化------Anthropic 选择「温水煮青蛙」,悄悄降低高阶模型的 API 等值价值,OpenAI 则选择更直接的做法。28 天计划本意是留住用户,第一天的实际效果是把「这家公司现在最关心什么」暴露得非常清楚。

5. 五角大楼停止使用 Anthropic 的 Claude

来源: Reddit r/Anthropic

五角大楼宣布已停止使用 Anthropic 的 Claude 模型,这一时点在其截止日期之后数周 。社区的主流判断是这对 Anthropic 影响不大------政府订单在收入结构里占比有限,且切换供应商在国防采购中并不罕见。但把这条放回整条线索看,值得记下的是节奏 :10/1 特朗普的 AI 方案把自我监管交给大科技,10/3 传出政府采购侧的调整,10/5 五角大楼正式表态。政府侧的采购行为正在成为一项独立的政策信号 ,它与技术能力的关系比与合规姿态的关系更弱。真正需要观察的不是这一单,而是下一单会不会有。

6. Anthropic 无理由关停付费账户,拒绝按比例退款,导出功能同时失效

来源: Reddit r/Anthropic

一名用户报告 Anthropic 未说明理由 就关闭了其付费账户,拒绝按比例退款,并且在尝试导出数据时发现导出功能也已失效 。三件事叠在一起才构成问题:无理由封停(不可申诉)、退款政策缺失(经济后果)、导出失效(数据不可带走)。这与 10/4「Claude 在高风险医疗问题上输出退化」、今天的「版本切换箭头消失」同属一类------不是能力问题,而是信任与可迁移性问题 。对企业采购而言,后者的权重往往高于前者,因为它决定了「换不换得掉」。这条与第 4 条 SemiAnalysis 的成本分析互为注脚:当订阅本身是补贴产品时,封停一个高频账户在财务上甚至是「划算」的,但这恰好是订阅制最不该给出的激励。

7. Opus 5.5 显著提速,但 Claude 更新后丢失了消息版本切换箭头

来源: Reddit r/Anthropic · Reddit r/Anthropic · Reddit r/Gemini

三条用户侧信号可以并读。第一,多名用户反馈 Opus 5.5 速度异常快 ,任务在几秒内完成且未切换模式------这与第 4 条 OpenAI 把「提速 50%」当作交付物形成有意思的对照:推理速度正在成为前沿模型的正面竞争项 。第二,Claude 在一次「聊天与工作功能合并」的更新后,用户编辑消息时不再显示版本切换箭头(‹1/2›) ,无法回到之前的版本;这可能是 bug,也可能是被移除的设计,但无论哪种,它削减的是用户对「可回退」的预期。第三,Gemini 用户抱怨促销现金难以实际使用 ,并直言产品体验不如 Kalshi。三条合起来指向同一个提醒:在能力快速迭代期,交互细节与账务细节的退化,会比能力落后更快地消耗用户耐心。

8. 2026 诺贝尔奖双发:物理学奖给「冰下巨眼」,生理学或医学奖给光遗传学

来源: 量子位 · 量子位

物理学奖一人独揽 ,得主是美国威斯康星大学麦迪逊分校的 Francis Halzen ,表彰其对南极冰立方中微子天文台(IceCube)的决定性贡献,以及对天体物理起源高能中微子的发现。技术解法极其硬核:用特制高温热水钻头在南极冰层融出深达两千多米的深孔,把挂满光敏传感器的电缆迅速沉入冰水。关键发现是钻头下潜到 1400 米以下时,高压把气泡全部压碎挤出,冰层纯净到中微子碰撞产生的蓝光能传播 300 米 才被吸收。2011 年完工的 IceCube 深埋于冰下 1450--2450 米,由 86 根电缆、5160 个光学传感器 组成,把整整 1 立方公里天然冰川变成一台望远镜;2013 年首次明确捕捉到来自太阳系以外的高能宇宙中微子。生理学或医学奖颁给 Karl Deisseroth、Peter Hegemann 和 Georg Nagel ,表彰其在光控离子通道和光遗传学 方面的发现------从单细胞绿藻里把光转成电信号的光控离子通道出发(2002--2003 年鉴定并表征 ChR2),到 2005 年 Deisseroth 团队把 ChR2 引入哺乳动物神经元,实现毫秒级精度 诱导动作电位,把神经科学从「观察谁在活跃」推进到「验证到底是谁在控制行为」。两个奖的共同点是:真正的突破都来自把一种天然机制改造成可控工具,而不是发明一个全新的原理。


二、技术与产品更新

1. Dust:让 Transformer 无需反向传播即可预训练

来源: Q Labs

Q Labs 提出 Dust ------第一个在预训练 Transformer 语言模型上能与反向传播竞争 的零阶(zeroth-order)方法。核心技巧是虚拟种群(virtual population) :传统进化策略(如 EGGROLL)每个种群成员都要保留一份扰动权重和一次独立前向,种群规模因此被前向次数锁死;Dust 改用激活空间扰动(node perturbation) ,并且在每个 token 上独立扰动 ------序列里的每个 token 就是一个成员,一次前向并行评估整批成员。一条序列几千个 token,等于一次前向评估几千个成员,比权重空间 ES 的种群大至少三个数量级 。信用分配上,某个 token 的噪声奖励是该 token 及(带衰减 γ 的)后续 token 的损失下降;注意力内部参数不靠 token 损失直接评分,而是通过与注意力输出估计误差的对齐度(式 4)来打分。

结果层面有三点值得记:(1) 在大种群下 Dust 在多个设置中不仅逼近、甚至超过 反向传播,提示在算力充裕的区间存在超越 backprop 的可能;(2) 从 100 万 token 起,Dust 比 EGGROLL 的 Transformer 实现高效 10³ 到 10⁴ 倍 ;(3) 与「零阶方法无法扩展到大网络」的传统认知相反,更大的模型反而更种群高效 ------243M 参数模型在多数种群规模下优于小 120 倍的模型。作者也明确划了边界:目标不是今天就能替代 backprop(算力效率还差得远),而是为「搜索型信用分配」打地基;未训的新架构(外挂程序、多步循环 Transformer)留给后续工作。这条的现实意义在于:它讨论的是「不同可微」这条路还能不能走,而不仅仅是又一个优化器技巧。

2. Opus 5.5 代理发现两种室温磁性半导体候选材料

来源: Vals AI

Vals AI 公开了一项由 Claude Opus 5.5 代理团队 完成的材料发现工作:两种有前景的室温反铁磁半导体 候选。目标是一种叫** Luttinger 补偿(Luttinger compensated, LC)的中间态材料------净磁矩为零(因此不干扰邻近器件、可高密度排布、切换速度比铁磁快约千倍),但同能级的自旋 按能量被分选**(因此可以用自旋电子学方式读写)。存储价值取决于「自旋窗口」:带隙边缘处所有可用电子态自旋一致的能量区间,窗口远大于室温热噪声(约 26 meV)才实用。

两个候选:(1)YBaMnFeO₅ ------代理设计 的新化合物,仅由钇、钡、锰、铁、氧五种元素组成,预测带隙 2.35 eV,空穴自旋窗口 1.0 eV、电子窗口 1.4 eV,磁有序温度原始模拟约 420 K(校准后约 490 K)。问题是需要 Mn 和 Fe 形成完美棋盘格排列,而模拟显示约 950 K 时棋盘格就崩解成随机混合,此类氧化物合成需要 900--1300 °C,标准合成法很可能得到无序晶体,从而丢掉自旋分选 。(2)KVCr(CN)₆ ------1999 年就被合成过的老材料,与普鲁士蓝同族。代理指出它其实是 LC 材料:预测带隙约 2.1 eV,空穴窗口 2.6 eV、电子窗口 1.6 eV,1999 年样品在 376 K 仍保持磁有序;而且它的结构把每种金属锁在各自的位置 (铬连氰根的碳端、钒连氮端),恰好补上了 YBaMnFeO₅ 的短板。2008 年一项研究其实已经画出过它的自旋分选,但当时主题是压力下的磁耦合,没人指出这意味着它是 LC 半导体 。作者把输入文件、原始输出、分析代码、一键校验脚本和已知注意事项全部开源。这条的价值不在「AI 发现了新材料」,而在于公开了完整的计算账本与 caveat 清单------包括模拟方法之间的分歧。

3. CodeLens:在自己的代码库上跑模型基准

来源: Hacker News

CodeLens 让开发者用自己的真实代码库 对 GPT-5、Claude、Grok、Gemini、o3 等模型做基准测试,而不是跑公开榜单。这解决的是一个具体的错配:SWE-bench 之类的公共基准衡量的是「模型在别人的代码上表现如何」,而团队真正需要知道的是「模型在我的代码规范、我的依赖版本、我的历史包袱上表现如何」。这也与今天的第 7 条形成呼应------模型能力差距在企业私有语境里往往会被完全抹平,评估必须以自己的代码为分母。

4. Agent 落地的三条新路径:本地代码审查、真机 iPhone 控制、云桌面代劳

来源: Product Hunt · Product Hunt · Product Hunt · Product Hunt

四个同日上榜的产品可以拼出一张 Agent 落地地图。本地代码审查工具 让用户在自己机器上用自己的 AI 做代码审查,卖点是隐私与可定制------代码不出本机;真机 iPhone 控制 让 AI 代理直接驱动一台真实 iPhone,包括完全没有 API 的应用 ,把「无 API」从不可达变成可达;ruOS 云桌面 把云桌面当成 Agent 的执行环境,代理在其中代表用户完成任务;Etsy 客服 AI 面向电商卖家,秒级回复买家消息。四条合起来说明 Agent 的竞争焦点正在从「模型能不能做」转向「在哪里做、以什么权限做、数据留在谁那里 」------本地优先、真机直控、云桌面隔离、垂直场景先行,本质上都是对权限边界的不同回答。


今日 AI 行业要点

核心趋势 :今天最清晰的一条主线是**「AI 造 AI」的闭环正在从论述走向账本**。Hinton 等 22 人的 RSI 论文没有停留在「智能爆炸」的哲学层面,而是搬出了 Anthropic 与 OpenAI 的内部比例数据------AI 生成代码占比一年内从低个位数到 80% 以上,Claude 在高层次监督下自主完成的研发工作半年内从 1% 涨到 26%。但陶哲轩在同一天给出了这枚硬币的另一面:AI 只在可验证 的环节加速(生成解答、Lean 形式化验证),而理解、评审、写进教科书这三步几乎零进度,于是产生「证明消化不良」。自动化率越高的环节,越是被目标函数驯服过的环节;不被验证的洞见反而成了瓶颈。

重要动态:研发侧,RSI 论文给出闭环的三个层级(完整参与造下一代 AI / 临界点后数年压缩到数月 / 实验室从几千人到数百万人);学术侧,陶哲轩与 Villani 公开转向谨慎,模型公司被喊话「别解数学题了」;版权侧,ChatGPT 伪造《纽约客》漫画家签名被系统记录 15 例以上,真实风险指向风格模仿而非具体作品复制;商业侧,OpenAI 28 天计划首日以「提速 50%」交付,同期上线图像广告与欧盟文本隐形水印,SemiAnalysis 报告揭示订阅补贴的结构性亏损;政务侧,五角大楼停用 Claude,与 10/1 的自我监管方案形成时间上的对照;技术侧,Dust 证明零阶方法可在预训练上逼近甚至超过反向传播,且大模型更种群高效;科学侧,Opus 5.5 代理给出两种室温 LC 半导体候选并开源全部计算账本。

行业观察 :把今天最值得停下来想的三件事放在一起看------RSI 论文、陶哲轩的转向、SemiAnalysis 的补贴报告 。三者描述的是同一个系统的三个位置:能力侧 ,AI 参与研发的自动化率在复利增长,且这条曲线的数据掌握在少数几家实验室手里;验证侧 ,人类群体消化产出的能力没有同步增长,陶哲轩的「知识拥堵」不是模型缺陷,而是流程瓶颈;经济侧 ,把前沿能力卖给个人用户的订阅市场结构性亏损 ------Anthropic 用 10% 的收入吃掉 40% 的推理算力,每兆瓦少赚 3600 万美元。这意味着一个具体的推论:如果订阅制不能自我维持,那么「AI 造 AI」的复利就更可能先服务于把算力换成下一代能力的实验室,而不是先服务于普通用户 。今天的所有新闻------从 OpenAI 在生图流程里塞广告、给欧盟文本打水印,到 Anthropic 无理由封停高频付费账户------都可以读成同一件事的不同侧面:补贴期正在结束,而能力曲线还在陡升。


推荐学习资源

  • 从零开始打造一个AI Agent CLI --- 手把手打造 Agent CLI,理解 Agent 的权限边界设计(本地优先 / 真机直控 / 云桌面隔离)与执行环境抽象。
  • AI Agents 开发实践 --- 掌握 Agent 工程落地:从可验证目标函数的设计,到企业级 Agent 的可观测与可回退。

新闻来源