OpenAI 在 DevDay 上把常驻智能体 Dots 推向付费用户,底层由 GPT-6 Astra 驱动、跑在独立云端计算机上① MarkTechPost;Anthropic 则用 Claude Sonnet 5.5 把 Terminal-Bench 4.0 推上 70.6%① MarkTechPost。模型、智能体与安全三条技术线同日交汇,本文按技术主题拆解。
主题节 1:常驻智能体 Dots:云端计算机架构与安全机制
Dots 的架构设计值得开发者关注:每个 Dots 由 GPT-6 Astra 驱动,运行在带浏览器的独立云端计算机上,与用户笔记本隔离;通过 ChatGPT 插件可触达 4000 多个应用,用户下线后仍持续运行并从反馈中学习偏好① MarkTechPost。每个用户初始获得 1 个主 Dots,产品向 ChatGPT Pro 与 Business Premium 订阅者推出,Enterprise、Edu 与 Healthcare 在管理员开启后进入 Beta;没有自托管或开放权重选项① MarkTechPost。
从工程视角看,Dots 的安全机制分层清晰:无任务时以只读连接主动寻找可帮忙之处(proactive research),不能发消息或修改内容;涉及账户或信息共享的操作必须先通过 auto-review 检查;监控系统可在安全担忧时暂停或停止智能体;上下文随智能体跨渠道跟随(Slack、Teams)② SiliconANGLE AI。OpenAI 还预告了专业智能体:由雇主配置独立身份与凭据、负责单一明确工作,并已与微软合作,使其可通过 Agent 365 的治理与安全控制来管理② SiliconANGLE AI。
对开发者而言,这套"常驻智能体 + 云端计算 + 审批流"的组合正在成为平台形态的模板。Meta 同期宣布围绕 Muse 构建企业 AI 平台,产品包括 Muse、Meta Business Agent、Muse API 与 Muse Code③ TLDR AI;TechCrunch 则分析,OpenAI 正把 ChatGPT 建成软件可被发现、可被人与 AI 智能体共同使用的地方,直接挑战传统应用商店模式④ TechCrunch。底层模型的性能数据值得记录:在 OpenAI 的延迟模拟中,GPT-6 Astra 在 OSWorld 2.0 上得分 72.6%、每任务约 40 分钟,GPT-5.6 Sol 得分 65.7%、约 75 分钟------常驻智能体的体验高度依赖底层模型的计算机使用能力① MarkTechPost。
# 以下为根据公开摘要信息对 Dots auto-review 检查流程的理解示意
# 具体实现请查阅 OpenAI 官方技术文档
def auto_review(dot, action):
# 涉及账户或共享信息的操作必须先通过检查
if action.touches("account") or action.touches("shared_info"):
decision = policy_engine.evaluate(action)
if decision == "approve":
return execute(action)
if decision == "pause":
monitoring.pause(dot) # 监控系统可暂停或停止智能体
return None
return deny(action)
# 无任务时只读 proactive research,不触发写操作
if dot.idle():
return read_only_probe(dot.connected_apps)
⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
主题节 2:大模型速递:GPT-6.1 Sol、Claude Sonnet 5.5、Qwen-Audio-3.1、Liquid d1
GPT-6.1 Sol 是今日性能/价格比最突出的发布:标准 API 输入与输出 token 价格仅为 Astra 的五分之一,每百万 token 仅 10 美分;据 OpenAI 称,它在 DeepSWE 1.1 上以约五分之一的任务成本达到 GPT-6 Astra 的水平,同时比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点,并在计算机使用任务上比 GPT-6 Sol 高 7% 以上⑤ OpenAI Blog。该模型已在 Amazon Bedrock 正式可用,客户可把 Codex 配置为在 Bedrock 上使用它完成调研、实现与测试等工作⑥ AWS ML Blog。
Anthropic 发布 Claude Sonnet 5.5,定位为 Opus 5.5 的更快、更低成本补充:输出生成快 30% 以上、单任务成本最多低 30%,在 Terminal-Bench 4.0 上达 70.6%(Sonnet 5 为 10.3%),定价保持每百万 token 输入 2 美元、输出 10 美元不变;1M token 上下文、128K 最大输出,OSWorld 2.1 计算机使用 80.1%、人类最后考试(带工具)64.5%(以上基准均为发布稿中厂商自报数据)① MarkTechPost。
语音侧,阿里 Qwen 团队发布 Qwen-Audio-3.1 音频栈,主模型 Qwen-Audio-3.1-Realtime 是面向可调用工具的语音智能体的全双工语音模型,上下文 262K token,并通过 WebSocket 在 QwenCloud 提供托管 API;降价幅度显著:Realtime 约降 85%、TTS 约降 70%、ASR 最多降 95%① MarkTechPost。细分场景侧,Liquid AI 发布 d1 决策模型:面向分类、工单路由、评分、内容审核等结构化选择,单次调用返回一组固定结果上的校准概率,生成 token 数为零;提供 Noul(是否题)、Choice(命名集合选择)、Score(有序量规评分)三个原语,可混在同一个请求中① MarkTechPost。Liquid AI 的迁移指南给出简单规则:如果答案是 N 个已知选项之一,就用决策模型;如果模型必须组合出新的字符串,就继续用 LLM① MarkTechPost。
主题节 3:自我改进研究密集落地:RRSI、SAGE、DASA
自我改进(self-improvement)是今日学术侧的密集主题。Google Research 与北卡罗来纳大学教堂山分校、斯坦福大学等开源 RRSI(正则化递归自我改进):允许 LLM 智能体重写自己的框架(提示词、工具、记忆、控制流与子智能体)而模型权重不变;为对抗"框架演化循环过拟合演进集"的问题,RRSI 研究指出三种失败模式------基准特定拟合、噪声追逐与复杂度累积,并在提案侧引入退火编辑预算(余弦调度,早期轮次可捆绑多个编辑,后期只允许单个可归因变更)、证据感知信用记录(每个候选连同组件、假设、diff、分数变化与成本变化一起记录)、结构化探索(进展停滞时预算转向未触碰组件),在选择侧引入泄漏评论者(打分前拒绝任务名、实体、答案或基准特定逻辑)、噪声调整下限(增益须超过未改动基座框架上测得的方差)、成本规则(额外推理 token 必须由测得的增益买单)与剪枝------研究团队将编辑预算类比 L0、剪枝类比 Lasso(L1)① MarkTechPost。代码为 Apache 2.0 许可,接受任意 LiteLLM 模型字符串,默认配置为 Vertex AI 上的 Claude Opus 4.8① MarkTechPost。
arXiv 上的 SAGE 论文则聚焦"自我演化智能体的门控":现有规则只在聚合验证分数提升时保留编辑,会引入永久性倒退并受"优化器诅咒"影响。SAGE 通过逐条配对比较(在同一批验证条目上对比当前技能与编辑后技能)加单侧配对检验,仅在收益相对损失统计可靠时提交编辑,否则弃权。跨 5 个基准、20 组设置中,SAGE 在 19 组降低倒退率(如 DeepSeek-V4 下 LiveMath 倒退率从 36.5% 降至 0%),并在全部 20 组取得最高最终分数(LiveMath 从 34.15 提升至 48.78)⑦ arXiv cs.AI。
# 以下为根据公开摘要信息对 SAGE 统计接受门逻辑的理解示意
# 具体实现请查阅论文原文(arXiv 2609.36043)
def accept_edit(current_skill, proposed_edit, eval_items):
scores_cur = evaluate(current_skill, eval_items) # 同一批条目上的基线分数
scores_new = evaluate(proposed_edit, eval_items) # 编辑后的逐条分数
diffs = paired_diff(scores_new, scores_cur) # 逐条配对比较
if one_sided_paired_test(diffs).significant(): # 单侧配对检验
return commit(proposed_edit) # 收益统计可靠才提交
return abstain() # 否则弃权
⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
另一项 DASA 研究追问"人类可读文本对微调是否必要":利用冻结参考模型的激活梯度反馈引导连续合成输入嵌入的优化,所得嵌入直接用于下游微调;实验覆盖 Llama 与 Qwen 系列 6 个模型(1B 至 32B 参数)以及涵盖知识、数学推理、代码生成与常识推理的 6 个基准,在相同 LoRA 设置下达到与源自然语言数据相当的性能并在多种配置下超越,相对 GRADMM 实现 3.6 至 4.9 倍加速⑦ arXiv cs.AI。
主题节 4:计算机使用与空间智能:Holo4 开放权重、AMD 收购 World Labs
H Company 发布 Holo4 开放权重计算机使用模型家族,同一套权重可在屏幕上点击与输入、编写代码并调用 MCP 或 API 工具,覆盖桌面、网页、Android、代码沙箱与业务 API;提供 Holo4 27B(稠密,由 Qwen3.8-27B 微调)与 Holo4 35B-A3B(MoE,3B 激活,基于 Qwen3.6-35B-A3B)两个尺寸。据 H Company 基准表,27B 在 OSWorld 上得分 85.2%、单任务成本 0.08 美元,AndroidWorld 上达 85.1%;长流程仍有差距:OSWorld 2.0 上 27B 得分 61.7%、单任务 1.22 美元,而 Claude Opus 5.5 为 81.8%、8.48 美元;AutomationBench 上 27B 得分 45.4%、单任务 0.05 美元(厂商自报数据)。35B-A3B 以 Apache 2.0 开放商业自托管,27B 权重为 CC BY-NC 4.0,两者都在 H Models API 上提供 256K 上下文① MarkTechPost。
空间智能侧,AMD 宣布以约 82 亿美元全股票交易收购 World Labs,预计年底前完成、尚待监管批准;创始人李飞飞将出任 AMD 首席科学家,空间智能研究团队整体并入⑧ Ars Technica。World Labs 由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 于 2024 年创立,成立时融资 2.3 亿美元,其中部分来自 AMD;其"世界模型"旨在对物理世界提供有用的预测性模拟⑧ Ars Technica。对 AMD 而言,这既是补齐与 Nvidia 竞争中的软件与模型层短板,也意味着头部芯片厂商开始把"理解物理世界的能力"视为下一代 AI 基础设施的关键拼图⑧ Ars Technica。按 AMD 的表述,World Labs 的模型专长将帮助塑造 AMD 未来的 AI 硬件、软件与系统③ TLDR AI。
主题节 5:企业智能体安全与治理:硬件看门狗、Fusion Claw、身份边界
智能体安全正在从软件防线下沉到硬件层。Nvidia 发布 Open Agent Safety Platform,把 OpenShell 安全运行时与 Sentry 硬件看门狗结合,用于监控智能体行为并执行策略,同时覆盖软件与硬件控制,并设计为支持第三方算力平台③ TLDR AI。企业应用侧,Oracle 推出 Fusion Claw 智能体软件运行时:把用于推理与规划的大语言模型与用于计算和事务处理的常规软件结合,仅在需要推理时调用模型,事务与计算在模型之外完成;Claw 运行在隔离环境中,防止语言模型直接更新 Fusion 业务对象,任务完成后生成"Outcome Receipt"(含所应用的政策、决策与执行的事务)② SiliconANGLE AI。
治理缺口的数据同样触目:RSA 披露一家中等规模银行审计发现其企业内运行着超过 4000 个影子智能体,Gartner 预计到 2028 年一家典型财富 500 强企业将运行约 15 万个 AI 智能体(2025 年不足 15 个),只有 13% 的组织认为自己的智能体治理到位① MarkTechPost。数据连接公司 CData 也发布 Connect AI Gateway,让 IT 团队在单一位置注册模型、MCP 服务器与智能体并为权限设定规则,并加入上下文引擎,复用 Fivetran 的 dbt 与微软 Power BI 等工具中维护的业务定义② SiliconANGLE AI。身份厂商的应对是"急停开关"与任务级权限:Okta 为 AI 智能体推出运行时强制与更广的"急停开关",用于撤销被攻破智能体持有的全部活跃 token② SiliconANGLE AI。支付行业给出了边界范本:金融科技公司 Equals Money 让客户的 AI 工具可读数据但不可动资金------客户控制的智能体对数据访问为只读、非敏感内容可写入,客户不能通过 MCP 发起支付;AI 现在大约撰写其 92% 的代码② SiliconANGLE AI。员工侧的采用速度也在倒逼治理:据 Omnissa《2026 数字工作空间现状》报告,2025 年企业终端上 AI 助手应用使用量增长近 1000%,其中约四分之三来自未经批准的工具② SiliconANGLE AI。
趋势判断
基于今日快讯可归纳出三条跨领域趋势。其一,智能体从"对话"走向"常驻",产品化与安全治理同步提速 :Dots 把常驻智能体打包成订阅产品,Meta 用企业平台跟进,而 auto-review、专业智能体身份与 Agent 365 治理表明安全控制正在成为产品标配(支撑来源:①、②、③、④)① MarkTechPost② SiliconANGLE AI③ TLDR AI④ TechCrunch。其二,高性能模型进入降价周期,性能/价格比成为竞争焦点 :GPT-6.1 Sol 以五分之一价格逼近 Astra、Claude Sonnet 5.5 保持 2/2/2/10 的同时单任务成本降 30%、Qwen 语音全线降价 70%-95%,企业选型逻辑从"追最强"转向"按任务定档"(支撑来源:①、⑤、⑥)① MarkTechPost⑤ OpenAI Blog⑥ AWS ML Blog。其三,智能体安全从软件防线下沉到芯片层与身份边界:Nvidia 用 Sentry 硬件看门狗、Oracle 用隔离运行时、Okta 用急停开关,安全控制不再放在被控对象内部(支撑来源:①、②、③)① MarkTechPost② SiliconANGLE AI③ TLDR AI。
结尾
今天的技术侧信号是"产品化与安全化并行":常驻智能体、低成本旗舰模型、自我改进研究与硬件级安全控制同场推进。后续值得关注两点:一是 Dots 的 auto-review 与专业智能体身份方案能否成为行业事实标准;二是 GPT-6.1 Sol 与 Claude Sonnet 5.5 的价格战会否把"性能/价格比"变成模型选型的默认指标。
【资讯来源】本文综合整理自 MarkTechPost、SiliconANGLE AI、TLDR AI、TechCrunch、OpenAI Blog、AWS ML Blog、arXiv cs.AI、Ars Technica 等公开信息源。 ① MarkTechPost, 2026年09月30日 02:30 北京时间 / 09月29日 11:30 美西时间 ,② SiliconANGLE AI, 2026年09月30日 06:31 北京时间 / 09月29日 15:31 美西时间 ,③ TLDR AI, 2026年09月29日 21:29 北京时间 / 2026年09月29日 06:29 美西时间 ,④ TechCrunch, 2026年09月30日 04:15 北京时间 / 09月29日 13:15 美西时间 ,⑤ OpenAI Blog, 2026年09月29日 18:00 北京时间 / 2026年09月29日 03:00 美西时间 ,⑥ AWS ML Blog, 2026年09月30日 03:34 北京时间 / 09月29日 12:34 美西时间 ,⑦ arXiv cs.AI, 2026年09月30日 12:00 北京时间 / 09月29日 21:00 美西时间 ,⑧ Ars Technica, 2026年09月30日 05:14 北京时间 / 09月29日 14:14 美西时间
【免责声明】 本日报为AI行业每日公开信息汇总整理,仅供读者快速了解行业动态,不构成任何投资建议。所有信息均来源于公开渠道,本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速,内容发布后可能发生更新,请以官方最新信息为准。据此作出的任何决策,全部风险自担。© 2026 林伽一 · AI科技日报
#常驻智能体 #GPT-6.1Sol #自我改进 #智能体安全 #空间智能