今天技术栈出现两处底层改写。模型侧,一类只返回选项、评分与概率的决策模型在三周内从单一产品变成多家竞逐,且几乎都主动兼容 TypeSafe AI 的 Jev 接口① MarkTechPost② TLDR③ TLDR AI,AWS Strands Labs 的 Strands Decider 2B 甚至用一个小型指针头取代了解码循环① MarkTechPost。算力侧,DeepSeek-V4.1-Flash 把整个输入缓存压到每 token 890 字节,缓存占用被直接写进计价表④ The Batch @ DeepLearning.AI,而英伟达的 Shield TV Pro 因元器件成本上涨即刻提价 100 美元⑤ Ars Technica。本文按技术主题拆解这四条线。
主题节 1:决策模型------输出概率而非文本,接口兼容成为扩散通道
决策模型与生成式模型的分工是明确的:它读取一个输入状态与一组类型化问题,为每个允许的答案返回概率,不产生自由文本。TypeSafe AI 的 Jev 支持三种原语------Choice(从最多 255 个选项中选一个)、Score(按有序等级评分)、Noul(某陈述为真的 0 到 1 概率);每个问题都针对同一状态并行且独立评估,增加问题几乎不改变响应时间。其训练方法是"校准决策强化学习"(RLCD):RLHF 优化人类偏好,RLCD 优化的是校准概率,即更高的置信度应意味着更高的准确率。公开定价为每百万输入 token 0.042 美元、输出免费,端到端响应时间 70 至 500 毫秒① MarkTechPost。
开源实现的工程细节值得开发者注意。AWS Strands Labs 的 Strands Decider 2B 以 Qwen3.5-2B-Base 为起点,丢弃语言建模头,替换为一个约 100 万参数的小型指针头;该头将 <answer> 位置的隐藏状态与每个选项最后一个 token 的隐藏状态比较,一次前向传播即得结果,无需解码循环;主体采用 rank-16 LoRA,头部以 fp32 运行,标签集来自请求因此选项数量不受限制。其内置服务器绑定 127.0.0.1 且无认证,生产环境需自建鉴权层① MarkTechPost。Cloudflare 的 Clef 与 Clef-flash 完全兼容 Jev API,已运行在 Workers AI 上、权重发布于 Hugging Face 供自托管② TLDR;Kev 覆盖 0.8B 至 27B 四个规模,但 27B 模型的完整训练语料与部分评测数据未公开③ TLDR AI。
# 以下为根据公开摘要信息对决策模型公开参数的理解示意
# 具体实现请查阅 TypeSafe AI 与 AWS Strands Labs 官方技术文档
decider_public_spec = {
"question_types": ("choice", "noul", "score"), # Jev 三种原语
"options_max": 255, # Choice 选项上限
"output_type": "typed_probabilities", # 不生成自由文本
"weights_license": ("MIT", "Apache-2.0"), # 小米 MIT / Strands Apache-2.0
"checkpoint": "v19", # Strands Decider 发布检查点
"params_billion": 1.9, # Strands Decider 2B 参数量
"latency_ms_range": (70, 500), # Jev 端到端响应时间
"server_bind": "127.0.0.1", # 内置服务器绑定地址(无认证)
}
⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
主题节 2:算力与成本------缓存按字节计价,开放权重登顶与硬件涨价并存
成本治理的第一战场已经从"每 token 价格"转到"每 token 缓存占用"。DeepSeek-V4.1-Flash 的架构是编码器-解码器混合专家 Transformer,5520 亿主干参数外加 1960 亿记忆模块参数,读取输入时每 token 激活 80 亿、生成输出时激活 160 亿;其解码器从编码器末层派生键值、并跨层共享缓存,40 层中只有 4 层需要计算完整输入缓存,从而把整个输入缓存压缩到每 token 890 字节------约为 DeepSeek-V4-Flash 的四分之一、DeepSeek-V1 的 1/437。输入从 4000 token 增长到 100 万 token 时,生成每个输出 token 所需的计算仅上升 25%④ The Batch @ DeepLearning.AI。
# 以下为根据公开摘要信息对 DeepSeek-V4.1-Flash 公开架构参数的理解示意
# 具体实现请查阅 DeepSeek 官方技术文档
deepseek_v41_flash_spec = {
"backbone_params": "5520亿", # 主干参数
"memory_module_params": "1960亿", # 记忆模块参数
"active_params_read": "80亿", # 读取输入时每 token 激活
"active_params_write": "160亿", # 生成输出时每 token 激活
"full_input_cache_layers": "4/40", # 仅 4 层需完整输入缓存
"cache_bytes_per_token": 890, # 输入缓存压缩结果
"compute_growth_4000_to_1M": "25%", # 输入增长时的每输出 token 计算增幅
"api_price_per_million": {"peak": (0.30, 0.006, 1.20)}, # 输入/缓存/输出
}
⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
供给侧的格局也在变化。开放权重模型本周在权威榜单上登顶,登顶者是小米:MiMo-V2.6-Pro-RL 在 Artificial Analysis 智能指数上以 46 分位列开放权重模型第一,较小的 MiMo-V2.6-Flash 以 59.58% 在 Vals Index 开放权重模型中居首;小米还公开了 7000 多个强化学习任务环境及训练代码,三个模型均可在 MIT 许可下免费下载,用于商业与非商业用途④ The Batch @ DeepLearning.AI。但硬件侧的成本正在上行:英伟达以"包括内存在内的元器件成本在全行业大幅上涨"为由,将上市 7 年的 Shield TV Pro 即刻提价 100 美元、新价格 299.99 美元⑤ Ars Technica。硬件形态另一侧则出现面向本地智能体的桌面系统:英伟达发布 DGX Spark 的 64GB 配置,稀疏条件下最高 1 petaFLOP 的 FP4 AI 算力、64GB LPDDR5x 统一内存(带宽 273 GB/s),其给出的时机理由是智能体的工具调用与长上下文使 token 消耗自 2026 年初以来增长了 14 倍,而在自有硬件上没有按 token 计费① MarkTechPost。对开发者而言,模型能力价格与部署账单正在反向移动。
主题节 3:智能体工程------无中心协作、逐项自查与训练框架扩展
协作规模开始被当作独立的扩展维度来测。微软的 Agensh 取消了中心编排器,让多达 1024 个编码智能体自行认领工作、共享发现并围绕同一工作区组织起来;团队在 ProgramBench 中最难的五个任务上测试,这些任务要求智能体从零重建 FFmpeg、PHP 等程序⑥ AGI Weekly (VentureBeat)。这一路线的风险也被同时压力测试:研究人员先给最初几个智能体错误信息,再让其余智能体阅读它们说的话,用以观察智能体蜂群如何把早期错误演变为共识、以及改变对话规则能否阻止这一过程⑥ AGI Weekly (VentureBeat)。
研究型智能体则在"自查"上取得进展。北京人工智能研究院(BAAI)的 AREX 通过反复循环"收集证据、反思暂定答案、发起针对性后续检索"来打磨成果;当暂定答案未能满足全部要求时,逐条核查可揭示哪些要求仍未获支持、可用证据在何处相互冲突,智能体不必丢弃答案,而可保留已确认部分、把未满足的要求作为下一轮研究的问题。在 BrowseComp 上,基于微调 Qwen3.5-122B-A10B 的 AREX 系统准确率达 82.5%,在 WideSearch-en 上 F1 为 82.0%④ The Batch @ DeepLearning.AI。工具侧,谷歌研究人员构建的 AIM 能组织研究想法、筛选有前景的方向、审计实现是否与想法相符,并在各搜索分支之间分配实验资源③ TLDR AI。
# 以下为根据公开摘要信息对 AREX 迭代执行框架的理解示意
# 具体实现请查阅北京人工智能研究院官方技术文档
arex_loop = {
"steps": ("collect_evidence", "reflect_draft", "targeted_followup_search"),
"on_unsupported_requirement": "保留已确认部分,将未满足项转为下一轮研究问题",
"bench": {"BrowseComp": "82.5%", "WideSearch-en": "82.0%"}, # 官方报告口径
"finetuned_backbones": ("Qwen3.5-4B", "Qwen3.5-122B-A10B"),
}
⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
主题节 4:安全与权限治理------内核隔离、分级准入与平台闸门
安全侧的动作同时落在工程与治理两层。工程层,Anthropic 指出 GLM-5.3 能够构建复杂的漏洞利用程序,且其安全护栏相对容易被绕过;其研究显示,在消耗相当数量 token 的情况下,GLM-5.3 在 ExploitBench 部分任务上的漏洞利用尝试成功率为 12%,而闭源权重的 Claude Mythos 为 14%,且仅花费 20.40 美元的 GLM-5.3-Flash token 额度,就足以发现 Google Chrome 中一个近期披露的漏洞④ The Batch @ DeepLearning.AI。这组数据对防守方的含义很直接:发现成本正在下降,自查暴露面比等待最强模型更实际。
治理层则出现"分级释出"与"平台闸门"两条线。谷歌称 Gemini 4 Argon 在编码、网络安全与专业工作相关的多项基准上领先竞争对手,但并未按惯例直接公开发布,而是先从受信任的网络防御者开始⑥ AGI Weekly (VentureBeat)。平台侧,苹果在周五的更新中宣布为 macOS 的"全盘访问"增加新的控制措施,要求真正希望授予某应用这种极高访问权限的用户,只能通过"非常明确的用户操作"完成授权⑦ TechCrunch。触发点是 Meta 的通用 AI 智能体 Muse:专栏作家 Jason Aten 称 Muse 向他推送了一条引用其 Apple Messages 对话线程的未经请求通知,而他从未授权;Meta 发言人 Andy Stone 则反驳称访问"完全由用户主动选择"⑦ TechCrunch⑧ The Verge AI。企业场域里,NetApp 选择以一致的数据平面加人类与智能体共享的统一控制平面,让客户为整个机群设定策略与边界,智能体则在这些边界内维持基础设施运行⑨ SiliconANGLE AI。响应速度的紧迫性也被量化:CrowdStrike 首席 AI 官 Bartley Richardson 称其在 2025 年观测到的最快网络犯罪攻击者"突破时间"仅为 27 秒,由此与 CoreWeave 结合安全数据与训练、推理算力⑨ SiliconANGLE AI。
主题节 5:开源与学术------抽取基准、语音转写与"Claude 形状"的科学
开源基准的不透明问题有了统一标尺。Datalab 发布的 OmniExtractBench 汇集 4 个现有基准中的 620 份文档,由同一个确定性评分器统一打分并解释每一次判定;每个任务给系统一份 PDF 和一个 JSON schema,系统返回 JSON 后再与金标准文件逐值比对。评分器以 omni-extract-bench 之名从 PyPI 安装(v0.1.7,Python 3.11+,仅依赖 SciPy),代码托管在 GitHub,数据在 Hugging Face 上以 CC BY 4.0 发布① MarkTechPost。
语音工程侧的规格也在补齐。微软发布的 MAI-Transcribe-2-Streaming 可提供 60 种语言的低延迟实时转写,并支持自动、连续的语言检测;MAI-Voice-2.1 支持 23 种语言与 26 个地区变体③ TLDR AI。训练框架方面,AI2 的 Olmo-core 3 作为开放训练框架,目标是把混合专家模型扩展到万亿参数级③ TLDR AI。科学应用则呈现边界:Anthropic 称 Claude 为一个数学家数十年未能解决的概率问题给出了证明,而"Claude 形状"的科学问题------即 LLM 能力恰好擅长的任务------虽能快速产出技术性解法,要具备实际相关性仍需领域专家修正④ The Batch @ DeepLearning.AI③ TLDR AI。
趋势判断
基于今日快讯,可归纳出三条跨领域趋势。其一,模型输出范式分化:决策模型与生成模型分工 :Jev 用概率回答固定问题集合、Strands Decider 用指针头一次前向出结果,与继续逐 token 生成的大模型形成互补,开发者可按任务性质选择"打分式"委派(支撑来源:①②③)① MarkTechPost② TLDR③ TLDR AI。其二,成本治理从单价转向占用,且与硬件成本反向移动 :DeepSeek-V4.1-Flash 把输入缓存压到每 token 890 字节并写进计价表,同时小米 MiMo 让开放权重登顶权威榜单、英伟达则因元器件涨价给老设备提价 100 美元(支撑来源:④⑤)④ The Batch @ DeepLearning.AI⑤ Ars Technica。其三,前沿能力准入从"发布控制"走向"分级治理":谷歌先从受信任网络防御者放行 Argon、苹果为全盘访问加上"非常明确的用户操作"前提,而开放权重 GLM-5.3 的网络能力已逼近闭源 Mythos(支撑来源:④⑥⑦)④ The Batch @ DeepLearning.AI⑥ AGI Weekly (VentureBeat)⑦ TechCrunch。
结尾
今天的技术信号集中在四处:决策模型以概率输出与指针头把判断环节独立出来,DeepSeek 把成本标尺挪到每 token 缓存占用,智能体协作与自查都出现可量化的工程进展,而能力准入则在平台闸门与开放权重逼近之间被重新定义。后续值得关注两点:一是决策模型的接口兼容能否沉淀为事实标准;二是缓存占用与硬件涨价的双向拉扯会如何改写端侧推理的部署选择。
【资讯来源】本文综合整理自 MarkTechPost、TLDR、TLDR AI、The Batch @ DeepLearning.AI、Ars Technica、AGI Weekly (VentureBeat)、TechCrunch、SiliconANGLE AI、The Verge AI 等公开信息源。 ① MarkTechPost, 2026年10月03日 11:31 北京时间 / 10月02日 20:31 美西时间 ,② TLDR, 2026年10月02日 18:55 北京时间 / 2026年10月02日 03:55 美西时间 ,③ TLDR AI, 2026年10月02日 21:42 北京时间 / 2026年10月02日 06:42 美西时间 ,④ The Batch @ DeepLearning.AI, 2026年10月02日 14:40 北京时间 / 10月01日 23:40 美西时间 ,⑤ Ars Technica, 2026年10月02日 22:52 北京时间 / 2026年10月02日 07:52 美西时间 ,⑥ AGI Weekly (VentureBeat), 2026年10月03日 01:30 北京时间 / 10月02日 10:30 美西时间 ,⑦ TechCrunch, 2026年10月03日 02:11 北京时间 / 10月02日 11:11 美西时间 ,⑧ The Verge AI, 2026年10月02日 20:00 北京时间 / 2026年10月02日 05:00 美西时间 ,⑨ SiliconANGLE AI, 2026年10月03日 01:37 北京时间 / 10月02日 10:37 美西时间
【免责声明】 本日报为AI行业每日公开信息汇总整理,仅供读者快速了解行业动态,不构成任何投资建议。所有信息均来源于公开渠道,本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速,内容发布后可能发生更新,请以官方最新信息为准。据此作出的任何决策,全部风险自担。© 2026 林伽一 · AI科技日报
#决策模型 #缓存压缩 #开放权重模型 #智能体治理 #抽取基准