2026 年 9 月 9 日的苹果秋季发布会上,全新 Siri AI 是绝对主角。据 Bloomberg 记者 Mark Gurman 报道,驱动它的不再是苹果自研的云侧模型,而是苹果向 Google 定制的 Gemini------约 1.2 万亿参数、MoE 架构、年费约 10 亿美元。这个数字是什么概念?它是苹果自研云模型(约 1500 亿参数)的约 8 倍。
对开发者而言,真正有价值的不是"苹果认输了"这种标题,而是这次官方少有地公开了完整的推理分层:端侧小模型、私有云计算、以及外部超大模型,三条路径按请求复杂度动态路由。这套架构怎么分工、边界在哪、第三方 App 如何接入,是本文要拆的东西。
一、先纠正一个常见误读:三层架构不是发布会才有的
很多报道把"三层架构"写成发布会当天的重磅。实际上,苹果在 WWDC 2026(6 月 8 日)就已经官方拆解过完整的模型家族:第三代 Apple Foundation Models(AFM 3),一共 5 个模型,2 个端侧 + 3 个云侧。
具体是:
| 模型 | 位置 | 定位 |
|---|---|---|
| AFM 3 Core | 端侧 | 3B 稠密模型,轻量任务与路由调度 |
| AFM 3 Core Advanced | 端侧 | 20B 稀疏模型,原生多模态 |
| AFM 3 Cloud | 苹果数据中心 | 中等复杂度云侧任务 |
| ADM 3 Cloud (Image) | 苹果数据中心 | 图像生成 |
| AFM 3 Cloud Pro | Google Cloud | 复杂推理与 agentic 任务 |
这里有个特别值得注意的措辞对照。苹果官方描述这几个模型时的原话是"custom-built in collaboration with Google"------官方承认与 Google 合作定制,但全程不点名 Gemini。而媒体口径直接写"苹果用 Gemini 驱动 Siri"。
说实话,这两种说法并不矛盾:官方说的是"合作定制的模型家族",媒体说的是"这个定制的底座是 Gemini"。写博客时我把两句话并列,比只引一边更接近事实。

二、端侧两个模型:一个负责路由,一个负责干活
端侧的两个模型分工很清楚,规格也是苹果这次少见的公开。
AFM 3 Core 是 30 亿参数稠密模型,每次请求全量激活。支持文本 + 图像输入、文本输出,定位是轻量任务与 routing/调度。注意这个"routing"------它就是三层架构的第一层决策者:先由端侧判断这个请求该本地处理还是往上抛。它跑在所有 Apple Intelligence 机型上(iPhone 15 Pro 及以后)。
AFM 3 Core Advanced 是 200 亿参数稀疏模型,原生多模态,通过 Instruction-Following Pruning 按 prompt 只激活 10~40 亿参数。因为要吃更多内存,只给内存更大的新机型。
苹果还少见地公开了一组自评数据(注意是自家人类评估,非第三方基准测试):新一代表现力语音得分 4.15/5,上一代为 3.87。自评数据要打折看,但至少说明端侧这一层不是摆设。
端侧这条线的算力底座是 A20 Pro。它是苹果首款用于 iPhone 的 2nm 芯片,搭载于 iPhone 18 Pro / Pro Max 与折叠屏 iPhone Duo。关键变化:
- 神经引擎从 A19 Pro 的单组 16 核,改为双组 16 核、合计 32 核,AI 处理能力翻倍;
- 新增含 GPU 内部神经加速器的新一代加速器,FP8 运算速度提升至 2 倍,把 ML 运算分散到 SoC 更多单元;
- 内存带宽提升 50%,苹果称是 iPhone 中内存接口最宽的芯片。泄露说法是 96 位 LPDDR5X(上代 64 位),官方未披露位宽;
- 封装用 WMCM 晶圆级多芯片模组替代 InFO_PoP,内存与 SoC 并排而非堆叠以避开散热路径,均热板面积扩至三倍。
带宽 +50% 这条其实比"32 核"更值得关注。稀疏模型推理的瓶颈经常不在算力而在显存带宽,20B 稀疏模型能在端侧跑起来,靠的就是这个。
三、PCC 首次走出苹果数据中心:这才是最微妙的架构变化
第三层是 Private Cloud Compute(PCC)。PCC 是苹果 2024 年随第一代基础模型引入的隐私框架,此前只跑在苹果数据中心的 Apple Silicon 服务器上,卖点是可被第三方研究者独立验证。
AFM 3 里,这个边界被打破了。三个云模型中,只有 AFM 3 Cloud Pro 搬到了 Google Cloud 托管的 NVIDIA GPU 上,其余两个(AFM 3 Cloud、ADM 3 Cloud Image)仍在苹果自己的 Apple Silicon 服务器上。而 Cloud Pro 恰恰是处理复杂推理与 agentic 任务的------也就是 Siri 那些"跨 App 多步操作"的重活。
苹果的处理方式是:硬件换了、机房换了,但仍然把 Cloud Pro 纳入 PCC 隐私框架。
这段设计正好解释了此前各家媒体对"Gemini 到底跑在 PCC 里还是 Google Cloud 上"的争论------两种说法是同一件事的两面:物理上在 Google Cloud 的 NVIDIA GPU,逻辑上归属 PCC 隐私承诺。作为开发者,看到这里应该能意识到一件事:PCC 从"一个机房概念"退化成了"一套契约概念"。它约束的是数据处理承诺,不再是物理隔离。这个转变对隐私叙事的影响,可能比模型本身更长远。
顺便说个可用于理解规模的数字:苹果称 Siri 每天处理超过 25 亿次请求。三层路由不只是技术问题,更是成本问题。

四、跨 30 万 App 是怎么做到的:App Intents 2.0
新 Siri 最出圈的能力是跨 App 代理操作,官方口径是覆盖 30 万+ 第三方 App。这件事在开发者侧的落点是 App Intents。
关键前提:SiriKit 已被废弃。 苹果在 WWDC 2026 上宣布废弃旧的 SiriKit,给了 2~3 年支持窗口。App Intents 成为 Siri 调用第三方 App 的唯一路径------没有发布 App Intents / App Entities 的 App,会被"从 agentic 工作流中剔除"。翻译一下:不接入等于对 Siri 不存在。
App Intents 2.0 新增了三项能力:流式响应、多轮追问、屏幕感知。官方演示的跨 App 多步任务是:"找出 Priya 周日发给我的照片,做成海报,AirDrop 给妈妈"------一条指令串起相册、图像工具、分享三个环节。
一个基本的接入形状大致是这样(API 形状参考 WWDC 2026 session,新 2.0 能力部分以官方文档为准):
swift
import AppIntents
struct PhotoEntity: AppEntity {
static var typeDisplayRepresentation: TypeDisplayRepresentation = "照片"
static var defaultQuery = PhotoQuery()
var id: String
var title: String
var displayRepresentation: DisplayRepresentation {
DisplayRepresentation(title: "\(title)")
}
}
struct MakePosterIntent: AppIntent {
static var title: LocalizedStringResource = "把照片做成海报"
@Parameter(title: "照片")
var photos: [PhotoEntity]
// App Intents 2.0:流式响应,边生成边回传中间状态
func perform() async throws -> some IntentResult & ProvidesDialog {
let poster = try await PosterService.render(photos)
return .result(dialog: "海报做好了,要 AirDrop 给谁?")
}
}
屏幕感知则要求开发者为控件加 "on-screen awareness annotations",Siri 才能解析"第三个"这类指代。这是纯增量工作,也是判断一个 App 有没有认真接入的试金石------只声明 Intent 不做屏幕注解,能跑通指令式调用,但接不住多轮指代。
五、商业模型与地理边界:第三层其实是收费的
三层路由不只是技术分层,也是商业分层。由于复杂请求要消耗服务器侧的大模型算力,Siri AI 对这类重请求设了使用上限,更宽松的额度与大多数 iCloud+ 套餐绑定。
这构成了一个很清晰的模型:端侧免费无限、云侧按订阅分级。对比一下,OpenAI、Anthropic 都是按 token 计费的 API 模式,苹果走的是"硬件 + 订阅"的预付费模式。前者对开发者透明可控,后者对终端用户无感但天花板由套餐决定。作为开发者,如果你的 App 依赖 Siri 触发端侧能力,这部分没有成本压力;但如果你的流程强依赖 agentic 多步编排,用户套餐档位会变成你的隐性依赖------这是个值得提前设计降级路径的点。
地理边界也很硬。Siri AI 随 iOS 27 以英文 beta 首发,10 月扩展法语、日语、韩语、葡萄牙语、西班牙语,中文没有时间表。苹果明确标注 Siri AI 暂不在欧盟和中国大陆提供,欧盟是无限期延迟。
另外首发日期各源存在分歧:MacObserver 与 HowStuffWorks 称 iOS 27 于 9 月 14 日发布,观点网与 PHILE WEB 则称 9 月 15 日。稳妥写法是"9 月中旬"。机型门槛也注意分层:iOS 27 本身支持 iPhone 11 及以后,但 Siri AI / Apple Intelligence 需要 iPhone 15 Pro 及以后,自定义声线语调等部分功能仅限 iPhone 17 Pro 系列与 iPhone Air。Siri AI 独立 App 则要到 10 月上线。
六、最上面那一层是可插拔的
最后说一个容易被忽略但更重要的信号:苹果的长期对冲。
多家报道提到,苹果一方面承认自研基础模型过去两年在复杂查询上失败率高、功能多次跳票,这促成了转向买断;另一方面,苹果仍在推进自研的约 1 万亿参数级云侧模型,作为长期替代。Gurman 的报道还提到,苹果内部有过代号 "Project Glenwood" 的模型比选,最终在 OpenAI、Anthropic 等方案中选了 Gemini。
这里需要明确标注:1.2 万亿参数、年费 10 亿美元、Project Glenwood 均为媒体爆料口径,苹果官方未确认参数与金额。
所以更准确的判断不是"苹果认输",而是"买 + 自研并行"。这个姿态的直接后果落在架构上:三层架构的最上面一层是可插拔的。AFM 3 Cloud Pro 跑在 Google Cloud 上、归属 PCC 契约、由苹果定制------换掉底座的成本,远低于自研一个同级模型。
对开发者来说,这个判断有实际含义。如果你的产品规划依赖 iOS 上的设备端智能,端侧那两层(AFM 3 Core / Core Advanced)是苹果长期可控的,值得押注;而 agentic 重任务那一层的能力边界、配额、甚至可用地区,未来都可能随商业谈判变化。把强依赖放在可插拔层上,风险是要自己扛的。
总结
把这次 Siri AI 的架构要点收一下:
- 三层路由:AFM 3 Core(3B 稠密)负责路由决策,AFM 3 Core Advanced(20B 稀疏,按 prompt 激活 1~4B)处理端侧主力任务,AFM 3 Cloud Pro 处理复杂推理与 agentic 任务。
- PCC 边界变了:最强的 Cloud Pro 首次跑在第三方基础设施(Google Cloud 的 NVIDIA GPU)上,但仍纳入 PCC 隐私框架------PCC 从物理隔离变成了契约承诺。
- 算力底座:A20 Pro 用 2nm、双神经引擎共 32 核、内存带宽 +50%,端侧跑得动稀疏大模型的关键是带宽而非纯算力。
- 开发者侧:SiriKit 已废弃,App Intents 是唯一入口,不接入等于不存在;屏幕感知注解是增量但必要的工作。
- 商业与地区:端侧免费无限、云侧按 iCloud+ 档位分级;欧盟无限期延迟、中国大陆暂不提供、中文无时间表。
- 长期变量:最上层可插拔,苹果自研万亿级云模型仍在推进。
对开发者最务实的一条建议:先确认你的 App 有没有 App Intents / App Entities,没有的话,Siri AI 这波流量和入口跟你无关。
参考链接
- Apple's new Foundation Models explained --- 9to5Mac
- Apple Foundation Models 3 WWDC 2026 developer read
- Apple chooses Google Gemini for Siri --- ET Enterprise AI
- Apple A20 Pro 规格整理 --- Notebookcheck
- App Intents 2.0 与 Siri 接入 --- ITmedia
- iOS 27 release date and Siri AI beta features --- MacObserver
- Le nouveau Siri d'Apple --- Frandroid
- Apple rebuilds Siri with Gemini --- DataNorth