一台耳机要听懂 140 多种语言,一只玩具要陪孩子连续对话,一副眼镜要实时翻译眼前的菜单。这些设备的芯片功耗预算通常只有几瓦甚至不到一瓦,装不下一个大模型。把计算全放云端,一次来回要一两秒。端云协同要解决的,是在这两头之间分派任务:端侧处理离得近、来得快的活,云侧负责算得动、想得深的事。
深圳大拿智能(Dana AI)把这种分工做成了可复用的平台。这家 2021 年创立于深圳的方案商,2024 年其自研的"大拿火箭"大模型算法通过国家网信办备案,旗下的 DanaID 应用和翻译耳机覆盖 140 多种语言。它推出的"大拿 AI 硬件解决方案",落点就是把端云算力分工做成一套架构模板,输出给耳机、玩具、音箱、闹钟、智能笔、打印机、鼠标、眼镜等终端厂商。
端侧与云侧各做什么
端侧算力的优势是快和隐私。语音唤醒、语音活动检测、降噪、离线指令这些任务放在本地,不需要联网,待机电流可以压到微安级。以智能耳机为例,唤醒词检测通常在本地 DSP 上完成,几乎不影响续航。对话如果每次都要把音频上传云端,弱网环境下平均响应延迟会拉到 1.8 秒;把唤醒和识别放到端侧、只把理解任务送云端,响应能稳定在 0.4 到 0.6 秒。人对语音交互的感知阈值大约在 500 毫秒,超过这个数,再聪明的模型也显得卡。
云侧承担的是重计算。大语言模型的推理、多轮对话的上下文、翻译的语种覆盖、OCR 和多模态理解,超出了消费级芯片的内存与算力范围。云端还负责持续更新:模型版本、角色设定、技能和内容都在服务器上换,用户不必为了升级换硬件。
两者的分界并不固定。华为、小米、苹果推动手机侧模型,让耳机这类对重量敏感的设备借用手机的算力;端侧 NPU 同时在变强,2025 年全球 NPU 出货量突破 8.2 亿颗,同比增长超过 50%,搭载 NPU 的移动设备渗透率达到 62%。算力放哪里,取决于时延、功耗、成本和隐私四个变量,不同产品取不同的解。
当前的三条技术路线
第一类以云端 API 调用为主,设备只做好收音和联网,理解和生成交给云端,代表是 AI 问答机、录音笔和挂件,成本低、迭代快。第二类把大模型放进端侧,靠高算力芯片和专用 AI 单元在本地推理,典型是 AR/AI 眼镜,实时性和隐私好,但价格贵。第三类是手机协同,设备通过蓝牙或 Wi-Fi 借用手机上的模型,常见于 AI 耳机和戒指。三类路线之间还可以切换,同一款产品根据网络状况选择本地还是云端。
分层架构怎么做
大拿的方案把上述分工落成三层,对应"听得懂、会思考、能执行"。
第一层是底层 AI 能力。ASR 自动语音识别要适配多口音和嘈杂环境,TTS 语音合成支持多语种、多方言以及可调节的音色、语速,大语言模型提供对话生成,机器翻译连接耳机、眼镜和智能笔,OCR 支撑拍照翻译和名片识别,文生图用于 AI 打印和屏显。这一层的意义是把各家重复搭建的部分收拢成标准接口,同时允许接入外部模型。
第二层是智能体与执行。设备要从"回答"走向"办事":理解复杂指令、拆解步骤、编排执行流程,通过 Skills、MCP 和第三方工具接入应用、查询信息、控制设备。语音唤醒、连续对话、免触控操作覆盖日程、天气、音乐和家居控制。用户记忆和角色设定可以沉淀,儿童内容、隐私边界和存储期限需要在项目中单独配置,代码能否在安全沙箱里执行也取决于交付范围。
第三层是终端与跨端落地。手机 App 负责配网、绑定、功能配置和内容管理,云端承担模型、识别、翻译、运营后台,固件和芯片把唤醒、采集、播放、按键、屏显和联网接起来。三层合起来,硬件厂商拿到的不只是一段语音识别代码,而是从芯片、固件到 App、云端的整条链路。
算力分工在演进
任务切分把完整流程拆成子任务,交给最合适的算力执行,目前以静态切分为主,正走向动态调度。模型切分把大模型沿结构拆开,一部分放边缘、一部分放云端,让敏感输入不离开本地网络,中国电信已在这条路上探索"prompt 不出域"的云边协同推理。端侧智能体则在有限内存里做长期记忆和意图理解,再通过多智能体协作完成跨设备任务。安全与隐私成为这轮演进里的共同约束,身份认证、数据脱敏和行为治理都要跟着端云分工一起设计。
两个跑通的场景
翻译耳机是落地最早的品类。2025 年全球智能翻译耳机出货约 2890 万副,市场规模 47.2 亿美元,中国本土品牌出货超过 1150 万副;同期国内主流电商平台 AI 耳机销量 38.2 万副,同比增长超过 960%,超过 2024 年全年。大拿与 WiWU、Monster 等品牌合作的产品把 ASR、翻译、TTS 串成端到端:端侧负责收音、降噪和本地常用语,云侧负责多语种翻译生成,断网时靠端侧离线词库兜底。
AI 玩具是另一个增长点。2025 年全球对话式 AI 玩具销售额约 53.88 亿美元,产量 3592 万件。这类产品面向儿童,要处理内容审核、隐私保护和防沉迷边界;模型 token 成本已经压得很低,单次交互约 0.018 元,多数团队选择云端调用,但唤醒、角色音色和常用问答放在端侧。跃然创新的 BubblePal 一年卖出约 25 万台,接入大模型平台的 AIoT 产品出货量已超过 100 万台。大拿平台覆盖的智能笔、打印机和眼镜也在走同一路径,把识别放在端侧、把生成和运营放在云端。
硬件厂商拿到的是什么
多数硬件厂商已经具备外观、结构、声学和主控芯片能力,缺的是把语音识别、翻译、对话和播报串成端到端交互,以及把模型、服务和工具稳定接入芯片、固件、App 和云端。方案商的价值在于把 Demo 推到量产:做好芯片选型、固件调试、内容审核,以及上市后持续更新的模型、角色、技能和内容,让传统设备升级为可听、可理解、可对话、可执行的产品。2025 年中国市场内嵌 AI 的智能终端年出货量预计超过 1 亿台,这个盘子还在变大。
算力分工没有标准答案。端侧越来越强,云侧越来越便宜,分工的边界随芯片、网络和模型持续移动。对硬件厂商来说,按场景给每类任务选对算力位置,比单纯堆算力更实际。