"此前在线教育公司实习中,我注意到学生答疑存在响应不及时、内容分散等问题。为了寻找更合适的解决方案,我开始关注数字人,并由此展开了这次竞品分析。"
本系列共三篇。本篇集中说明研究口径、数字人行业背景及三个研究对象的市场定位;中篇比较功能、操作路径与技术;下篇讨论商业模式、竞争格局及对教育数字人的启示。
一、研究说明
1.1 研究背景
随着大模型、实时音视频和生成式AI技术的发展,数字人正在从以形象展示和内容生产为主的工具,向具备语义理解、实时互动、多模态协同和任务执行能力的业务入口演进。其应用场景也逐渐覆盖电商直播、品牌营销、客户服务、教育培训和政务服务等领域。
在这一趋势下,不同厂商形成了不同的产品路径。七牛云将RAG、LLM、实时音视频和3D形象整合为一体化产品;火山引擎将数字人、智能语音、实时音视频和生成式视频拆分为可组合的技术能力;蝉镜则从口播内容创作延伸至知识库驱动的交互数字员工。三个研究对象分别代表企业数字人一体化解决方案、基础能力组件化和内容创作工具智能化三种路径,因此本文选择七牛云智能数字人、字节跳动相关产品与技术和蝉镜数字人进行对比研究。
1.2 研究目的
本报告旨在分析数字人行业的发展阶段及代表性厂商的产品路径,比较其目标用户、核心价值、产品形态、技术与交付方式,并为教育数字人"知小伴"的后续规划提供参考。本篇重点说明研究口径、行业背景与发展趋势,并分析七牛云智能数字人、字节跳动相关产品与技术、蝉镜数字人的市场定位;功能、操作路径与技术能力将在中篇展开,商业化路径、竞争格局及产品启示将在下篇展开。
1.3 研究对象
- 七牛云智能数字人:包括视频合成、形象与声音定制、交互数字人、直播、数字人一体机及相关API/SDK能力。
- 字节跳动相关产品与技术:研究范围包括火山引擎虚拟数字人、豆包语音、实时音视频、VikingDB、即梦,以及OmniHuman、Seedance等模型与技术。
- 蝉镜数字人:包括网页端、App、小程序的数字人内容创作能力,以及交互数字员工、企业知识库和企业交付方案。
1.4 研究方法
本文主要采用资料研究法,通过查阅行业政策、市场研究报告,以及三个研究对象的官方网站、产品介绍、开发者文档、操作指南、计费说明、相关论文与模型发布资料,梳理数字人行业的发展现状、产品分类、技术链路和发展趋势,并分析三个研究对象的产品定位、主要功能、技术能力、接入方式与商业化路径。
二、数字人行业与产品背景
2.1 概念与产品分类
国家网信办(2026年征求意见稿)将数字虚拟人定义为:存在于非物理世界,利用图形学、数字图像处理或人工智能等技术,通过真人驱动或计算驱动模拟人类外貌,并具备声音、行为、交互能力或性格等特征的虚拟数字形象。结合当前常见产品形态,数字人可以概括为以下四类。不同类别之间并非完全互斥,同一产品可能同时具备多种能力。
- 内容生成型数字人: 输入文稿、图片、音频或视频,生成口播、课程讲解或营销视频,重点关注生成质量、制作效率和模板复用。
- 直播型数字人: 面向长时间连续推流、素材循环和直播互动,重点关注运行稳定性和运营效率。
- 实时交互型数字人: 整合 ASR、LLM/RAG、TTS、动作驱动和实时传输,重点关注响应速度、问答准确性和音画同步。
- 数字员工型数字人: 在交互能力基础上连接知识库、业务系统或工具,承担咨询、导览、培训和业务办理等任务。
2.2 核心技术链路
|---------|-----------------|-------------------|
| 环节 | 作用 | 关键评价点 |
| 形象与建模 | 生成或定制2D/3D形象 | 还原度、风格、授权、制作成本 |
| ASR | 将用户语音转为文本 | 识别率、噪声、热词、流式延迟 |
| LLM与RAG | 理解问题并调用知识库生成回答 | 命中率、事实性、拒答、引用一致性 |
| TTS | 将回答转为语音 | 自然度、情绪、停顿、多音字、多语言 |
| 动作驱动 | 控制口型、表情、头部与肢体动作 | 音画同步、语义一致性、稳定性 |
| 渲染与RTC | 实时输出画面和音频 | 首包延迟、端到端延迟、弱网表现 |
核心技术链路参考七牛云智能数字人产品页对 RAG + LLM、音视频输入输出等能力的说明,以及火山引擎 AI 音视频互动方案对大模型、ASR、TTS、知识库、数字人和 RTC 等模块的整合说明。
2.3 主要应用场景
从行业公开资料看,七牛云智能数字人主要覆盖虚拟 IP、数字人直播、数字员工以及教育、文旅等场景。火山引擎虚拟数字人主要提供播报、直播和交互型方案。蝉镜则重点覆盖短视频与课程内容创作,并向交互数字员工延伸。 综合来看,数字人的应用已覆盖内容营销、电商直播、教育培训、企业客服、政务文旅和展厅等领域。不同产品的价值重点有所差异:内容生产类产品追求产量与传播效率,实时交互类产品关注问答准确性与响应速度,企业解决方案还需兼顾部署、安全与业务系统连接。
2.4 市场现状与规模预测
从产业阶段看,数字人正在由早期的虚拟偶像和固定脚本播报,逐步向企业经营与公共服务场景拓展,并呈现规模化应用趋势。当前供给侧形成了"底层模型与音视频能力---数字人生产平台---行业解决方案"的多层结构:上游提供语音、视频生成、实时渲染和大模型能力,中游以 SaaS、API 和开发平台降低制作与接入门槛,下游围绕电商、媒体、客服、教育、文旅和政务形成场景化产品。竞争重点也由单纯追求形象拟真,转向实时交互、知识准确性、业务系统连接、部署方式与合规能力。
市场规模方面,艾媒咨询公开数据页显示,中国数字人核心市场规模由 2017 年的 8.1 亿元增长至 2025 年的 480.6 亿元;按该组数据计算,2017---2025 年年均复合增长率约为 66.60%,2026 年预计达到 572.9 亿元。艾媒咨询另一份报告预计,2030 年中国数字人核心市场规模将达到 935.6 亿元;数字人带动市场规模由 2024 年的 4785.3 亿元增至 2030 年的 10468.6 亿元。这表明数字人的价值不仅来自数字人产品本身,也来自其对内容生产、营销、电商、文旅及企业服务等关联市场的拉动。

图 1 中国数字人核心市场规模及预测(2017---2030年,单位:亿元)
IDC 聚焦"AI 数字人"这一较窄口径,预测中国 AI 数字人市场未来五年将保持 43.5% 的年均增速,到 2029 年达到 250.5 亿元、较基期增长超过 5 倍。9 因此,跨机构数据适合用于判断增长方向,不宜直接比较绝对规模;本文后续仍以产品定位、公开披露的产品能力和典型场景作为竞品判断的主要依据。
2.5 发展趋势与政策要求
- 从"念稿"走向"理解并回答"。七牛云将 RAG + LLM 列为智能交互底座。火山引擎将知识库、记忆、工具调用与 RTC 整合到 AI 音视频互动方案中。蝉镜则开始宣传企业专属知识库与交互数字员工。
- 从单一形象驱动走向多模态音视频联合生成。Seedance 2.0 采用统一的多模态音视频联合生成架构,支持文字、图片、音频和视频输入。Seedance 2.5 在此基础上进一步提升长叙事、多模态参考和编辑能力。上游视频生成能力正在扩展数字人内容生产的输入方式、镜头控制与编辑效率。
- 从单点能力走向平台化与多形态交付。七牛云提供 API、SDK、在线部署、私有化部署和一体机。火山引擎以云服务和 API 形式提供虚拟数字人、实时音视频等能力。蝉镜则通过网页端、App、小程序及企业方案覆盖不同用户。 多种交付形态并存,以适配个人创作者、开发者和政企客户不同的使用、集成与部署需求。

图 2 Seedance 2.5 官方发布页展示的能力升级方向:长叙事、多模态参考与精准编辑
三、 研究对象的 概况与市场定位
3.1 七牛云智能数字人
七牛云将智能数字人定位为人工智能与实时渲染结合的企业产品,公开功能覆盖声音定制、形象定制、短视频合成、RAG + LLM 智能交互、数字人直播和 3D 数字人;同时提供 API、SDK、在线部署与私有化部署。
其目标用户主要是需要把数字人嵌入业务场景的企业和开发者。官网将虚拟 IP、直播、数字员工列为主要方向,并明确列出数字教师、智能客服和数字分身等应用。2025 年,七牛云进一步推出 DeepSeek 数字人一体机和数字人营销 AI Agent,强化大模型、知识库、业务流程与硬件交付。
图 3 七牛云智能数字人产品页
- **产品定位:**面向企业和开发者的一体化数字人解决方案。
- **价值重点:**强调数字人的业务集成、实时交互和多种部署方式。
- **教育适配:**可用于数字教师、课件讲解和错题讲解等场景。
3.2 字节跳动 相关产品与技术
字节跳动的数字人相关能力并非由单一产品承载,而是分布在火山引擎虚拟数字人、豆包语音、实时音视频、VikingDB、即梦及 ByteDance Seed 模型等不同产品和技术中。火山引擎虚拟数字人提供 2D 真人、3D 卡通和 3D 超写实等数字人生产能力。AI 音视频互动方案进一步整合大模型、ASR、TTS、知识库、记忆、数字人和工具调用,为实时交互场景提供基础能力。豆包声音复刻与 VikingDB 分别补充语音复刻和向量检索能力。
其目标用户覆盖企业、开发者和专业创作者。企业和开发者可以组合语音、实时音视频、知识库和数字人等能力搭建业务产品;创作者可以通过即梦使用图像和视频生成能力。OmniHuman-1 支持音频、视频及组合信号驱动的人物动画生成。OmniHuman-1.5 进一步强化对语义、韵律、情绪和复杂动作的理解与表现。Seedance 2.0/2.5 则将相关技术方向扩展至多模态音视频联合生成、长叙事、参考控制与视频编辑。

图 4 火山引擎虚拟数字人产品页
- **产品定位:**以底层模型、语音、实时音视频和多模态生成能力为核心的数字人技术生态。
- **价值重点:**提供可组合的基础能力,支持企业和开发者根据具体业务自行搭建数字人产品。
- **教育适配:**可为教育数字人提供语音识别、语音合成、实时互动、知识检索和视频生成能力,但课程体系、学习流程和教学交互仍需产品方自行设计。
3.3 蝉镜数字人
蝉镜将自身定位为"爆款内容获客引擎"和一站式数字人内容创作平台,主要提供照片生成数字人、文案生成视频、PPT 转微课、爆款仿写、手持商品、形象与模板等功能,重点覆盖短视频、营销内容和课程内容的制作。
其目标用户以商家、MCN、个人创作者、教培机构和企业内容团队为主。用户可以通过网页、App 和小程序完成数字人定制与内容生成,平台同时设置形象授权认证。公开资料显示,蝉镜正在从数字人短视频创作向企业知识库和交互数字员工延伸,逐步拓展企业咨询、培训和服务场景。

图 5 蝉镜AI网页工作台
- **产品定位:**面向商家、创作者和教培机构的低门槛数字人内容创作平台。
- **价值重点:**通过模板、数字人资源和自动化生成能力,缩短从文案、PPT 到视频成片的制作路径。
- **教育适配:**适合微课、课程讲解和批量教学视频制作。公开资料已展示企业知识库与交互数字员工方向,但对实时问答能力、响应效果和知识库使用方式的披露相对有限。
3.4 产品定位横向比较
|--------|------------------------|-----------------------|-----------------|
| 维度 | 七牛云 智能数字人 | 字节跳动相关产品 与技术 | 蝉镜 数字人 |
| 产业位置 | 企业数字人解决方案与音视频能力平台 | 底层模型、云服务与创作产品 | 垂直内容创作SaaS |
| 核心用户 | 企业、开发者、政企客户 | 开发者、企业、专业创作者 | 商家、MCN、教培、个人创作者 |
| 核心价值 | 快速接入可交互数字人 | 提供可组合的语音、实时音视频和生成模型能力 | 低门槛批量生产营销/课程内容 |
| 主要场景 | 数字员工、直播、教育、展厅 | 虚拟播报、数字人直播、互动服务、创意视频 | 短视频、带货、微课、直播 |
| 交付方式 | SaaS、API/SDK、私有化部署、一体机 | API、云服务、创作平台 | 订阅SaaS、移动端、企业方案 |
本篇小结
从市场数据看,数字人仍处于扩张期,但行业正在由形象与内容生产竞争,转向交互质量、知识可靠性、业务闭环与合规交付竞争。对三个研究对象的比较因此不能只看"能否生成数字人",还需要关注其在实时音视频、知识库、系统集成、私有化和行业场景等方面的能力布局。
三个研究对象并非完全同类替代关系。七牛云偏企业交互与交付,字节跳动相关产品偏模型与技术供给,蝉镜偏内容生产与运营。中篇将进一步比较数字人形象、声音、视频创作、实时交互、知识库、用户路径和技术部署。