体验的Scaling时刻:读淘天首席科学家郑波2026云栖演讲

基于 2026 云栖大会主论坛演讲《体验的Scaling时刻》· 演讲人:阿里巴巴 ATH 事业群技术副总裁、淘天集团首席科学家 郑波 · 视频源:Bilibili BV1p3hE6iEgW

核心论断:AI 的技术演进正迎来"体验的 Scaling(规模化)时刻"。过去受限于成本与工艺的高精度 3D 渲染、影视级长视频和逼真音画交互,在全模态生成技术的推动下,边际生产成本正无限趋近于零。未来三年内,业界必将诞生原生一体化的全模态统一生成模型,彻底重塑人机交互与物理世界的体验边界。


01 什么是"体验的 Scaling 时刻"?

作为阿里多模态生成业务(包括文生视频 Happy Horse、世界模型 Happy Oyster)的领军人物,郑波从应用与体验的视角拆解了 AI 技术的深层拐点:

  • 抹平创意落地的边际成本:传统的数字内容工业(如电影特效、电商 3D 建模、交互场景)依赖昂贵的美工、动效师与专业管线。全模态生成模型通过端到端生成,将专业级视听内容的制作成本降低数个数量级。
  • 从"文字理解"到"感官复刻":如果说上一阶段的大语言模型解决了逻辑思维与语言表达的基石,那么当前正在发生的巨变,则是将文字逻辑直接映射到视觉、听觉以及真实物理世界的动态规律中。

02 未来三年的决定性预判:原生一体化全模态统一模型

郑波在演讲中明确提出了对多模态技术架构演进的重磅预判:

告别拼接式架构: :当前的多模态系统大多采用"文本 LLM + 外挂扩散模型/音频模型"的拼装方案,跨模态信息在传递过程中损失严重,难以维持时空与语义的高度统一。

原生一体化统一模型::未来三年内,业界将诞生真正的原生一体化全模态模型。该模型在一个统一的神经网络内部,直接原生表征和生成文字、高保真音频、多视角图像、长时连续视频乃至传感器时空数据。


03 真实产业落地场景与新品发布计划

多模态生成技术并非空中楼阁,它正在淘天集团及阿里巴巴的核心业务中掀起体验风暴:

  • 电商商品维度的全景生成:商家的商品展示从静态图片和简单录播,全面升级为任意视角的 3D 空间动态交互展示,实时根据用户偏好动态渲染试穿/搭配效果。
  • 物理世界模拟与世界模型:借助世界模型(Happy Oyster 等探索),赋予生成内容精确的物理重力、光影折射与刚体碰撞规律,为具身智能与交互仿真提供坚实底座。
  • 11月发布全新视频生成模型:郑波在演讲现场正式预告,阿里将于 11 月发布全新一代视频生成大模型,在动作一致性、超长镜头连贯性及复杂物理运镜上实现突破性升级。


给产品与设计团队的落地启示

趋势方向 业务机遇 应对策略
体验边际成本趋零 海量个性化动态视频展示,千人千面的交互式视觉内容 将固定模板设计转向动态 Prompt 与生成规则编排
全模态统一模型 音画文一体化极速反馈,交互延迟大幅降低 尽早建立企业私有高保真视听素材资产库,为多模态微调储备原料
世界模型物理一致性 从平面广告进阶到虚拟试装、具身仿真操作环境 关注物理引擎与真实场景数据融合,避免脱离实际物理常识的漂移

来源:2026 云栖大会主论坛演讲《体验的Scaling时刻》(主讲人:郑波)。内容经整理与工程化拆解,仅供技术讨论与学习参考。

相关推荐
FII工业富联科技服务1 小时前
2026年AI技术发展趋势分析:从模型能力突破到工业AI的真实应用
大数据·人工智能·深度学习·机器学习·制造·ai智能体·agentic ai
还卿一钵无情泪1 小时前
Docker 部署Unsloth 绕开环境配置难题
运维·人工智能·docker·ai·容器·nlp·干货
johnsong1 小时前
AI前沿日报 2026-10-07:信任崩塌
人工智能
小范的技术工坊1 小时前
MCP协议:Agent工具调用的新标准
大模型·agent
菩提树下的凡夫2 小时前
多线程是加载一个复用推理模型还是用多个独立的推理模型
人工智能·深度学习
冯一川2 小时前
使用 Python 实现支持多轮对话的 CLI 聊天机器人(基于 Ollama)
人工智能
武子康2 小时前
LingBot-Video 怎么选推理路径?8 步 DMD 不等于小显存
人工智能·后端
Febrie2 小时前
Codex插件推荐:Local Figma Agent MCP,不购买付费套餐,也能让 Agent 读懂并修改Figma设计稿
人工智能
edtoplort2 小时前
OpenAI紧急叫停GPT-6.1 Astra训练,奥尔特曼为何踩刹车
人工智能·gpt·算法