淘宝直播 AI 分身:基于阿里云 Milvus 的商品知识召回实践

淘宝直播的 AI 分身正在从"能生成一段话",走向"能围绕当前直播间、当前商品和当前场次持续给出准确回答"。在这一过程中,真正决定回答质量的,往往不只是模型会不会说,而是系统能不能先找到正确的商品事实。

商品名称、卖点、类目、主播、场次和业务标签分散在知识库中。用户的一句自然语言提问,既可能没有出现标准商品名,也可能同时带有类目、场次等约束。如果检索召回了"看起来相似、实际上不属于当前场景"的商品,后续生成再流畅,也会把错误进一步放大。

为此,淘宝直播团队使用阿里云 Milvus 承载商品知识的向量存储与语义检索,通过混合搜索融合语义向量与关键词等多路检索结果,并结合类目检索、分区和标量过滤,构建 AI 分身回答生成前的商品知识召回链路。当前整体向量数据已达数亿条规模。在这一规模下,系统仍能在毫秒级返回检索结果并保持稳定运行,为直播间在线问答提供了可持续扩展的数据底座。

一、客户业务背景:让 AI 分身先找准商品,再组织回答

淘宝直播的 AI 能力覆盖直播间信息获取、数字人直播通知、商品文案上传、模型数据回传、商品弹卡和场次计划等环节。随着直播间逐步引入 AI 分身,知识库不再只是后台资料库,而是回答生成链路中的实时事实依据。

在一次典型问答中,用户可能会问"这件适合夏天吗""刚才那款还有什么颜色""同类目里有没有更轻的"。系统需要先结合当前主播、直播场次、商品类目和自然语言问题,从大规模知识库中定位候选商品,再把相关信息交给生成模型组织回答。

产品的界面如下图:

二、客户核心挑战:不只要"找得像",还要"范围对、跑得稳"

对直播间 AI 分身来说,语义相似只是召回的第一步。结果必须属于当前场景,还要能够在亿级数据和大规模资源下稳定服务于在线链路。

1. 用户问题与商品资料往往不是同一种表达

商品知识库中通常是结构化描述,用户却更常使用口语、简称或场景化表达。仅依靠关键词容易漏掉同义表达,因此需要把问题与商品知识映射到向量空间,通过语义相似度找到候选结果。在实际检索中,系统进一步采用混合搜索,将语义向量召回与关键词等检索信号融合。向量召回用于覆盖口语、同义词和场景化表达,关键词检索保留商品名、型号和属性词等精确匹配信号,两类结果共同排序,提高候选结果的准确度。

2. 只做向量检索,可能召回"相似但不该出现"的商品

直播问答具有明确的业务边界:候选结果可能必须属于当前主播、当前场次或指定商品类目。语义相似度负责"找得像",主播 ID、场次 ID、品类等标量条件负责"范围对"。两类条件必须在同一条检索链路中协同。

3. 数亿条向量数据对性能与扩展性提出更高要求

当商品知识从小规模验证走向大规模在线使用,数据量、字段数和索引管理的复杂度都会显著增加。当前系统承载数亿条向量数据,每条数据除向量和 ID 外,还携带字典信息等丰富属性。系统既要保持检索效率,也要把回答生成所需的商品事实一并返回,避免二次拼接造成不一致。

4. 检索处在在线链路,稳定性和可观测性同样关键

AI 分身的每次回答都依赖知识召回。任何抖动都可能传导到最终用户体验。因此,在大规模集群资源下,团队不仅关注查得快不快,也关注数据、分区、Segment、Schema 与索引状态是否可观测、可管理,以便及时发现和定位问题。

三、整体技术方案

淘宝直播的商品知识召回方案,并不是在全量数据上单纯计算向量相似度,而是把业务边界与语义理解放在同一条检索链路中。主播、场次、商品品类等结构化字段用于标量过滤,用户 Query 生成的向量用于语义召回,两者共同决定最终的候选商品。

整体链路可以分为数据准备、在线检索和回答生成三个阶段。

在数据准备阶段,商品资料经过清洗和向量化后写入 Milvus。向量字段用于语义召回,商品 ID、主播 ID、场次 ID、品类及其他字典属性作为标量字段一并保存。这样,一条记录既是可检索的语义单元,也是可直接交给回答生成模块的商品上下文。

在在线检索阶段,AI 分身收到问题后,将当前直播上下文组装成过滤条件,同时将 Query 转为向量。Milvus 在符合业务条件的数据范围内执行混合搜索,融合语义向量和关键词等多路检索结果,经过统一排序后返回与问题最相关的商品或知识片段。

在回答生成阶段,生成模型无需读取完整知识库,只接收检索得到的少量高相关事实。这既减少了无关上下文,也使回答更贴近当前商品和当前场次。

整体链路图下:

场景一:直播间实时商品问答

当用户询问商品卖点、颜色、适用场景或同类目对比时,系统会将当前主播、场次和品类等上下文转换为标量过滤条件,再使用向量检索理解用户的口语化表达。

检索时,系统会同时发起语义向量召回和关键词召回。语义向量用于理解口语、简称和场景化表达,关键词检索则强化商品名、型号、颜色、材质和规格等词项的精确匹配。两路结果经过统一融合排序。混合搜索既能扩大相关候选的覆盖范围,也能利用精确词项收紧结果范围,减少单一检索方式造成的漏召回和误召回。

比如,用户的问题未必包含标准商品名,但向量检索仍能找到语义相关的候选结果;同时,标量条件把结果限定在当前直播场景内,避免跨主播、跨场次或跨类目误召回。召回的商品属性与事实被作为可控的上下文交给大模型,让 AI 分身在"说得好"之前先做到"找得准"。

Milvus 最终返回少量高相关的商品属性和事实,包括卖点、规格、颜色和适用场景等信息。大模型只需围绕这些候选内容组织回答,减少无关知识的干扰,在毫秒级检索返回的基础上给出更准确、连贯的商品回答。

场景二:数亿条向量数据下的稳定在线检索

数亿条向量数据进入在线系统后,写入和查询会同时给索引、分区、节点调度和请求路由带来压力。直播间里的用户不会等,AI 分身也不能停下来慢慢查。每次提问都要尽快拿回准确的商品事实,数据继续增长、流量不断波动时,这个速度还得保持稳定。根据团队实际使用反馈,当前核心检索可在毫秒级返回结果,系统运行稳定。

阿里云 Milvus 通过向量检索、标量过滤、分区管理以及 Collection 和 Schema 管理承接这些请求。部署版本怎么选,可以先看业务能接受多少数据回退和多长的服务中断。RPO 看故障发生时最多可能丢多久的数据,RTO 看多久能恢复服务,两个数字都越小越好。

部署方式 SLA 发生故障后怎么处理 官方恢复目标
标准版单可用区 99.9% 不具备可用区级容灾能力 无机房级容灾目标
双可用区基础版 99.9% 在备用可用区重新拉起计算节点 RPO 为 0,资源充足时 RTO 小于 1 小时
双可用区高可用版 99.95% 直接切换主备集群 RPO 为 0,RTO 小于 3 分钟
跨地域高可用版 99.99% 跨地域容灾接管 RPO 小于 10 秒,RTO 小于 3 分钟

怎么选,可以从可接受的中断时间出发。双可用区基础版只保留一份计算资源,故障时需要重新拉起节点,成本相对较低,也需要预留恢复时间。直播问答直接面向用户,双可用区高可用版在主备可用区各准备一份计算资源,异常时能够直接切换,更适合持续在线的问答服务。业务还需要防范地域级故障时,可以进一步选择跨地域高可用版。

表中的 SLA 和恢复目标来自阿里云 Milvus 的服务等级协议多可用区部署模式说明。具体适用范围和除外情形以正式协议为准。

实际使用时,部署版本之外,团队还会配合数据多副本、自动备份和监控告警,尽量提前发现异常并保护数据。出了问题,恢复服务还不够,团队还得尽快看出慢在哪里。Milvus Manager 把 Schema、向量搜索、数据、分区、Segments 和属性放到同一个 Collection 详情页,开发时可以直接验证数据和检索结果,线上出现异常时也能更快缩小排查范围。

未来展望

随着 AI 分身覆盖更多直播间、商品和场次,商品知识检索还将从"稳定召回"进一步走向"可评测、可调优、可持续扩展"。

在检索效果上,团队可以围绕召回率、Top-K 命中率、过滤准确率和端到端延迟建立评测集,并结合重排、结果去重和时效字段继续优化,让语义相关性与直播业务约束更紧密地协同。

在工程与运维上,可以进一步完善容量规划、监控告警、故障定位和降级策略,使当前在数亿条向量数据规模下验证过的性能和稳定性,能够继续支撑更大规模的在线 AI 请求。

综上,淘宝直播的实践表明,AI 分身要实现准确、连贯的商品问答,关键不是把所有知识都交给大模型,而是建立一套能够在明确业务边界内快速召回事实的检索系统。阿里云 Milvus 凭借语义向量检索、标量过滤、分区管理和云上托管能力,承接了这一关键数据底座。

当 AI 分身能够先从数亿条向量数据中找准当前场景下真正相关的商品知识,再交给大模型组织表达,直播问答才能在性能与稳定性之上,从"能回答"进一步走向"答得对、接得上、可持续扩展"。

一线案例如何变成可部署的电商智能搜索方案

本文案例展示的向量召回和业务属性过滤,和直播电商、商品目录、B2B 找货等场景中的其他检索需求有许多共通之处。用户既可能用自然语言描述商品,也可能直接上传截图。系统需要理解图文意图,再结合类目、场次、上下架状态、供应商等条件控制召回范围,最后通过去重和重排提高结果质量。

阿里云将这些案例中反复出现的需求和工程经验,整理到基于 Milvus 构建电商图文智能搜索平台解决方案中。方案把商品图片理解、图文向量化、BM25 关键词检索、标量过滤与 Rerank 组合成一套可直接部署的流程,覆盖直播电商、商品目录与 B2B 找货等场景,可用于建设截图搜货、自然语言找商品、以图找货、目录查重与相似推荐等能力。

如果您也在建设海量商品智能检索系统,可以前往解决方案页面查看架构说明和适用场景,并按指引完成部署体验。

基于 Milvus 构建电商图文智能搜索平台:www.aliyun.com/solution/te...

相关推荐
猎头南楼1 小时前
大模型后训练与 Agent 自迭代:两类工程能力的观察
人工智能·深度学习·机器学习
镜像视界(浙江)科技有限公司1 小时前
《视频孪生之上:二维展示终结,三维空间计算重构城市逻辑》——跨摄像连续表达 × 三角测量厘米级定位 × 动态轨迹建模,构建新一代城市空间
大数据·人工智能·算法·矩阵·音视频·空间计算
你不是我我1 小时前
【AI 测评】想用自己的声音给视频配音?Index-TTS本地部署这样做
人工智能·音视频
IT_陈寒1 小时前
Java Stream处理大集合,我的内存怎么就炸了
前端·人工智能·后端
Captaincc2 小时前
AI 用量桌面端-桌面宠物自定义指南
前端·人工智能
悟空码字2 小时前
四轮对话两张配图:用 WorkBuddy 优化公众号发文配图的实战指南
人工智能·后端·腾讯
wordbaby2 小时前
「搜索引擎与知识检索」第四篇:超越扁平文本:知识的组织与检索
人工智能
空堂与归2 小时前
deepseekHarness桌面端不开端口:Electron 自定义协议拆解
人工智能
懂压力传感器的涌客2 小时前
从具身智能说起:柔性薄膜压力传感器在机器人触觉系统的选型与信号链设计
人工智能·机器人·压力传感器·源头工厂·fsr压力传感器