微信内部的生产级模型,居然开源了
我们都知道微信团队很低调,低调到最近几天,微信视觉团队开源了自家的视觉向量模型,居然没人知道。
我要是不偶然间刷 GitHub 我也不知道。
这次开源的叫 WeMM-Embedding,GitHub 上直接能下,Apache 2.0 协议,可商用。
自家生产环境天天在用的东西,就这么放出来了。
这东西值得说道说道。
1. 先搞清楚它是个啥
看到「微信开源大模型」,很多人的第一反应是:微信也能生成内容了?
不能。它生成不了任何东西。
WeMM-Embedding 是一个向量模型,你可以理解为图书馆里的编目员。它自己不写书,它干的事是把馆里每一本书,不管中文书,画册,还是录像带,都编成一张同一格式的索引卡。你拿着需求来找它,它把需求也编成卡,然后告诉你哪几张卡跟你的最像。
这个「编卡」的动作,技术名词叫 Embedding,就是把文字,图片,视频统统变成一串数字向量。向量之间的距离越近,内容就越像。
所以它的用途就一句话:检索和匹配。搜图,搜视频,找同款,做推荐,全靠它。至于你想让 AI 看图说话,写篇文章,那是另一类模型的活,和这个没关系。
2. 技术上有什么讲究
这类模型其实不少见,阿里有,学术圈也有。微信这个版本,有几个点我觉得做得挺务实。
一套模型吃四种输入。 文本,图片,视频,还有视觉文档(就是 PDF 扫描页,财报,合同这类东西),甚至图文混着喂也行。以前你要做全模态检索,得好几个模型拼着用,现在一个搞定。注意音频不支持,这是它的明确短板。
三个尺寸,可大可小。 2B,4B,9B 三档,最小的 2B 版本,模型权重 4GB 左右,8GB 显存的消费级显卡就能跑起来。这个门槛有多低呢,大概就是你打游戏的电脑就能干。要提醒的是,喂长视频会明显吃显存,官方评测一条视频抽 64 帧,这时候显存占用是单张图的好几倍,部署时最好给视频单独限一下长度。
训练分两步走。 第一步大规模多模态对齐,让模型先学会把不同形态的内容往同一个空间里放。第二步用精筛数据做精修,加细粒度的相关性监督,外加一个「跨尺寸知识迁移」,你可以理解为让 9B 这位老馆长带一带 2B 的新徒弟,把小模型的分数也拉上去。这也是它 2B 版本特别能打的原因之一。
向量维度可以砍。 这是我最喜欢的一个设计,叫 Matryoshka(俄罗斯套娃)可变维度。完整向量是 2048 维,但你可以直接砍掉一大截,只留 256 维。官方数据是,砍到 256 维之后,图像和视频检索的性能几乎不掉。
维度为什么重要?因为向量数据库的存储和计算成本,跟维度直接挂钩。砍到八分之一,成本也就跟着砍下去。做检索系统的人都懂,这才是真金白银的地方。
3. 官方成绩单
官方技术报告里的分数,确实漂亮。
在 MMEB-v2 这个多模态公开基准上,2B 版本拿了 77.9 分,阿里 Qwen3-VL-Embedding 的 8B 版本是 77.8,小模型打平了四倍大的对手。9B 版本 80.6 分,目前的开源最高分。更狠的 MMEB-v3 上,9B 拿了 59.5 分,也是第一。
要说明的是,这些分数出自官方报告,用公开基准自己跑的,大家参考着看。真要用,拿它跟竞品在自己业务数据上过一遍,谁好用谁。
4. 微信自己在哪用
这是我认为它比大多数开源模型靠谱的地方:它是生产环境验证过的,不是刷榜玩具。
技术报告里写得很清楚,这套模型已经大规模部署在微信的推荐和搜索业务里,包括视频号,公众号,朋友圈,还有电商服务。内部 26 个任务的测试集上有明显提升,14 个在线 A/B 实验全部有正向收益。
啥意思呢,你每天刷视频号看到的推荐,背后就是它在算账。这套东西不是实验室里刷榜的样品,是天天在亿级日活眼皮底下干活的。
微信这种体量,能在这种场景里跑稳的模型,工程可靠性基本不用你操心。你拿去用,踩到坑的概率比用那些论文副产品低得多。
5. 你拿它能干嘛
说几个普通人也能听懂的场景。
语义搜相册。 你输入「秋天傍晚的湖边」,它直接把你相册里符合的照片视频全捞出来,不需要你提前打任何标签。手机厂和 NAS 厂商现在都在做这类功能,底层就是这种模型。
以图搜图。 电商找同款,设计师找素材,版权方查盗版,都是它。
文档 RAG。 把合同,财报,论文这些 PDF 直接按页变成向量,用户提问时先搜出最相关的页面,再交给大模型去回答。以前这条路要先 OCR 识别文字,错一片,现在跳过 OCR 直接理解版面,效果反而更好。
内容去重和推荐。 内容平台判断「这两篇是不是洗稿」,短视频平台做「看了又看」,底层都是向量距离。
反过来说,如果你要的是让 AI 写文章,画图,生成视频,它一点忙都帮不上。它是系统里负责「找」的那一环,不负责「造」。
6. 开源竞品都有谁
这个赛道 2025 年之后卷得很凶,值得拎出来说的就这几个。
阿里 Qwen3-VL-Embedding,最直接的对手,生态和文档比微信这边完善,分数略低,属于稳妥的次选。
GME,也是阿里系的老模型,视觉文档检索还行,图像视频明显掉队。
全模态一派,E5-Omni,Tianmu 这些,优势是支持音频,语音搜视频它们能干,WeMM 干不了。代价是图文视频的单项分数都打不过同尺寸的 WeMM。
说白了,如果你的业务不含音频,只看图文视频检索,WeMM 目前是同尺寸开源模型里的天花板。如果含音频,它直接出局,不用纠结。
7. 哪些行业适合上手
最后按行业给个清单,各位对号入座。
电商行业,闭眼入。以图搜图,找同款,商品推荐,都是刚需,2B 版本就够用,一张消费级显卡跑全店商品库。
内容平台和 MCN,值得入。视频去重,洗稿识别,跨模态推荐,能省一大笔人工审核的钱。
有企业知识库的公司,文档 RAG 场景直接上。法律,金融,咨询这类天天跟 PDF 打交道的行业,收益最明显。
教育行业,可以做题库相似查重,课件资源检索,锦上添花但不是刚需。
如果你业务里有大量音频,播客,语音数据,别选它,去看全模态那一派。
如果你只是想要个聊天机器人,或者拿它跟编程模型比,那它跟你的需求压根不是一类东西。
开源地址放在这:github.com/Tencent/WeM... ,模型权重在 Hugging Face 上,搜 tencent/WeMM-Embedding 就有。
微信这次算是把自家看家的东西拿出来了。做多模态向量检索的兄弟们,该换装备了。