BGE:智源研究院突破性中英文语义Embedding向量模型

引言

智源研究院发布了一款开源的中英文语义向量模型BGE(BAAI General Embedding),在中英文语义检索精度与整体语义表征能力方面全面超越了OpenAI、Meta等同类模型。BGE模型的发布,标志着语义向量模型(Embedding Model)在搜索、推荐、数据挖掘等领域的应用迈入了一个新的阶段。

模型性能

BGE模型在中文语义向量综合表征能力评测C-MTEB中表现卓越。在检索精度方面,BGE中文模型(BGE-zh)约为OpenAI Text Embedding 002的1.4倍。

此外,BGE英文模型(BGE-en)在英文评测基准MTEB中同样展现了出色的语义表征能力,总体指标与检索能力两个核心维度均超越了此前开源的所有同类模型。

技术创新

BGE模型的卓越性能源于其高效的预训练和大规模文本对微调两方面要素。BGE采用了针对表征的预训练算法RetroMAE,利用无标签语料实现语言模型基座对语义表征任务的适配。同时,BGE针对中文、英文分别构建了多达120M、232M的样本对数据,帮助模型掌握实际场景中各种不同的语义匹配任务。

应用前景

此外,BGE模型在技术上还采取了非对称的指令添加方式,提升了语义向量在多任务场景下的通用能力。这一创新使得BGE模型在构建大语言模型应用(如阅读理解、开放域问答、知识型对话)时,展现了更加强大的功能。

效率与开源

值得一提的是,BGE模型在保持卓越性能的同时,并未增加模型规模与向量的维度,因而保持了相同的运行、存储效率。目前,BGE中英文模型均已开源,代码及权重均采用MIT协议,支持免费商用。

结论

总结来说,BGE模型的发布,不仅为中英文语义向量模型领域带来了一次重大突破,也为大模型生态基础设施建设提供了强有力的支持。其在语义检索能力上的领先优势,以及在多任务场景下的通用能力,都预示着BGE将在未来的大模型应用开发中发挥重要作用。

参考资料

Github

github.com/FlagOpen/Fl...

HuggingFace

huggingface.co/BAAI/

AI快站模型免费加速下载

aifasthub.com/models/BAAI

相关推荐
我是一只puppy4 分钟前
使用AI进行代码审查
javascript·人工智能·git·安全·源代码管理
阿杰学AI5 分钟前
AI核心知识91——大语言模型之 Transformer 架构(简洁且通俗易懂版)
人工智能·深度学习·ai·语言模型·自然语言处理·aigc·transformer
esmap8 分钟前
ESMAP 智慧消防解决方案:以数字孪生技术构建全域感知消防体系,赋能消防安全管理智能化升级
人工智能·物联网·3d·编辑器·智慧城市
LaughingZhu12 分钟前
Product Hunt 每日热榜 | 2026-02-08
大数据·人工智能·经验分享·搜索引擎·产品运营
芷栀夏21 分钟前
CANN ops-math:筑牢 AI 神经网络底层的高性能数学运算算子库核心实现
人工智能·深度学习·神经网络
用户51914958484523 分钟前
CVE-2025-47812:Wing FTP Server 高危RCE漏洞分析与利用
人工智能·aigc
阿里云大数据AI技术27 分钟前
【AAAI2026】阿里云人工智能平台PAI视频编辑算法论文入选
人工智能
玄同76529 分钟前
我的 Trae Skill 实践|使用 UV 工具一键搭建 Python 项目开发环境
开发语言·人工智能·python·langchain·uv·trae·vibe coding
苍何1 小时前
腾讯重磅开源!混元图像 3.0 图生图真香!
人工智能
千里马也想飞1 小时前
人工智能在医疗领域的应用与研究论文写作实操:AI辅助快速完成框架+正文创作
人工智能