不到 5 分钟完成本地部署:Jina embedding 模型现已支持本地部署

作者:来自 Elastic Scott Martens

全部 28 个 Jina AI 模型(包括 reranker),现已提供可直接部署的 Docker 容器,无遥测数据收集,无需许可证服务器。可直接兼容 OpenAI、Cohere、Voyage AI 和 Elastic Inference Service API。

亲手体验 Elasticsearch:深入了解我们在 Elasticsearch Labs 仓库中的示例 Notebooks,开始免费云试用,或者立即在你的本地机器上体验 Elastic。


全部 28 个 Jina AI embeddingreranking 模型现已提供完全离线的 Docker 容器,支持本地部署,包括 jina-embeddings-v5-omnijina-reranker-v3。下载任意一个容器,将其传输到本地部署的隔离网络(air-gapped)或受防火墙保护的系统中,即可在不到五分钟内完成本地 inference 部署并开始运行。

这些容器完全自包含,不会建立任何外部连接。它们不会访问 Hugging Face 或任何模型注册中心,也没有许可证服务器、遥测或日志上报 endpoint。对于受监管行业、具有数据主权要求的场景,或互联网连接不稳定甚至完全不可用的环境,这消除了对第三方 AI 服务的依赖。Jina On-Prem 支持 Elastic Inference Service(EIS)、OpenAI、Cohere、Voyage AI 和 Gemini API schema,因此现有应用无需修改代码即可继续运行。

目前,最强大的 AI 模型通常部署在远程云环境中,并通过 Web API 提供访问。这意味着你必须信任 AI 服务提供商能够保障安全性、服务可用性以及价格稳定性。随着 AI 使用规模不断扩大、模型越来越复杂且资源需求不断增加,要同时满足可靠性、隐私、可控成本和良好数据治理等合理要求,已经变得越来越困难。

近期,政府监管、法院裁决以及出于其他企业利益做出的商业决策,都导致部分服务的访问受到限制。即使你能够切换到其他服务,AI 模型也不像普通组件一样可以随时替换。使用语义 embedding 的应用依赖于在 query 时使用与数据摄取阶段完全相同的模型。如果失去对 embedding model 的访问权限,你的搜索系统将无法继续运行。

AI 的定价模式进一步放大了这一风险。近期主要 AI 厂商披露的财务信息,让客户有充分理由担心未来可能出现的大幅涨价。依赖成本不可预测的产品,会进一步增加 AI 投资的风险,而这些高资本投入本身未必能够带来明确的投资回报。

Jina On-Prem 正是 Elastic 对这些挑战的回应。

谁需要本地部署 AI?

本地托管并直接控制你的 AI 模型,可以满足各种技术需求、行业要求和业务诉求。

本地部署能够降低支付给 AI 服务提供商的费用,但相应地,硬件成本和运行保障将由你的组织承担。根据你的使用规模,总体成本甚至可能更低。此外,还有许多更重要的原因值得考虑自行运行 AI。如果下面提到的任何问题与你的企业相关,那么可以考虑像 Jina On-Prem 这样的本地 AI 解决方案。以下仅列举部分场景,并非完整清单。

使用场景 为什么选择本地部署 示例
隔离网络 / 高安全环境 无任何对外数据传输;实现完全网络隔离 国防、情报机构、涉密科研
法规合规 满足数据主权要求;无跨境数据传输或第三方数据暴露 医疗(《健康保险流通与责任法案》 HIPAA )、金融、欧盟企业(《通用数据保护条例》 GDPR
对延迟极其敏感 零网络依赖;无法容忍连接失败 机器人、边缘计算、车辆、船舶
成本可预测 固定基础设施成本,而不是按 Token 计费且未来价格存在不确定性 高吞吐、持续运行的 inference 工作负载
降低法律责任 无第三方数据暴露;有助于维护法律保密特权和履行谨慎义务 律师事务所、政府机构

为什么隔离网络和受防火墙保护的系统需要本地部署 AI

隔离网络(air-gapped)和受防火墙保护的系统无法使用外部 AI API。Jina On-Prem 完全运行在你的基础设施内部,不会建立任何对外连接。

对于管理高度敏感数据的组织来说,安全和隐私是首要考虑因素。如果你投入大量资源来保护敏感数据,却又立即将这些数据交给某个远程第三方,而该第三方可能缺乏足够的安全措施,或者可能受到外国政府要求提供数据,那么这些投入就失去了意义。

处理敏感数据的组织通常会对员工进行安全数据处理培训,但当员工在处理这些数据时,浏览器仍然可以访问互联网上的任意网页时,这类培训的效果往往十分有限。隔离是目前最有效的安全措施,无论是采用隔离网络还是极其严格的防火墙策略。然而,这也意味着几乎无法使用任何外部服务。

面向低延迟和高可用系统的本地部署 AI

软件即服务(SaaS)和云计算,本质上是在自行构建高可用、高可靠服务与将这些问题交给第三方之间做出的权衡。但它们也带来了可变的 latency 、服务中断,以及在出现问题时彻底失去控制权。AI 服务也不例外。如果你的搜索系统因为无法访问 embedding model 而离线,那么这种权衡可能就不再划算。

此外,依赖外部 AI 始终伴随着难以预测和管理的风险。互联网连接和网络 latency 可能会因为政治事件、恶劣天气,甚至船只拖锚损坏海底光纤而突然恶化。政府可以(而且最近已经发生过)通过出口禁令突然阻止对 AI 模型的访问。AI 服务提供商有时也会下线旧模型,以促使你迁移到新模型。外部服务带来的灵活性和较低的运维成本,需要与这种依赖关系所带来的风险进行权衡。

面向 GDPR、HIPAA 和数据主权合规的本地部署 AI

收集个人数据的组织正受到越来越严格的法规约束,而这些法规通常因司法管辖区不同而有所差异,甚至可能彼此冲突。例如,HIPAA 对美国医疗机构提出了极其严格的数据保护要求;而加拿大欧盟以及许多亚洲司法辖区的数据保护法律,都要求处理个人信息的企业必须安全地处理这些数据,并限制向其他主体或其他司法辖区传输数据。

这些法规甚至可能对外国企业施加义务,只要它们拥有这些地区的客户即可。金融机构通常还受到更加严格的监管,并且需要像防范其他犯罪活动一样,对信息安全承担直接责任。

法规合规要求往往与第三方 AI 服务不兼容,尤其是在使用这些服务涉及跨境数据传输时。

此外,近期发生的一些事件表明,即使法规要求数据必须存储在本地,当国际云服务提供商受到外国政府压力时,仅依赖数据物理位置限制也未必能够提供足够的保护。不同司法辖区的法律可能相互冲突,一方面要求数据必须在本地存储和处理,另一方面又使第三方服务无法使用。在某些情况下,唯一的解决方案就是将整个业务流程(包括 AI 系统)全部部署在企业内部。

第三方数据传输带来的 AI 法律责任风险

数据保护法律以及针对敏感数据的谨慎义务通常伴随着法律责任,有时这种责任甚至非常严重。对于第三方服务提供商如何处理你的数据,你同样可能需要承担责任。虽然法院和法律程序在事后可能为不安全的服务提供商提供某些救济途径,但对于国家安全机构、执法部门或黑客攻击,这些救济通常并不存在,也难以真正发挥作用。

对于政府而言,已经发生过跨境云服务提供商向外国主体披露国家敏感信息的案例。

即使你并不担心外国政府或黑客,并且外部 AI 服务提供商本身具有良好的安全性,仅仅因为它们属于第三方,也可能带来法律责任。

例如,在大多数司法辖区,律师与客户之间的沟通都享有特殊的法律保护,而律师事务所在记录和保存这些信息时承担着严格的法律责任。在美国,这种"律师---客户保密特权(attorney-client privilege)"十分著名,甚至成为许多影视作品的重要情节。然而,这种保密特权可能因为将信息披露给不享有该特权的第三方而失效,而近期的发展表明,外部 AI 服务提供商很可能就属于这样的第三方。

至少在美国,仅仅通过互联网 API 使用第三方 AI 服务(例如提供 indexing 服务的 embedding 模型),就有可能违反重要的保密义务。即使没有发生任何数据泄露,仅仅因为使用了外部托管的软件,律师事务所也可能面临诉讼、纪律处分,甚至被吊销执业资格。

面向离线、边缘计算和物理隔离系统的本地部署 AI

计算机系统并不仅仅因为安全原因而被隔离。

例如,运行中的车辆无法依赖互联网完成任何关键功能。船舶和飞机拥有极其复杂的机载计算机系统,它们必须在没有互联网连接的情况下正常运行,因此无法依赖外部 AI 服务。海上平台、偏远地区设施、部署在北极、南极以及缺乏全球网络物理连接的小岛上的计算机系统,都属于需要将所有服务本地部署的典型场景。随着 AI 在企业计算中的作用不断增强,这些限制也变得越来越重要。

AI 在物理系统中的新兴应用(例如机器人,以及其他面向现实世界的应用场景,如物流管理系统甚至超市自助结账系统)虽然可能连接到互联网,但它们几乎无法容忍连接失败或 latency 突增。如果这些系统依赖 AI 才能正常运行,那么 AI 系统就必须尽可能部署在本地,并具备尽可能高的可靠性。

谁不需要本地部署 AI?

远程软件服务和云端 AI 也有其优势。运行 AI 模型通常需要价格昂贵、耗电量高且寿命相对较短的处理器。由于市场因素和外部经济冲击,目前获取高性能硬件尤其困难。在这种情况下,按 token 付费使用外部 API,而不是承担本地 AI 所需的大量资本投入,可能更加合理。

对于间歇性使用者来说,外部 API 最具优势。如果你主要使用 AI 模型进行批量数据处理和分析,而不是运行一个需要全天候在线的搜索系统,那么投资昂贵的硬件和本地部署通常没有太大意义。

此外,如果你的数据处理本身已经部署在云端,例如为了可靠性和可访问性而托管在云上的 ecommerce 网站,那么使用位于同一云基础设施中的 AI 服务,通常比自行部署获得许可的 AI 模型更具成本效益。既然你已经依赖云服务提供商,那么继续依赖其 AI 服务所增加的风险也相对有限。

如果你的使用场景符合上述情况,那么 Jina AI 模型已经提供了以下部署方式,以满足你的需求:

下表总结了影响选择的关键因素。最终答案取决于你的数据、基础设施以及使用模式。

推出 Jina On-Prem

对于能够从本地 AI 服务中受益的用户,我们推出了 Jina On-Prem,这是一个完全自包含的安装套件,用于部署 Jina AI 的高性能模型。

Jina AI 的模型能够以仅为其他 embedding model 数倍甚至数十分之一的模型规模,实现与其相当的准确率。这大幅降低了计算成本、内存占用和硬件需求,使其成为希望或必须将 AI 部署在本地环境中的用户的理想选择。

我们提供商业许可证,并针对不同规模的使用场景提供可扩展且按比例定价的解决方案。

因素 更适合本地部署 更适合云 API
使用模式 持续运行或高吞吐 inference 间歇性使用或批量处理
数据敏感性 受监管、具有数据主权要求或涉密数据 没有跨境传输或第三方限制
网络环境 隔离网络、受防火墙保护或网络不稳定 稳定、始终在线的互联网
现有基础设施 已拥有或能够采购 GPU 硬件 已部署在云端,并可使用同一云中的 AI 服务
成本模式 固定硬件和许可证成本;规模扩大后成本可预测 token 计费;前期投入低,但长期成本存在不确定性
延迟容忍度 几乎无法容忍(机器人、边缘计算、实时系统) 可以接受网络带来的延迟波动
运维责任 由你的团队负责硬件和可用性管理 服务提供商负责硬件和升级,你负责集成

你需要结合自身的实际情况和使用场景,综合考虑成本与收益,并结合上一节提到的各种因素进行评估。随着时间推移,这种成本收益分析也可能发生变化。我们无法预测 AI 行业的发展趋势,也无法预测硬件价格,即使是在短期内也是如此。

Jina On-Prem 支持哪些 API schema?

  • 提供完整依赖包,可用于本地安装;也提供 Docker 容器,几分钟内即可完成安装和运行。

  • Jina On-Prem 安装后不会连接任何外部系统。

    • 不会访问 Hugging Face Hub 或任何模型注册中心(已内置 HF_HUB_OFFLINE=1TRANSFORMERS_OFFLINE=1)。

    • 没有许可证服务器。

    • 没有遥测或日志上报 endpoint。

  • 同时支持 CPU 和 GPU 硬件,并支持 GPU 自动检测。

  • 提供全部 28 个 Jina AI 模型,包括最新的 jina-embeddings-v5-omni 多模态 embedding 模型,以及 jina-reranker-v3

  • 支持通过标准 AI API schema 访问,包括 Jina API、OpenAI、Cohere、Voyage AI 和 Gemini。对于基于这些 schema 构建的应用,Jina On-Prem 可以直接替换,无需修改代码。

  • 可直接替代由 EIS 提供的模型。Jina On-Prem 可直接集成到隔离网络中的 Elastic 部署中。

Jina AI 本地部署模型的硬件要求

不同的 Jina 模型具有不同的硬件要求。下表展示了最新模型在 GPU 配置下的推荐配置。你无需使用比 NVIDIA L4 更强大的 GPU,不过对于 v5 embedding model ,推荐使用 A100。我们最新的 embedding model 当前至少需要 8 GB 的 VRAM。

模型 最低 VRAM 推荐 GPU
jina-embeddings-v5-text-nano 2 GB T4 / L4
jina-embeddings-v5-text-small 3 GB L4 / A10G
jina-embeddings-v5-omni-small 8 GB L4 / A10G / A100
jina-reranker-v3 3 GB L4
jina-clip-v2 4 GB L4
jina-code-embeddings-1.5b 4 GB L4
ReaderLM-v2 4 GB L4

如果你同时使用多个模型,所需的 VRAM 将会增加。更多信息请参阅 规格配置和硬件 页面。

如何使用 Docker 安装 Jina On-Prem

最快的入门方式是安装 Docker(如果你还没有安装),然后按照 Jina On-Prem 快速入门页面中的说明操作。

所有 28 个 Jina 模型都提供了预配置的 Docker 容器。下载其中一个容器并将其传输到你的目标安装环境后,你可以在五分钟内运行 Jina AI 模型。

对于多模态或自定义构建,或者希望下载完整依赖集合并在容器之外进行安装的情况,请按照打包指南中的步骤操作。

你需要拥有一个 GitHub 账号和访问 token 才能下载 Jina On-Prem。要创建免费账号,请访问 https://github.com/signup。要生成或管理你的访问 token,请按照 GitHub 文档中的说明操作。

你的 Jina On-Prem 安装支持所有 Jina API 和 EIS 功能,并支持通过 OpenAI、Cohere、Voyage AI 和 Gemini API 生成 embedding,因此可以通过标准接口集成到已有应用中。更多信息请参阅 API 文档

Jina 模型(包括通过 Jina On-Prem 安装的模型)提供多种许可证方案。最新模型在 CC BY-NC 4.0 许可证下可免费用于非商业用途。如需将 Jina On-Prem 用于商业用途,请联系 Elastic Sales

原文:On-premise AI: Jina embedding models with no internet needed - Elasticsearch Labs

相关推荐
2601_963282771 小时前
极寒专网技术拆解:黑龙江零下 40℃场景数字对讲组网全方案|黑龙江移远科技寒地通信底层技术解析
运维·网络·人工智能·科技
程序员cxuan1 小时前
Loop 还没玩明白,Graph Engineering 又火了。
人工智能·后端·程序员
wh_xia_jun1 小时前
基于 Hi3861 的 PWM 与彩灯综合实践指南
人工智能
To_OC1 小时前
别再被跑分骗了:大模型 Benchmark 到底在考什么?
人工智能·llm·agent
二进制流水搬运工1 小时前
入职第一天拉了23个仓库,我写了个脚本解放双手
大数据·elasticsearch·搜索引擎
qyz_hr1 小时前
待岗人员如何安置?国企末等调整制度下的分流通道设计与合规要点
人工智能
成都被卷死的程序员1 小时前
AI的Tools与Skills详解
人工智能
橙臣程1 小时前
深度学习9——transformer之注意力机制
人工智能·深度学习·transformer
网络工程小王2 小时前
【HCIE-AI】10.pytorch模型迁移分析
人工智能·学习·华为·llama