从租用AI到拥有AI:企业私有模型的价值、成本与落地路径

汤森路透最近推出了自己的大语言模型Thomson,项目投入约4000万美元,底层用的是阿里的Qwen3.5-397B-A17B。
汤森路透你可能没听过,但是路透社你肯定听说过,汤森是路透社的母公司。那么为什么一家做法律、财税和新闻资讯的大公司,要花这么多钱自己搞模型呢?
其实仔细想想不难发现原因所在,AI这几年正在逐渐变成法律、销售、招聘、医疗这些专业业务流程里的基础设施。OpenAI的用户活跃数据也印证了这一点:2026年2月以来,法律行业的Codex企业周活跃用户增长了108倍,销售和招聘领域增长了41倍。
用量大了,问题就来了:如果核心能力一直建在别人的API上,服务波动、涨价、模型升级、数据边界变化,哪个都够企业喝一壶的。
所以很多企业开始思考一个问题:哪些AI能力值得自己掌控,哪些继续租用更划算。
一、企业为什么想从租用AI走向拥有AI
在大模型快速发展的这几年,绝大多数企业接入AI的方式,基本都是调用模型厂商的API。这样做的原因很简单:启动快,效果也通常不错。企业不需要自己买GPU,不需要维护推理服务,也不需要理解模型训练。只要把需求发过去,把结果接回来,业务就能跑起来。
但是随着业务规模增长,使用量逐渐增大,问题也会慢慢暴露出来。
1.每一次调用都在产生长期成本
企业使用AI不是偶尔总结一份文档,而是把模型深度嵌入到自己的业务流中,比如合同审阅、发票识别、客服工单分类、供应商资料审核、代码检查和内部知识问答等流程。一旦这些功能上线,就可能每天、每小时甚至每分钟产生调用。
短期看,外部API省掉了基础设施成本 ;长期看,企业可能一直为同一类重复任务支付推理费用。业务量增长以后,调用量和账单也会一起增长。所以很多企业开始重新评估租用AI到底是不是合算的买卖。
那不租用,就得考虑自建模型,当然,这不等于自建模型一定更便宜。因为企业还要承担GPU或云资源、推理服务、数据清洗、模型工程、监控、升级和安全治理成本。真正要比较的,是一段时间内的总拥有成本,而不是简单比较API单价和本地推理单价。
2.企业无法完全控制模型
外部模型不是不好用,而是企业很容易被牵制:
- 模型什么时候升级或下线
- 某项能力什么时候调整
- 价格、限流和服务条款如何变化
- 服务部署在哪个区域
- 数据如何被处理和保存
- 模型为什么突然改变回答风格
- 某项专业能力是否能适配自己的业务领域
- ...
这些问题对于法律、销售、人力资源、财务、医疗、供应链和企业内部代码逐渐产生影响,最终会演变成合规、稳定性和业务连续性问题。
企业对AI的控制,也不只有「是否拥有模型权重」这一层,至少可以拆成四层:
1.数据控制 :比如数据是否可以出域、如何保留、谁能访问
2.应用控制 :Prompt、RAG、工具调用、审批和日志是否可控
3.服务控制 :模型版本、部署区域、SLA和供应商是否可控
4.权重控制:能否自行部署、微调、蒸馏和替换模型
开放权重主要增强第四层 ,这会帮助企业获得一部分服务控制权,但不会自动解决数据治理、业务流程和安全审计问题 。企业在实际业务中,也没必要非在「全部租用 」和「从零自研」之间二选一,更现实的做法,是根据业务规模、数据敏感性和错误成本,决定哪些能力需要自己控。
3.企业最值钱的行业壁垒,不能只放在上下文里
前两年,很多企业接入大模型,第一步都是做问答助手:把内部知识文档召回,拼接Prompt,再交给大模型总结。于是大家研究文档切分、向量检索和召回算法,希望模型能回答业务领域的问题。
实际上就是做RAG,RAG有用,但它主要解决的是「让模型有资料可看 」,不一定能让模型学会「企业的判断方式」,实际上就是行业经验,这些才是企业的核心竞争力:
- 哪些风险必须升级
- 哪些异常只是格式问题
- 哪个条款在当前交易中真正重要
- 哪些资料虽然相关,但不能作为结论依据
- 什么情况下应该明确说「不确定」
这些经验如果始终只存在于一次次请求的上下文和人工修改里,就很难沉淀成可复用的企业能力。
不过,并非所有行业知识都要塞进模型权重里。动态的法规和产品资料,更适合放在带版本管理的知识库中 ,便于溯源和权限控制;而稳定的输出风格,则通过微调来固化 。至于风险阈值和审批流程这类强规则,最好还是交给显式的业务逻辑来处理。
二、Qwen3.5-397B-A17B为什么能成为企业底座
先说结论:这个模型不是面向个人的,至少不适合大多数个人直接部署;对企业来说,它也不是拿来就能上线的最终产品。它更像一个大型、开放、可继续加工的模型底座。
而它之所以适合作为候选底座,不是因为参数规模足够大,而是因为它在通用能力、开放性、可改造性和推理效率之间,达到了一个比较完美的平衡。
1.397B总参数,17B激活:混合专家模型
Qwen3.5-397B-A17B是一个稀疏混合专家模型(Mixture of Experts,MoE),总参数规模约3970亿,但每次前向计算只激活约170亿参数。
可以把它理解成一个大型专家团队:整个团队拥有约3970亿个参数,但每次处理一个Token时,路由机制只选择部分专家参与计算。这样可以在保留较大模型容量的同时,减少单次计算量。
对企业来说,这个设计还挺有意义的。企业级AI往往不是偶尔处理一条复杂问题,而是持续处理合同、表格、工单、代码和业务文档。单次推理效率会影响并发、延迟和成本,MoE可以在一定程度上缓解单次计算压力。
但这里有个很容易被误解的地方:17B是激活参数,不是部署所需的全部参数。
就是模型总权重依旧是397B,企业仍要面对权重存储、显存分布、专家路由、节点通信和长上下文KV Cache等问题。MoE降低的是部分计算压力,不是把397B模型变成了17B模型。
2.开放权重,意味着企业拥有改造空间
开放权重 和通过API调用的模型,最大区别不是能不能下载,而是企业能否一定程度上掌控模型:
- 自己部署和固定模型版本
- 接入内部工具和数据系统
- 用企业案例做微调或蒸馏
- 根据业务评测结果更换底座
- 选择模型运行的位置
- ...
但开放权重不等于完整开源 。训练数据、完整训练代码、训练配方和基础设施不一定公开。企业拿到的是一个可部署、可改造的模型底座。
3.多模态+长上下文,更擅长处理企业资料
企业资料很少是干净的纯文本,实际工作里经常会遇到:
- PDF合同
- 扫描件
- Excel表格
- 图片和附件
- 多份相互引用的文件
- 长篇制度和历史记录
- ....
而Qwen3.5-397B-A17B定位为原生视觉语言模型 ,并提供较长上下文能力。这使它更擅长处理文档、表格、图片等多种模式的复杂资料。
4.通用能力足够强
企业选择基础模型,主要看它能不能规划着把一项复杂任务拆解并完成。Qwen官方资料展示的能力包括:
- 复杂指令执行:理解多步骤要求,并尽量按指定格式输出。法律、财务和风控任务,往往要求模型同时完成抽取、比对、归类、引用和总结
- 推理与代码能力:处理数学、逻辑和程序生成任务,不用从头教它基本推理、结构化处理和代码能力
- 工具和Agent能力:支持工具调用、规划、搜索和多轮任务,可以进一步把它接入检索系统、数据库和内部业务API
- 视觉与文档理解:多模态
- 多语言处理 :官方资料显示,Qwen3.5将语言和方言覆盖扩展到201种,适合跨语言资料和多地区业务
以上虽然不代表它在所有任务上都超过GPT或Claude,但它至少提供了一副相对完整的通用能力骨架:会推理、能编码、能处理文档,也能接入工具。企业可以把训练资源放到法律条款、税务规则、供应商标准和内部流程上,而不是重新训练语言、常识和基本推理。
这才是Qwen3.5作为底座的意义:不是替企业完成专业化,而是把「从零训练通用能力」变成「从一个已经具备通用能力的起点,开始做专业化」
三、企业拥有自己的模型,究竟能得到什么
1.可能降低高频任务的长期成本
当一个企业每天处理大量稳定 任务时,可以评估私有部署 或更小的蒸馏模型,是否能降低成本。例如:
- 每天审核大量文档
- 每天处理客服工单
- 每天抽取大量结构化字段
- 持续做代码检查和测试生成
- 对供应商资料进行初筛
这类任务的特点是数量大、格式相对稳定、需求变化不频繁。如果长期调用外部模型,成本会持续增长;如果把部分能力迁移到自有模型,单位成本和资源控制可能更稳定。
为什么说可能?因为企业还需要支付:
- GPU或云资源
- 推理服务和模型工程
- 数据清洗和训练
- 监控、审计和安全治理
- 模型升级和故障处理
- 错误返工和人工兜底
只有当调用量足够大、场景足够稳定、模型能力能够长期复用时,这个投入才划得来。
2.节省专业人员时间
很多时候,企业真正想省的不是Token费用,而是专家时间。以供应商初筛为例,模型可以自动完成资料读取、字段抽取、规则比对和证据定位,生成一份带依据的初审结果,只把高风险和无法判断的部分留给专家复核。这类工作规则明确、重复度高,交给模型能释放大量专家时间,让专家聚焦在更有价值的工作上。
3.敏感数据更可控
客户合同、供应商报价、未公开财务数据、内部代码和案件材料,都可能是企业的敏感数据。
私有化部署不能自动解决所有安全问题,但至少可以让企业自主决定:
- 数据放在哪里
- 谁能访问模型
- 哪些内容可以进入上下文
- 客户数据是否允许进入训练
- 模型输出如何留痕和审计
- 版本升级如何验证
对法律、医疗、金融和政府等行业来说,这种控制权本身就很有价值。
4.能把行业经验变成长期资产
企业真正应该沉淀的,不是某个模型文件,而是一套能让模型越用越聪明的工作机制。
举个例子,比如我们用AI做供应商资料初筛,完整的闭环大概是这样的:
业务员把资料传上去 → 系统记下谁传的、用的哪个模型版本、调了什么工具 → 模型给出一份初筛结论和依据 → 专家看一眼,觉得不对就改一改,或者直接驳回 → 把这份资料和专家的修改痕迹做脱敏、整理、质检 → 变成三样东西:训练素材、错误案例库、评测考题 → 拿去优化RAG、微调模型、甚至蒸馏成小模型 → 新版本上线后,继续收集新一轮反馈,循环往复。
这套流程里,每个环节产出的东西各有各的用处:
- 脱敏后的真实业务数据,可以拿去继续训练模型,或者给RAG当知识库
- 专家改过的地方,就是在告诉模型你这里错了、那里漏了、措辞不对------这些能加工成偏好数据
- 那些翻过车的失败案例 ,统统收进回归测试集,确保新版本不会再犯同样的错
- 专家心里那杆秤,比如什么叫合格 ,我们把它写成可执行的评分规则
- 领域评测集,用来横向对比不同底座、不同提示词、不同检索方案、不同微调版本谁更好
- 工作流和工具调用记录 ,沉淀下来就是可复用的Agent流程
- 权限、审计、版本记录这些东西,保证出了岔子能追溯
这么一轮下来,数据就不再是躺在日志里的废料,而是变成了真正的模型资产------能拿去训练、能拿来评测、能解释模型行为,哪天想换底座了,这套资产也能快速迁移过去。
所以企业真正攥在手里的,根本不是某个具体模型,而是三样更难被复制的东西:
第一,知道自己业务里最常见的问题是什么
第二,知道什么答案算对
第三,知道模型怎么嵌进真实工作流,并且有人兜底
这就是数据资产产生复利的地方。第一次用模型,只是完成了一个任务;但之后每一次专家动手改、每一次翻车复盘、每一次版本评测,都在让下一个版本更好训、更好验收 。所以私有模型本身没那么大的价值 ,真正有价值的点是利用私有模型沉淀企业自己的模型资产。
四、如何把Qwen3.5改造成企业自己的模型
企业做AI,别上来就训模型。不现实,也没必要。更靠谱的路子,是从一个具体的任务开始,一层一层往上搭,循序渐进,就像做工程一样,先上MVP版本,再逐步迭代优化:
- 先写提示词、接工具,把整个流程跑通
- 跑通了,发现知识跟不上,再加RAG
- 加完RAG,发现输出习惯不稳,再做LoRA微调
- 到这一步还不够,任务确实复杂、需要模型自己调多个工具,那时候再考虑后训练或者强化学习
这么说有点抽象,我举个具体的例子,拿供应商资料初筛这个业务场景来说,第一版别搞复杂。
模型能按固定格式输出风险、证据、待办就行,文件解析和企业查询的工具接上,够用就上线。
上线后盯几个关键指标:人工修改量、漏报率、证据准确率、单均成本。这几个指标没跑稳之前,不用碰模型训练。
出了问题,再对症下药:
不知道最新规则?去接RAG
知道规则但写出来东一榔头西一棒子?拿专家改过的真实案例去做LoRA微调
真的需要模型自己拆任务、调工具,而且你已经有稳定的评分标准和评测集 了,这时候再想后训练的事
还有几个经验之谈:
1、格式问题,用结构化输出和字段校验搞定 ,不能靠模型
2、动态制度,放在知识库里 ,别放进模型权重
3、风险阈值、审批权限这些,写在显式规则和业务流程里 ,别让模型判断
4、微调只能让模型的风格像业务人员,但是它不能代替业务人员做决策
五、什么样的公司适合评估397B
企业如果想尝试397B,应该先问自己几个问题:
- 是否有大量重复的知识型任务
- 是否拥有外部模型拿不到的私有数据
- 是否对数据出域有严格要求
- 调用量是否长期稳定
- 任务结果是否可以被明确评测
- 是否有算法、工程、数据和运维团队
- 是否能够承担分布式推理和模型治理成本
如果只是想做一个内部聊天机器人、调用量很小、没有评测集或没有专职团队,直接上397B就很没必要了,徒增一套昂贵的基建。
至于部署这部分,我觉得可以分阶段看:
- 低调用量/快速验证:托管API
- 数据敏感/调用量稳定:私有化部署
- 任务明确/追求单位成本:大模型蒸馏小模型
- 数据、专家和评测能力都很强:持续预训练+后训练
Qwen3.5-397B-A17B可以作为企业评估的候选底座,但终态不一定是在线服务模型,也可以作为教师模型,为更小、更便宜的业务模型生成训练数据。
六、企业项目应该怎么落地
第一步:先选任务,不要先选模型
第一批任务最好具备几个特点:
- 高频、重复
- 输入相对稳定
- 输出格式明确
- 错误成本可控
- 有人工结果可以对照
第二步:先做效果对比
拿真实的脱敏数据,同时比较:
- 当前人工流程
- 外部闭源模型
- Qwen3.5或其他开放模型
- 接入企业知识库前后的差异
评估指标不要只看回答是否流畅,还要看:
- 准确率
- 完整性
- 引用可靠性
- 人工修改时间
- 单任务成本
- 响应延迟
- 输出稳定性
- 高风险错误率
第三步:建立企业自己的评测集
最好尽早保存:
- 正确案例、错误案例、边界案例和高风险案例
- 人工修改内容
- 专家评分
- 不同模型和不同版本的结果差异
有评测集,才能判断模型是否真的好用,也才能知道一次微调到底有没有带来改进
第四步:根据评测结果选部署方式
评测集跑完之后,部署方式的选择就有了依据,不用拍脑袋:
- 如果外部闭源模型在核心指标上明显领先,且数据允许出域,先用托管API跑起来,把业务流程验证清楚
- 如果数据敏感或调用量已经稳定,评估私有化部署,固定模型版本和部署区域
- 如果任务边界清晰、评测集稳定,可以尝试用大模型蒸馏小模型,把单位成本打下来
- 如果数据、专家和评测能力都足够强,再考虑持续预训练和后训练
核心原则是:部署方式的选择是跟着评测结果走,不是跟着想不想拥有模型走。模型开放权重不代表必须私有化,调用量小的时候硬上397B,只会把验证成本推高。
七、企业自建模型,到底是在省钱还是换账单
自有AI价值 = 节省的API费用 + 节省的人工时间 + 数据控制收益 − 算力、研发、运维、治理和错误成本
可能更划算的情况
- 调用量很大
- 任务长期稳定
- 模型可以被多个业务复用
- 企业拥有自己的算力或长期资源
- 专业人员时间价值很高
- 数据出域和供应商依赖成本很高
可能更贵的情况
- 调用量很小
- 业务需求经常变化
- 没有专职工程团队
- 数据质量很差
- 缺少评测标准
- 为了部署大模型购买了大量闲置GPU
- 模型效果还不如现成API
所以,企业私有模型更像一项长期投资:前期需要投入数据、工程和治理成本,后期才可能换来更低的单位成本、更强的数据控制和更稳定的业务能力。
把专家能力持续转化成模型资产
Qwen3.5-397B-A17B的意义,不是让每家公司都去部署一个397B模型,而是提供了一条路线:企业不必从零训练基础模型,也不用把所有AI能力都交给外部服务商,而是可以从一个足够强的开放权重模型开始,把自己的数据、专家判断、业务工具和评测体系逐步沉淀成模型能力。
对大多数企业来说,最先应该建设的不是私有模型,而是四样东西:
- 自己的数据
- 自己的专家标准
- 自己的评测集
- 自己的业务闭环
有了这些,再谈私有部署和持续训练才有意义。其实真正值得企业讨论的不是我们要不要拥有一个私有模型,而是:哪些AI能力值得自己控、哪些能力继续租用更划得来、哪些业务数据和专家经验、需要沉淀为自己的模型资产