750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家

750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家

7 月 31 日,LG AI 研究院在 Hugging Face 上放出了 K-EXAONE 2.0 的完整权重,三个数字在开源圈迅速传开:750B 总参数37B 激活参数Apache 2.0 许可证 。这是韩国迄今规模最大的 AI 基础模型,总规模是初代 K-EXAONE(236B/23B)的 3 倍以上,而激活率从初代的 9.7% 一路压到 4.9%------比 DeepSeek-V3 的 671B/37B(激活率 5.5%)更狠。同一天,美国商务部对 Anthropic 模型的出口管制风波尚未平息,韩国国家队模型以 Apache 2.0 全量开源登场,时间点本身就意味深长。

先看三个关键事实。第一,K-EXAONE 2.0 采用混合注意力 MoE 架构,总参数 750B、激活参数 37B,规模是初代的三倍,参数效率却是初代的近两倍。第二,它在韩国科技信息通信部主权人工智能基金会模型项目 框架下开发,定位是国家级数字基础设施,而非单纯的商业产品。第三,许可证选择 Apache 2.0 而不是更常见的 MIT,等于把专利授权也一并交了出来------这在主权模型的语境里几乎可以翻译成一句话:你们放心用,我们不做商用陷阱

但真正值得开发者关注的,不是"又一个 700 亿级参数开源模型",而是它站队的技术路线。2026 年的开源大模型世界已经分裂成两条路线:一条以 Kimi K3 为代表,总参数冲到 2.8T、激活参数约 72B,用极致稀疏换容量上限;另一条以 DeepSeek 为代表,671B 总参数、37B 激活,在容量与推理成本之间取平衡点。LG 的 K-EXAONE 2.0 加入的不是第三条路,而是把 DeepSeek 的平衡点往韩国国情方向又推了一步------在算力受限的条件下,把每个 GPU 的利用率榨到极限。这篇文章就沿着这条路线,拆一拆它的激活参数账、注意力账、许可证账,最后给出开发者现在就能落地的四条路径。

一、激活参数才是真正的成本账

总参数决定模型的"知识容量",激活参数决定推理时的"算力消耗"。一个 MoE(混合专家)模型把网络拆成多个专家子网络,每个 token 只经过其中一小部分专家。750B 参数的模型,如果只有 37B 在干活,意味着单次前向传播的 FLOPs 和一个 37B 的稠密模型相当,却享受了 750B 模型的容量。这套逻辑在推理成本上体现得最直接:每百万 token 的推理成本大致与激活参数成正比,一个 37B 激活的模型,单 token 推理成本大约只有同规模稠密模型的 5%。

对中小团队来说,这个比例意味着两件很实在的事。第一,同样预算下可以服务约 20 倍 的用户量,或者把单次调用的毛利提升一个数量级;第二,可以把更大参数的模型塞进同样的显卡集群------48GB 显存的单卡就能扛住 37B 激活的推理,这在稠密模型的世界里是不可想象的。K-EXAONE 2.0 把激活率压到 4.9%,等于告诉所有算力受限的团队:你要的"大模型自由",不一定靠买更多卡,也可以靠更聪明的架构

当然,稀疏不是免费的午餐。路由开销、专家并行、负载均衡这三座山,每一座都压过不少团队。路由开销指每个 token 都要经过一个 router 网络动态决定走哪几个专家,这个决策本身要消耗算力,也引入新的失败模式:如果 router 学偏了,大量 token 挤在同一个专家上,稀疏性就名存实亡,模型退化成稠密模型的性能加卡顿的体验。K-EXAONE 2.0 采用 top-k 路由加负载均衡约束,下面这段代码模拟了它的核心路由逻辑------这也是 MoE 模型最值得手写一遍的部分,理解它你才能真正理解 4.9% 是怎么来的:

python 复制代码
import numpy as np

def moe_route(router_weights, k=8):
    """模拟 MoE 的 top-k 稀疏路由。

    router_weights: (batch, num_experts) 每个 token 的路由分数
    k: 每个 token 激活的专家数量
    """
    # 归一化路由分数
    probs = np.exp(router_weights - router_weights.max(axis=-1, keepdims=True))
    probs = probs / probs.sum(axis=-1, keepdims=True)

    # top-k 选择:只激活分数最高的 k 个专家
    top_k_idx = np.argsort(probs, axis=-1)[:, -k:]
    top_k_probs = np.take_along_axis(probs, top_k_idx, axis=-1)

    # 负载均衡辅助损失:惩罚"所有 token 挤同一专家"
    expert_usage = top_k_probs.mean(axis=0)
    balance_loss = (expert_usage ** 2).sum() * k

    return top_k_idx, top_k_probs, balance_loss

# 模拟 128 个专家、batch=4、k=8 的路由
rng = np.random.default_rng(42)
scores = rng.normal(0, 1, size=(4, 128))
active, probs, loss = moe_route(scores, k=8)
print("一个 token 激活的专家下标:", active[0])
print("稀疏度: {:.2%}(128 个专家只激活 8 个)".format(len(active[0]) / 128))
print("负载均衡损失: {:.4f}".format(loss))

运行这段代码你会直观看到:128 个专家只激活 8 个,稀疏度 6.25%,和 K-EXAONE 2.0 的 4.9% 属于同一数量级。路由器把 95% 以上的网络"短路"掉,这就是稀疏激活模型能同时拥有大容量和低成本的原因。值得注意的是,负载均衡损失那一行不是装饰------MoE 训练里最经典的翻车事故,就是 router 收敛到"所有人挤一个专家",让稀疏模型退化成稠密模型的性能加卡顿体验,LG 在技术报告里专门强调了对这一项的约束。换句话说,4.9% 这个数字背后,是训练阶段每一轮都在跟路由崩溃搏斗的结果。

到这里,反对的声音也该听一听。稀疏 MoE 不是没有代价:专家之间的通信开销在跨机部署时尤其明显,一个 128 专家的模型做张量并行,all-to-all 通信可能占掉 30% 以上的时间;训练时的路由崩溃需要额外的辅助损失和温度退火来压制;更重要的是,稀疏模型的"知识分布"不均匀,冷门专家训练不充分,导致某些领域的表现明显弱于同等容量的稠密模型。所以选型时不要只看激活率一个数------如果你的场景是低延迟交互(语音助手、实时翻译),稠密模型或小激活模型可能反而更合适;如果你的场景是离线批处理、长上下文分析,稀疏大模型才是性价比之王。K-EXAONE 2.0 的 4.9% 激活率适合后者,这一点要心里有数。

二、混合注意力省下的是 KV Cache

MoE 解决的是参数利用效率,注意力机制解决的是上下文处理成本。标准全注意力(full attention)每个 token 都要和上下文里所有 token 计算相关性,复杂度随序列长度平方增长,而且 KV Cache(键值缓存)随上下文线性膨胀------128K 上下文在 8 卡 A100 上,KV Cache 就能吃掉几十 GB 显存。长上下文模型的部署成本,一半以上都花在这个缓存上,这也是为什么很多团队测长上下文模型时,发现显存先爆、算力还富余。

K-EXAONE 2.0 的"混合注意力"把两种机制拼在一起:对关键位置用全注意力保证质量,对长距离位置用线性或稀疏注意力降低复杂度。这和大模型领域正在发生的趋势完全一致------Kimi K3 走的是线性注意力路线,DeepSeek 系在 MLA(多头潜在注意力)上压缩 KV Cache,各家路径不同,目标相同:把长上下文推理的显存成本压下来。LG 的混合方案本质上是"不做单选题":哪些位置值得全量计算,哪些位置可以近似处理,让模型自己学。对部署团队来说,这套方案的实际收益是显存占用曲线被压平:短上下文时和普通模型没区别,长上下文时不再呈线性暴涨,预算规划因此变得可预测。

把 K-EXAONE 2.0 放进开源 MoE 家族的坐标系里看,它的定位非常清楚。下表汇总了当前四个代表性模型的参数与许可证情况:

模型 总参数 激活参数 激活率 许可证 机构
K-EXAONE 2.0 750B 37B 4.9% Apache 2.0 LG AI 研究院
K-EXAONE(初代) 236B 23B 9.7% MIT LG AI 研究院
DeepSeek-V3 671B 37B 5.5% MIT 深度求索
Kimi K3 2.8T 约 72B 约 2.6% 开源(部分条款) 月之暗面

这张表最值得盯的不是绝对值,而是趋势:激活率在一年内从 9.7% 压到 4.9%,而 Kimi K3 已经做到 2.6%。如果稀疏度再压一个数量级,推理成本还会再降一个台阶。对预算敏感的团队,激活参数正在成为比总参数更重要的选型指标------下次看模型卡的时候,先看激活参数,再看总参数,顺序别反。顺便说一句,Kimi K3 的 2.6% 激活率是把双刃剑:容量上限拉满,但训练和推理的工程复杂度也拉满,不是所有团队都扛得住;K-EXAONE 2.0 选的 4.9% 恰好是"工程可控"和"成本优势"之间的一个务实折中。

三、Apache 2.0 背后是主权 AI 的算盘

K-EXAONE 2.0 由韩国科技信息通信部的主权人工智能基金会模型项目资助开发,这个背景决定了它的开源策略不是纯技术决策。2026 年 7 月,美国商务部刚刚对 Anthropic 的 Claude Fable 5 实施过 19 天的出口管制暂停;韩国、日本、欧盟都在加速"主权模型"布局。在这种局面下,一个由本国大厂主导、Apache 2.0 全放开的基础模型,是数字基础设施层面的战略对冲------你可以在贸易摩擦的任何时候,依赖一个不受任何国家出口管制约束的模型底座。

Apache 2.0 和 MIT 的区别很多人忽略:MIT 只保证"你拿去用",Apache 2.0 额外给了明确的专利授权------如果 LG 或其关联方持有相关专利,使用者不会因为实现模型细节而被起诉。对一个承载国家级 AI 战略的项目,这个条款把"商用风险"降到了接近零。这也是为什么 Apache 2.0 正在成为主权模型的事实标准:Llama 系、Gemma 系、Qwen 系全部采用或兼容它,而 K-EXAONE 2.0 的加入让这个标准阵营又多了一个重量级成员。

更深一层,K-EXAONE 2.0 的架构选择本身就是主权 AI 的"性价比策略":算力受限的国家买不到足够多的高端 GPU,就让每个 GPU 干更多的活。4.9% 的激活率意味着同样的推理集群可以服务 20 倍的请求------这是用架构创新弥补算力差距的典型打法。韩国没有中国这样庞大的本土芯片供应链,也没有美国这样宽松的算力供给,它选择的路是:把软件效率做到极致,让每一块能买到的 GPU 都物尽其用。这条路对东南亚、中东、拉美的主权 AI 项目,参考价值可能比想象中大------它们面临的约束几乎一模一样:卡难买、钱有限、但不想把数字主权交给任何一家美国公司。

对开发者而言,主权模型还有一个容易被忽视的好处:版本稳定性。闭源 API 的模型两个月换一代,接口说变就变,你的代码要跟着适配;而 Apache 2.0 的模型一旦部署,就是你自己的资产,没有弃用通知、没有价格表突变、没有数据合规的灰色地带。这在做长周期项目时是实打实的省心。当然,代价是你得自己养推理集群、自己处理安全更新------这笔账算下来,小团队通常还是 API 划算,主权模型的红利更多落在有运维能力的组织手里。

四、开发者现在能做什么

第一,本地推理。37B 激活参数配合 4-bit 量化,单卡 48GB 显存(如 A6000 / L40S)就能跑起来,消费级 24GB 显卡配合 CPU offload 也可以做实验。对韩语场景(商务文档、客服、代码注释)它的基准表现明显优于同量级通用模型,这本来就是 K-EXAONE 系列的看家领域;对中文场景,它的优势没这么突出,但作为多语言模型的基础能力是完整的,拿来跑翻译、摘要、信息抽取这类任务没有问题。

第二,私有化部署。Apache 2.0 意味着金融、医疗、政企客户可以完全离线部署,数据不出内网------在数据合规压力越来越大的 2026 年,这是闭源 API 给不了的优势。部署时优先用 vLLM 或 SGLang 这类支持 MoE 优化的推理引擎,显存占用可以比 naive 加载低 60% 以上,吞吐能再翻一倍。这类引擎对 top-k 路由的 kernel 级优化,直接决定 4.9% 激活率能不能兑现成真实的成本优势,部署前一定要先跑一遍 benchmark,别拿吞吐当参数吹。

第三,微调与蒸馏。MoE 模型的微调门槛比稠密模型高:路由器层学习率要单独调,专家并行要考虑负载均衡损失。一个稳妥的起点是从 LoRA 适配器开始,冻结大部分专家,只训练路由器和顶层,显存需求能压到全参微调的三分之一。如果要做领域蒸馏,优先蒸馏它的韩语能力而非通用能力------那是它真正的护城河,也是社区里最稀缺的部分。等社区放出 SFT 数据集的整理版本,这个动作的成本还会再降一截。

第四,关注它的韩国生态落地。LG 旗下的家电、汽车零部件业务,以及韩国公共部门的政务系统,都在测试把 K-EXAONE 2.0 接入业务流。韩国市场验证过的"主权模型+行业纵深"模式,对国内做行业大模型的公司有直接的参照价值------同样的故事,Qwen 和 DeepSeek 已经在国内讲过一遍,但韩国的执行细节(许可证策略、算力补贴、公共采购绑定)值得单独研究。主权 AI 的竞争已经不只是模型的竞争,而是整个配套制度的竞争,谁先把制度跑通,谁就拿到了下一轮的门票。

K-EXAONE 2.0 发布后,下一个值得盯的时间点是韩国科技信息通信部的主权模型二期计划------如果二期把激活率进一步压到 2% 以下,同时保持韩语基准不掉点,那"稀疏激活+主权 AI"这条路就真的跑通了。到那时,750B 参数的门槛就不是参数量,而是谁能把每个 GPU 的利用率榨得更干净。开源模型的竞争已经进入下半场:比的不再是谁的参数更多,而是谁让每一块钱算力都花得值。K-EXAONE 2.0 给出了一个值得抄的答案,剩下的就看你的场景适不适合。

相关推荐
AI街潜水的八角1 小时前
菌落微生物检测和识别2:基于深度学习YOLO26神经网络实现菌落微生物检测和识别(含训练代码和数据集)
人工智能·深度学习·神经网络
weixin_446260851 小时前
ORCA-bench:大模型智能体能否胜任线上故障值守?
人工智能
fthux1 小时前
装闭 RenoPit 源码解析(13):生成AI装修闭坑PDF报告
人工智能·ai·pdf·开源·github
独行侠影a2 小时前
Mojo:专为AI而生的“Python++”,能否真正挑战CUDA与C++的统治地位?
大数据·人工智能·深度学习
zzzzzz3102 小时前
别让大模型直接碰业务:我在 Spring Boot 里给 AI 操作加了一道“可拒绝的闸门”
人工智能·spring boot·spring
2601_960906722 小时前
一致行动人合计持股比例变动超过1%整数倍
人工智能·逻辑回归·爬山算法·散列表·启发式算法·广度优先
蓝鲨硬科技2 小时前
任利锋的“造物”野心,让AI 3D进入“可制造”时代
人工智能·3d·制造
暗黑小白2 小时前
Agent 运行时与 Harness:从教科书循环到生产级运行时
人工智能
烂蜻蜓2 小时前
AI入门教程(十七):AI安全进阶——越狱、注入、对抗与防护
人工智能·ai