目录
[一、2026 年全球开放生态的六个结论](#一、2026 年全球开放生态的六个结论)
[(二)第二阶段:DeepSeek-R1 把开放竞争推进到强化学习推理](#(二)第二阶段:DeepSeek-R1 把开放竞争推进到强化学习推理)
[(三)第三阶段:2026 年进入开放智能体系统](#(三)第三阶段:2026 年进入开放智能体系统)
[(一)MoE 成为高参数开放模型的默认答案](#(一)MoE 成为高参数开放模型的默认答案)
[1. Qwen:从模型家族升级为开放智能体平台](#1. Qwen:从模型家族升级为开放智能体平台)
[2. DeepSeek:以训练效率和可验证推理改变行业研究议程](#2. DeepSeek:以训练效率和可验证推理改变行业研究议程)
[3. Kimi:把超大 MoE 与并行代理结合](#3. Kimi:把超大 MoE 与并行代理结合)
[4. GLM:把"长时间仍能进步"定义为智能体能力](#4. GLM:把“长时间仍能进步”定义为智能体能力)
[5. MiniMax:低激活参数与模型自我演化](#5. MiniMax:低激活参数与模型自我演化)
[6. Hy3:以 21B 激活参数追求旗舰代理能力](#6. Hy3:以 21B 激活参数追求旗舰代理能力)
[7. ERNIE、Seed、Step、Intern-S1:四条差异化支线](#7. ERNIE、Seed、Step、Intern-S1:四条差异化支线)
[1. gpt-oss:OpenAI 的开放权重回归](#1. gpt-oss:OpenAI 的开放权重回归)
[2. Llama 4:生态规模仍强,但开放定义争议持续](#2. Llama 4:生态规模仍强,但开放定义争议持续)
[3. Gemma 4:端侧原生多模态](#3. Gemma 4:端侧原生多模态)
[4. Phi-4:专用小模型的高价值路线](#4. Phi-4:专用小模型的高价值路线)
[5. OLMo:真正开放科学的基准](#5. OLMo:真正开放科学的基准)
[6. Granite 与 Nemotron:企业治理和硬件优化两极](#6. Granite 与 Nemotron:企业治理和硬件优化两极)
[1. Mistral:以 Apache 2.0 构建全尺寸主权模型组合](#1. Mistral:以 Apache 2.0 构建全尺寸主权模型组合)
[2. Falcon:语言主权与混合架构](#2. Falcon:语言主权与混合架构)
[3. Aya:把多语言公平作为开放科学目标](#3. Aya:把多语言公平作为开放科学目标)
[4. Liquid AI:端侧架构搜索的代表](#4. Liquid AI:端侧架构搜索的代表)
[(一)模型定义层:Transformers 仍是事实枢纽](#(一)模型定义层:Transformers 仍是事实枢纽)
[(二)数据中心推理:vLLM 与 SGLang 双强](#(二)数据中心推理:vLLM 与 SGLang 双强)
[(三)本地与边缘:llama.cpp、GGUF、MLX 和端侧运行时](#(三)本地与边缘:llama.cpp、GGUF、MLX 和端侧运行时)
[(四)微调与后训练:从 LoRA 工厂走向代理 RL 平台](#(四)微调与后训练:从 LoRA 工厂走向代理 RL 平台)
[(二)做"总拥有成本"而不是只算 token 单价](#(二)做“总拥有成本”而不是只算 token 单价)
[十四、2026---2028 方向分析](#十四、2026—2028 方向分析)
[(一)确定性最高:MoE 与混合注意力继续普及](#(一)确定性最高:MoE 与混合注意力继续普及)
[(二)高影响:开放 RL 环境成为新护城河](#(二)高影响:开放 RL 环境成为新护城河)
干货分享,感谢您的阅读!
全球大模型开放生态已经从"发布一个可下载模型"升级为"开放一套可运行、可训练、可验证、可治理的智能系统"。权重仍然重要,但决定长期竞争力的,是数据配方、强化学习环境、推理基础设施、开放许可与可信评测能否形成闭环。
核心判断:开放大模型的竞争单位已经从 checkpoint 升级为"模型 + 数据 + RL 环境 + 推理栈 + 评测治理"的开放智能系统。
一、2026 年全球开放生态的六个结论
(一)基本结论汇总
其实从整个2026年的搜索公开资料来看,当前开源大模型整体上可以直观梳理出以下六个基本的结论:
-
"开放模型"已分裂为三种产品: 完整开放科学、宽松许可开放权重、附条件的社区权重。企业若只看"可下载",会低估许可、数据、审计和持续维护成本。
-
前沿架构已经从稠密 Transformer 转向"MoE + 混合/稀疏注意力 + 多Token预测"。 大模型在扩大总容量的同时压低每 token 激活量,目标是提升智能密度,而不是只扩大参数。
-
推理竞争正在让位于智能体竞争。 2026 年主力项目集中投入长程软件工程、搜索、工具调用、环境交互和可验证反馈;"能否在数百轮后继续进步"比单轮答题更重要。
-
中国是高参数开放权重发布最密集的区域,美国在平台、端侧、GPU优化和开放科学上更分层,欧洲强调主权部署和宽松许可,中东以阿拉伯语与混合架构形成差异化。 这是对公开发布样本的结构性观察,不是对总体研发实力的单一排名。
-
长上下文从营销指标进入系统工程。 128K、256K、1M 甚至更长窗口已经普遍,但真正决定效果的是稀疏注意力、KV缓存、检索压缩、状态管理和工具失败恢复。
-
开源的下一阶段不是"更多权重",而是"更多可验证环境"。 AgentWorld、代码沙盒、浏览器、机器人仿真和自我改进回路,将决定开放模型能否持续追近闭源前沿。
(二)全球开源大模型生态:七层协同栈

开放生态可以拆成七层:应用与智能体、编排与记忆、模型与后训练、数据与环境、训练系统、推理与硬件、评测许可治理。任何一层缺位,都可能让一个模型从"榜单很强"变成"生产不可用"。
二、发展脉络:开放大模型经历了三次跃迁

(一)第一阶段:开放权重带来本地部署与微调自由
2023---2024 年开放生态的主命题是"能否拿到权重"。Llama、Mistral、Qwen、Falcon、Gemma、Phi、OLMo 等项目把推理、量化、LoRA 微调和私有部署从少数云厂商扩展到研究机构与企业机房。这个阶段的主要创新发生在模型压缩、低比特量化、消费级硬件推理和社区微调。
但权重开放不等于训练过程开放。多数模型并未完整披露训练数据、数据清洗规则、全部中间检查点和后训练配方。因此,2024 年后"open source"与"open weights"的概念冲突逐渐显性化,OSI 与 Linux Foundation 的开放定义工作开始成为产业基础设施,而不是语义争论。R01R02
(二)第二阶段:DeepSeek-R1 把开放竞争推进到强化学习推理
2025 年初,DeepSeek-R1 以大规模强化学习验证了:在可验证任务上,模型可以在很少依赖传统监督微调的前提下形成反思、验证和长链推理行为;随后开放的蒸馏模型把这类能力快速扩散到 32B、70B 等更易部署的尺寸。R09
这次跃迁改变了开源社区的研究重心:
-
从"模仿对话风格"转向"构造可验证奖励";
-
从单一 SFT 转向 GRPO、PPO 变体、结果验证器和课程学习;
-
从只发布 instruct 模型转向同时发布 base、thinking、non-thinking 和蒸馏版本;
-
从固定推理长度转向可控思考预算,在质量、延迟与成本间动态折中。
(三)第三阶段:2026 年进入开放智能体系统
2026 年的关键词不再只是 reasoning,而是 long-horizon agentic engineering。GLM-5.1/5.2 把数百轮优化、数千次工具调用和超长软件工程任务作为核心展示;Qwen3.5/3.6 把原生多模态、百万级环境 RL 与编码代理整合;Kimi K2.5 引入 Agent Swarm;MiniMax M2.7 强调模型参与自身脚手架优化;Nemotron 3 则把长时代理拆成旗舰编排模型和高吞吐执行模型。R06R07R12R14R15R16R28R29
这意味着开放生态的最小交付物正在改变:
过去:checkpoint + tokenizer + inference.py
现在:checkpoint + 推理引擎适配 + 工具协议 + 代理框架 + RL 环境 + 评测脚手架 + 安全与许可说明
三、架构进展:MoE、混合注意力与"智能密度"

(一)MoE 成为高参数开放模型的默认答案
Qwen3.6-35B-A3B、DeepSeek-V3 系列、Kimi K2.5、GLM-5 系列、Hy3、Mistral Large 3、Nemotron 3 等都采用稀疏专家架构。它们用更大的总参数储存知识和技能,但每个 token 只激活少量专家,降低单步计算量。
需要澄清一个常见误区:激活参数小,不等于模型占用显存小。 推理仍需容纳全部或大部分权重;长上下文还会显著增加 KV cache。激活参数主要影响 FLOPs、吞吐和每 token 计算路径,而权重规模、量化格式、并行策略和缓存共同决定部署成本。
2026 年值得关注的不是"谁的总参数最大",而是三种效率:
-
智能密度:每个激活参数能产生多少有效能力;
-
系统密度:在固定 GPU、功耗和并发下能完成多少端到端任务;
-
学习密度:每单位环境交互或可验证反馈能带来多少能力增益。
(二)混合注意力与状态空间模型正在回归
纯全注意力在百万级上下文下成本高昂。DeepSeek-V3.2-Exp 的 DSA、GLM-5.2 的索引共享、Qwen3.5 的 Gated Delta Networks、Nemotron 3 的 Mamba-Transformer、Falcon H1 的 Transformer-Mamba、Liquid LFM2.5 的短卷积 + GQA,都在探索"保留全局推理能力,同时降低长序列成本"的混合结构。R10R14R07R28R31R32
这不是简单的"Transformer 被替代",而是架构进入异构化:
-
少数全注意力层负责全局路由与精确关联;
-
线性注意力、状态空间或卷积层承担高吞吐序列建模;
-
稀疏索引选择最相关 token;
-
MoE 选择最相关专家;
-
多Token预测和推测解码降低生成延迟。
(三)上下文窗口从数字竞赛进入可靠性工程
Llama 4 Scout 宣称 10M 上下文实验能力,GLM-5.2、Nemotron 3 等进入 1M,Seed-OSS 达 512K,Qwen3.5/3.6、Kimi K2.5、Hy3 等位于 256K 左右。R05R14R20R06R12R18R28
但企业真正需要测试的是:
-
长文档中部信息是否被稳定召回;
-
多轮工具调用后约束是否仍保持;
-
失败步骤是否能定位并重试,而不是污染后续状态;
-
上下文压缩是否保留关键证据与权限边界;
-
并发下 KV cache、首 token 延迟和吞吐是否可接受。
因此,1M 上下文通常不是"把所有资料一次性塞进去",而是为记忆管理、检索、分段执行和轨迹压缩提供更大的系统余量。
四、能力进展:从推理、代码到原生多模态代理

(一)推理:从固定长思维链到动态计算预算
Qwen、GLM、Hy3、Seed-OSS、gpt-oss、Nemotron 等模型都提供不同形式的 thinking/non-thinking 或 effort 控制。这一趋势的价值不是"让模型永远想更久",而是按任务难度分配推理预算:简单问答直接响应,复杂数学、代码和规划才展开深度推理。R03R06R14R18R20R28
下一步瓶颈不是思维链长度,而是:
-
能否在必要时调用工具而不是继续空想;
-
能否识别自己进入局部最优或重复循环;
-
能否把推理过程压缩成可复用状态;
-
能否用外部验证器纠错,而不依赖自我确信。
(二)代码:从补全器变成可执行的软件工程代理
Qwen3.6、GLM-5.2、Kimi K2.5、MiniMax M2.7、Hy3、Nemotron 3、Mistral Devstral/Leanstral 等项目,都把代码能力定义为"读仓库---制定计划---修改多文件---运行命令---读取错误---再次修改---提交结果"的闭环,而不再只是 HumanEval 式函数生成。R06R08R12R14R16R18R28
更值得重视的是评测单位变化:Terminal-Bench、SWE-bench、NL2Repo、KernelBench、长时编译器或数据库优化任务,更接近真实工程。GLM-5.1 的官方案例甚至追踪 600 多轮迭代,讨论模型是否会在长时间后停滞。R15
(三)多模态:从"加一个视觉编码器"走向统一感知与行动
Qwen3.5、Kimi K2.5、Gemma 4、Llama 4、ERNIE 4.5、Intern-S1、Phi-4 Reasoning Vision 代表不同路线:
-
统一早期融合:文本、图像、音频、视频在预训练阶段共同进入模型;
-
端侧多模态:Gemma 4 12B 在 16GB 级设备上运行音视频与图像理解;
-
科学多模态:Intern-S1 把科学图像、公式、时间序列和物理信号作为重点;
-
视觉推理专用小模型:Phi-4 15B 集中解决图表、OCR、GUI、数学视觉;
-
异构专家:ERNIE 4.5 同时保留跨模态共享与模态专属专家。R07R12R24R05R19R22R25
多模态的关键衡量标准也在变化:不只是"看懂图片",而是能否定位屏幕元素、操作 GUI、读取长视频、把视觉证据转成工具动作,并在动作后重新观察环境。
(四)端侧:小模型重新成为战略主线
Gemma 4、Phi-4、LFM2.5、Falcon H1、Granite Nano、Qwen 小尺寸和 Mistral 小模型表明,端侧开放模型不是前沿模型的简化版,而是独立赛道。它们强调:
-
数据不离开设备;
-
断网可用和低延迟;
-
CPU、NPU、移动 GPU 与 Apple Silicon 支持;
-
量化后的工具调用、RAG 和结构化输出;
-
与云端旗舰模型形成分层路由。
未来常见架构可能是"端侧 1B--15B 模型处理感知、隐私与高频操作;云端大 MoE 负责复杂规划和少数高难任务"。
五、主力模型全景表
下表记录的是 官方公开规格与明确路线,不是能力排名。参数中的"A"表示每 token 激活参数。
| 机构 | 主力开放模型 | 总参数/激活 | 上下文 | 模态 | 许可 | 开放级 | 重点方向 |
|---|---|---|---|---|---|---|---|
| 阿里巴巴 Qwen | Qwen3.6-35B-A3B | 35B / A3B | 262K | 原生多模态 | Apache-2.0 | B | 智能体编码、仓库级推理、201种语言/方言(3.5) |
| DeepSeek | DeepSeek-V3.2-Exp | 671B / A37B | 128K | 文本 | MIT | B | 强化学习推理、稀疏注意力、低成本训练 |
| 月之暗面 Moonshot | Kimi K2.5 | 1000B / A32B | 256K | 原生多模态 | 自定义MIT变体 | C | 多模态智能体、并行代理、MuonClip |
| 智谱 Z.ai | GLM-5.2 | 744B / A40B | 1000K | 文本/系列多模态 | MIT(5.1明确) | B | 长时软件工程、1M上下文、DSA |
| MiniMax | MiniMax-M2.7 | 230B / A10B | 196K | 文本 | 非商业许可 | C | 低激活MoE、Agent Teams、技能与动态工具搜索 |
| 腾讯混元 | Hy3 | 295B / A21B | 256K | 文本 | 自定义模型许可 | C | 推理、上下文学习、代码与智能体 |
| 百度 | ERNIE-4.5-VL-424B-A47B | 424B / A47B | 128K | 多模态 | Apache-2.0(代码;模型需核验) | C | 异构模态MoE、Paddle/ERNIEKit |
| 字节跳动 Seed | Seed-OSS-36B | 36B | 512K | 文本 | Apache-2.0 | B | 长上下文、国际化、研究可审计性 |
| 阶跃星辰 | Step-3.5-Flash | 196B / A11B | 256K | 文本 | 自定义模型许可 | C | 高吞吐推理与智能体 |
| 上海AI实验室 | Intern-S1 | 241B / A22B | 128K | 科学多模态 | Apache-2.0/模型许可 | C | 科学图像、公式、时序与物理信号 |
| OpenAI | gpt-oss-120b | 117B / A5.1B | 128K | 文本 | Apache-2.0 | B | 单80GB GPU部署、工具调用、安全评估 |
| Meta | Llama 4 Maverick | 400B / A17B | 1000K | 原生多模态 | Llama Community License | C | 原生多模态MoE、超长上下文、生态规模 |
| Gemma 4 12B | 12B | 128K | 音频/视频/图像/文本 | Gemma License | C | 16GB本地部署、端侧多模态、140+语言 | |
| Microsoft | Phi-4-Reasoning-Vision-15B | 15B | 16K | 图像+文本 | MIT | B | 小模型推理、OCR、GUI与数学视觉 |
| Ai2 | OLMo 3 32B | 32B | 65K | 文本 | Apache-2.0 | A | 数据、代码、检查点与模型流全追溯 |
| IBM | Granite 4.1 30B | 30B | 512K | 文本/专项模型 | Apache-2.0 | B | 企业治理、长上下文、签名与风险评估 |
| NVIDIA | Nemotron 3 Ultra | 550B / A55B | 1000K | 文本/系列多模态 | NVIDIA Open Model / OpenMDW | C | Mamba-Transformer MoE、多代理与Blackwell优化 |
| Mistral AI | Mistral Large 3 | 675B / A41B | 256K | 多模态家族 | Apache-2.0 | B | 大MoE+3/8/14B小模型组合 |
| Cohere For AI | Tiny Aya / Aya Expanse | 8B | 32K | 文本 | CC-BY-NC / 研究许可 | C | 低资源语言、全球研究协作 |
| TII | Falcon H1R 7B | 7B | 262K | 文本 | TII Falcon License | C | Transformer-Mamba混合、阿拉伯语主权AI |
| Liquid AI | LFM2.5-8B-A1B | 8.3B / A1.5B | 128K | 文本/端侧 | LFM Open License | C | 卷积+注意力混合、消费级硬件 |
| xAI | Grok-1(历史) | 314B / A86B | 8K | 文本 | Apache-2.0 | D | 历史权重与当前开源代理工具分离 |
(一)中国主力路线
1. Qwen:从模型家族升级为开放智能体平台
Qwen 的优势不只在模型数量,而在纵向完整度。Qwen3.5 把原生视觉语言基础、混合注意力 MoE、超大规模代理环境 RL 和 201 种语言/方言放进同一代模型;Qwen3.6 进一步强化仓库级编码与"思考保留"。所有公开权重采用 Apache-2.0。R06R07
其生态同时包含 Qwen Code、Qwen-Agent、Qwen3-Coder、视觉、音频、图像生成、Embedding、AgentWorld 和机器人套件。Qwen 因而代表一种"开放平台型"路线:基础模型负责能力上限,代理框架和环境负责可执行性,模型家族覆盖不同算力与模态。
重点成就:
-
35B 总参数、3B 激活的 Qwen3.6-A3B 展现极高智能密度;
-
Qwen3.5 用统一多模态预训练替代"文本模型外接视觉塔"的传统拼装;
-
Qwen3-Coder 将大规模可执行任务合成、环境交互和 RL 用于编码代理;
-
Apache-2.0 降低企业二次开发和再分发阻力。
客观限制:主力模型家族更新速度快,推理框架常需主分支或最新版本;自报基准和实际生产脚手架差异需要企业自行复测。
2. DeepSeek:以训练效率和可验证推理改变行业研究议程
DeepSeek-V3 用 671B 总参数、37B 激活、MLA、DeepSeekMoE、无辅助损失负载均衡和多Token预测建立高效大 MoE;R1 进一步用大规模 RL 推动推理能力,并开放蒸馏模型。R09R11
V3.2-Exp 引入 DeepSeek Sparse Attention,目标是在长上下文中降低注意力成本;其 MIT 许可和开放推理代码维持了较强可部署性。R10
重点成就:
-
把"RL 能否直接产生推理行为"从学术问题变成产业可复制路线;
-
通过蒸馏使推理能力进入更小模型;
-
以架构和训练协同优化证明开放模型可以用更低训练成本达到高竞争力。
客观限制:截至本文时点,最新 DeepSeek V4 Preview 主要是 API 预览,不能把 API 新版本与已开放的 V3.2-Exp 权重混为一谈;开放权重不等于完整开放训练数据。
3. Kimi:把超大 MoE 与并行代理结合
Kimi K2.5 是 1T 总参数、32B 激活、256K 上下文的原生多模态代理模型,并把 Agent Swarm 作为核心特征。其训练延续 MuonClip 和大规模混合视觉/文本数据路线。R12R13
重点成就:以较低激活量承载超大总容量;将单代理串行执行扩展到并行代理分工;长程编码和视觉代理形成统一模型。
客观限制:模型许可包含大型商业产品的展示义务等自定义条款,需要单独审阅;1T 权重意味着即使激活量低,私有部署仍需要高昂显存和分布式工程。
4. GLM:把"长时间仍能进步"定义为智能体能力
GLM-5 系列面向复杂系统工程。GLM-5.1 展示数百轮数据库优化和数千次工具调用,GLM-5.2 扩展到 1M 上下文并引入 DSA IndexShare,以减少超长上下文索引成本。R14R15
重点成就:把长程任务的 productive horizon------额外运行时间是否仍能带来改进------作为公开研究对象;提供 effort level 控制;同时有 GLM-4.6V 等开放多模态工具调用分支。
客观限制:厂商长程基准高度依赖代理脚手架、运行预算和环境,不能直接等同于裸模型能力;GLM-5.2 的全部许可与权重版本应以具体仓库为准。
5. MiniMax:低激活参数与模型自我演化
MiniMax M2 系列以约 230B 总参数、约 10B 激活面向代码与代理。M2.7 宣称模型参与构建技能、代理脚手架和训练改进循环。R16
重点成就:把"模型帮助训练下一版模型"从概念演示推进到实际研发流程;以很低激活量支持复杂工具调用。
客观限制:M2.7 当前许可明确限制商业使用并要求事先授权,因此它是典型的"权重可得但不适合默认商用"的案例。R17
6. Hy3:以 21B 激活参数追求旗舰代理能力
腾讯 Hy3 是 295B 总参数、21B 激活、256K 上下文的 MoE,并提供快慢思考、微调和 RL 后训练材料。R18
重点成就:在相对可控的激活量下强化代码、搜索、上下文学习和代理任务;从 Preview 到正式版吸收 50 多个产品反馈,体现从模型评测走向产品闭环。
客观限制:需要核验具体模型许可和可商用边界;官方比较仍以自报评测为主。
7. ERNIE、Seed、Step、Intern-S1:四条差异化支线
-
ERNIE 4.5:一次开放 10 个模型变体,最大 424B/A47B,并用异构模态专家同时实现参数共享与模态专属能力;ERNIEKit 提供训练和压缩工具。R19
-
Seed-OSS:36B 密集模型、512K 上下文、可调思考预算,Apache-2.0;同时开放含/不含合成数据版本,便于研究合成数据影响。R20
-
Step-3.5-Flash:196B/A11B、MTP-3,强调高吞吐推理和智能体"智能密度"。R21
-
Intern-S1:235B MoE语言骨干 + 6B视觉编码器,在 5T 多模态 token 中投入大量科学域数据,强化公式、图像和时间序列科学推理。R22
(二)美国与开放科学主力路线
1. gpt-oss:OpenAI 的开放权重回归
OpenAI 在 2025 年发布 gpt-oss-120b 与 20b,均为 Apache-2.0。120b 约 117B 总参数、5.1B 激活,可在单张 80GB GPU 上运行;20b 面向约 16GB 内存设备。两者支持可调推理、工具调用和可见思维链。R03R04
重点成就:证明前沿商业实验室可以把安全评测、工具使用和推理能力打包为可本地运行的开放权重模型;极低激活比提升部署效率。
客观限制:模型以英文文本为主,不是原生多模态;开放权重并未公开完整训练数据和训练流水线,因此属于 B 级而不是完整开放科学。
2. Llama 4:生态规模仍强,但开放定义争议持续
Llama 4 Scout 和 Maverick 都采用原生多模态 MoE。Scout 为 109B 总参数、17B 激活并强调 10M 上下文实验能力;Maverick 为 400B 总参数、17B 激活、1M 上下文。R05
重点成就:在巨大开发者与云平台生态上推进原生多模态和超长上下文;众多推理、量化和微调工具优先适配 Llama 格式。
客观限制:Llama Community License 包含使用条件,不是 OSI 批准的开源许可;2026 年 Meta 的前沿 Muse 系列并未同步开放权重,说明 Meta 也在采用"开放生态 + 闭源前沿产品"的双轨策略。
3. Gemma 4:端侧原生多模态
Gemma 4 12B 面向 16GB 级本地设备,是无独立编码器、可原生接收音频和视频的中型多模态模型,并支持 140 多种语言和端侧智能体工作流。R24R48
重点成就:把多模态、代码执行与代理能力带到笔记本和移动生态;与 LiteRT-LM 等端侧推理栈结合。
客观限制:Gemma 使用自定义许可;端侧内存可运行不等于在所有设备上都能达到交互式速度,量化、NPU算子和功耗仍是关键。
4. Phi-4:专用小模型的高价值路线
Phi-4-Reasoning-Vision-15B 采用 MIT 许可,15B 参数、16K 上下文,重点覆盖视觉数学、图表、OCR、GUI 定位和计算机使用。R25
重点成就:用相对紧凑尺寸聚焦高价值视觉推理任务,体现"专用能力密度"高于无差别扩参的路线。
客观限制:上下文较短,语言和模态覆盖不如大一统多模态模型;适合作为分层系统中的专用执行器。
5. OLMo:真正开放科学的基准
OLMo 3 的核心成就不是单项榜单第一,而是公开完整模型流和训练数据追溯。研究者可以访问数据、训练代码、中间检查点和评测流程,研究模型如何学习、遗忘、形成知识和产生偏差。R26R49
重点成就:使预训练动力学、知识来源、知识截止时间和可重复评测成为可审计科学;这是多数开放权重模型无法提供的能力。
客观限制:完整开放的成本高,能力迭代速度可能不如商业大模型;但其社会和科学价值不能用单一榜单衡量。
6. Granite 与 Nemotron:企业治理和硬件优化两极
IBM Granite 4.1 采用 Apache-2.0,提供 3B、8B、30B 密集模型,强调企业数据治理、GRC 评测、长上下文和模型签名。R27
NVIDIA Nemotron 3 则以混合 Mamba-Transformer MoE、1M 上下文、多环境 RL 和 Blackwell 优化为核心。Ultra 为 550B/A55B,面向复杂编排;Super 为 120B/A12B,面向高频代理执行。R28R29
二者共同表明:开放模型正在成为企业基础设施产品,而不只是研究发布。一个侧重治理和可控,一个侧重吞吐和硬件协同。
(三)欧洲、中东与全球协作路线
1. Mistral:以 Apache 2.0 构建全尺寸主权模型组合
Mistral 3 同时发布 3B、8B、14B 密集模型和 675B/A41B 的 Mistral Large 3,全部 Apache-2.0。R23
重点成就:覆盖端侧、企业私有化和旗舰集群;许可清晰,适合欧洲主权 AI、本地化和行业定制。Leanstral、Devstral 等专项模型把开放延伸到形式化证明和代码代理。
客观限制:部分最新商业模型采用不同许可或仅服务化,必须按具体版本判断,不能把整个 Mistral 产品线视为同一开放等级。
2. Falcon:语言主权与混合架构
TII 的 Falcon H1/H1R 使用 Transformer-Mamba 混合结构,突出长序列效率和低内存;Falcon H1 Arabic 则集中建设高质量阿拉伯语模型。R31
重点成就:证明区域实验室可以用开放模型建立语言主权、研究品牌和本地产业生态,而不必复制中美的超大参数竞赛。
3. Aya:把多语言公平作为开放科学目标
Cohere For AI 的 Aya 通过全球研究协作、低资源语言数据和多语指令模型,推动开放模型服务更广泛语言社区。R30
客观限制:部分 Aya 模型使用非商业研究许可,更适合科研、教育和公益场景;企业商用需要核验版本。
4. Liquid AI:端侧架构搜索的代表
LFM2.5-8B-A1B 以 8.3B 总参数、1.5B 激活、128K 上下文面向消费级硬件工具调用。其混合短卷积 + 少量 GQA 架构通过硬件在环搜索设计。R32
重点成就:不是简单缩小 Transformer,而是从硬件约束反向设计模型;强化 CPU、NPU 和移动设备上的本地 AI。
六、许可、治理与"开放权重不等于可商用"

许可是模型选型中的硬约束。Apache-2.0 和 MIT 通常允许商业使用、修改和再分发,但仍需保留版权与许可文本;Llama、Gemma、Kimi、NVIDIA、Falcon 等自定义许可可能加入规模阈值、用途限制、品牌展示或再分发要求;非商业许可则不能默认用于收入相关产品。
企业应建立 Model BOM(模型物料清单),至少记录:
-
模型权重与版本哈希;
-
模型许可、代码许可、数据许可;
-
是否包含远程自定义代码;
-
量化、蒸馏和微调衍生版本的来源;
-
推理引擎、算子、容器与驱动版本;
-
安全评测、红队结果和已知限制;
-
输出归属、隐私、地域和下游再分发条款。
欧盟 AI Act 已对通用 AI 模型提出技术文档、下游信息和训练内容透明度等义务,开放发布并不自动免除所有责任。R46 Linux Foundation 的 OpenMDW 等新型模型许可框架也在尝试把权重、架构、代码、数据和文档纳入更完整的许可对象。R47
七、全球区域格局:开放已成为产业政策与主权能力

(一)中国:用高频开放缩短生态反馈周期
中国模型厂商在 2025---2026 年形成了最密集的高参数开放权重发布群:Qwen、DeepSeek、Kimi、GLM、MiniMax、Hy3、ERNIE、Seed、Step、InternLM 等覆盖通用、推理、代码、视觉、语音、科学和端侧。其共同特征是:MoE、高激活效率、工具调用、中文与多语言、国产硬件适配、快速产品反馈。
这种策略的价值在于把模型能力快速扩散给云厂商、芯片厂商、应用团队和高校;代价是不同项目的许可、数据透明度和长期维护质量差异较大。
(二)美国:从单一开放战略转向分层组合
美国生态呈现明显分层:OpenAI 发布 gpt-oss 但保留最前沿闭源服务;Meta 保留 Llama 4 开放生态,同时 Muse 前沿产品闭源;Google 用 Gemma 深耕端侧;Microsoft 用 Phi 做小而专;Ai2 做完整开放科学;IBM 做企业治理;NVIDIA 用 Nemotron 联动硬件和代理栈。
这意味着"美国是否开放"不是一个问题,正确问题是:哪一层开放、开放到什么程度、开放服务于哪种商业模式。
(三)欧洲:开放许可与主权部署形成战略一致性
Mistral 的 Apache 系列与欧洲本地云、数据主权和监管环境高度契合。欧洲路线不一定追逐最大参数,而是强调:权重可控、部署位置可控、许可可用、语言与行业可定制。
(四)中东与全球开放科学:语言主权和公共品
Falcon 以阿拉伯语和混合架构建立区域模型能力;Aya、OLMo 等项目则把开放视为全球语言公平、科学复现和公共基础设施。它们提醒市场:开放模型的价值不只体现在商业榜单,还体现在研究可验证性、文化覆盖和教育可及性。
八、工具链进展:模型格式正在成为开放生态的"ABI"
2026 年模型是否成功,很大程度取决于能否被主流工具链迅速接入。
(一)模型定义层:Transformers 仍是事实枢纽
Hugging Face Transformers 统一模型配置、权重加载、处理器和生成接口,并成为训练框架、推理引擎和本地工具之间的枢纽。R36 新模型若需要长期依赖 trust_remote_code,通常意味着生态适配尚未成熟,也增加供应链风险。
(二)数据中心推理:vLLM 与 SGLang 双强
vLLM 通过 PagedAttention、连续批处理、前缀缓存、量化和多种并行方式提供高吞吐服务;SGLang 强调低延迟、高吞吐、Radix 缓存、结构化生成以及对多种 GPU、CPU、TPU 和 NPU 的支持。R33R34
模型发布后能否在数天内获得 vLLM/SGLang 支持,已经成为生态成熟度指标。Qwen、DeepSeek、Kimi、GLM、MiniMax、Hy3 等官方文档通常直接给出这两种部署方式。
(三)本地与边缘:llama.cpp、GGUF、MLX 和端侧运行时
llama.cpp 以最少依赖在广泛硬件上运行模型,并用 GGUF 形成量化模型交换格式。R35 Apple Silicon 上的 MLX、Android/嵌入式上的 LiteRT/ExecuTorch,以及厂商 NPU 运行时,共同推动 1B--15B 模型进入个人设备。
(四)微调与后训练:从 LoRA 工厂走向代理 RL 平台
LLaMA-Factory 等项目把 SFT、LoRA、DPO、GRPO 和多模型适配产品化;OpenRLHF、verl 等则面向大规模 RL、奖励模型、分布式 rollout 和异步训练。R37R38R39
真正的差距正在从"会不会微调"转向:
-
能否持续生成高质量可验证任务;
-
能否并行运行数千到数万个环境;
-
能否检测奖励黑客、模式坍缩和评测泄漏;
-
能否把失败轨迹转化为下一轮课程数据。
(五)评测:可重复性比榜单名次更稀缺
OpenCompass、lm-evaluation-harness、OLMES 和 HELM 等项目提供统一任务、配置、报告和可重复评测基础。R40R41R42R43 但智能体评测仍然困难,因为结果高度依赖工具、环境版本、网络状态、预算和随机性。
建议企业采用四层评测:
-
静态能力:知识、推理、语言、视觉、代码;
-
工具能力:函数调用、JSON、权限和错误恢复;
-
端到端任务:真实仓库、真实文档、真实业务流程;
-
运营指标:成功率、人工接管率、时延、GPU小时、事故率和回滚率。
九、数据进展:公开语料、合成数据与可验证环境
开放模型的训练数据正在形成三层结构:
-
通用开放语料:Dolma、FineWeb 等提供大规模清洗网页和文档,改善可复现预训练;R44R45
-
高质量合成数据:由强模型生成推理、代码、工具轨迹,再通过规则、执行器或验证器筛选;
-
交互环境数据:模型在代码沙盒、浏览器、游戏、数据库、机器人仿真中行动,获得结果反馈。
合成数据解决了稀缺高质量监督问题,但也带来教师偏差复制、风格同质化和模型坍缩风险。未来高价值数据不一定是更多文本,而是 带状态、动作、结果、失败原因和验证信号的轨迹。
Seed-OSS 同时发布含/不含合成数据的基础版本,是值得关注的研究设计;OLMo 的数据追溯则使研究者能检验知识来源;Qwen AgentWorld、GLM 长程任务、MiniMax 自我优化等项目表明,环境将成为新一代"数据集"。
十、开放智能体:模型、环境与验证器的闭环

一个可用的智能体至少需要七个组件:目标与约束、规划与分解、模型推理、工具与环境、验证反馈、记忆状态、复盘与再规划。
2026 年主要研究方向集中在:
-
长程一致性:数百轮后仍保持目标、约束和代码状态;
-
失败恢复:识别工具超时、权限错误、测试失败并局部回滚;
-
自我评估:在没有明确数值奖励时判断质量;
-
多代理并行:把检索、编码、测试、审阅分给不同代理;
-
安全执行:沙盒、最小权限、网络边界和人类批准;
-
轨迹压缩:把长历史转为结构化状态,而不是无限追加 token。
多代理并不自动提升效果。它增加协调、重复劳动和错误传播。只有任务可分解、验证器可靠、通信成本可控时,Agent Swarm 才可能比单代理更优。
十一、客观比较:如何理解各主力模型的"重点成就"
开放模型的成就可分为五类,不能只看通用基准:
-
能力前沿:DeepSeek-R1 的 RL 推理、GLM/Kimi/Qwen 的长程代理、Llama/Qwen/Kimi 的原生多模态;
-
效率前沿:Qwen3.6 A3B、gpt-oss A5.1B、Step A11B、LFM A1.5B 等智能密度;
-
开放前沿:OLMo 的完整模型流、Mistral/Qwen/gpt-oss/Granite 的宽松许可;
-
部署前沿:Gemma、Phi、LFM、Falcon、Granite Nano 的端侧与专用模型;
-
生态前沿:Qwen、Llama、NVIDIA、Hugging Face 工具链的模型---框架---硬件协同。
因此,不存在脱离约束的"最佳开放模型"。对科研机构,OLMo 的可追溯性可能比更高榜单分数重要;对金融企业,许可、数据驻留和稳定 JSON 可能比创意写作重要;对手机应用,12B 以下模型的延迟与功耗才是核心;对代码代理,长时工具调用和测试通过率比 MMLU 更重要。
十二、企业选型与部署建议

(一)按场景建立候选池
-
完整开放研究与可审计性:OLMo 3 / OLMo Hybrid、Dolma、OLMES;
-
宽松许可企业部署:Qwen、Mistral、gpt-oss、Phi、Granite、Seed-OSS;
-
高端代码与智能体:Qwen3.6、DeepSeek、GLM-5.2、Kimi K2.5、Hy3、Nemotron 3、Mistral Devstral;
-
中文与本地化:Qwen、DeepSeek、GLM、Hy3、ERNIE、Seed、Step、InternLM;
-
端侧和隐私:Gemma 4、Phi-4、LFM2.5、Granite Nano、Falcon H1、Qwen 小尺寸;
-
科学与专业推理:Intern-S1、Phi-4 Vision、Leanstral、领域微调模型。
(二)做"总拥有成本"而不是只算 token 单价
私有部署成本包括:权重显存、KV cache、冗余副本、峰值并发、量化损失、工程人力、框架升级、安全补丁、监控、评测、许可审阅和模型更新。API 成本则包括 token、缓存、工具调用、数据边界、供应商锁定和服务波动。
一个常见最优解是 混合路由:小型本地模型处理隐私、高频和结构化任务;大开源 MoE 处理复杂私有任务;少量闭源前沿 API 处理极难、低频、可脱敏任务。路由器根据任务风险、难度、延迟和预算选择模型。
(三)建立持续模型评审,而不是一次性选型
开放模型更新周期已经缩短到数周或数月。企业应维护:
-
版本冻结与升级窗口;
-
自有评测基线和回归阈值;
-
模型与推理框架兼容矩阵;
-
许可和安全变更监控;
-
蓝绿发布、流量镜像和一键回滚;
-
提示词、工具协议和结构化输出版本管理。
十三、风险、局限与常见误判

(一)误判一:开源一定更便宜
大模型私有化可以降低高并发边际成本和数据外流风险,但超大 MoE 的权重、并行、缓存和运维可能远高于 API。只有在请求量、利用率、硬件折旧和人力明确时才能比较。
(二)误判二:上下文越长,记忆越可靠
长窗口只是容量,不保证检索准确、规则保持或跨步骤一致。超长上下文还可能增加干扰、延迟和成本。系统仍需检索、摘要、状态机和验证器。
(三)误判三:激活参数等于显存需求
激活参数影响每 token 计算,但所有专家权重通常仍需驻留或分片;MoE 还引入路由、专家并行和网络通信成本。
(四)误判四:开放权重自动可审计
没有训练数据、数据来源、后训练配方和中间检查点,只能审计模型输出和局部行为,难以追溯知识来源和系统性偏差。OLMo 等完整开放项目在这方面仍是少数。
(五)误判五:智能体基准可以直接比较裸模型
代理脚手架、工具描述、运行时间、重试、网络、并行代理数和预算都会改变结果。必须区分 model-only、model + standard harness、best self-reported harness 三种成绩。
十四、2026---2028 方向分析

(一)确定性最高:MoE 与混合注意力继续普及
高端开放模型将继续扩大总容量但压低激活量;长上下文架构会进一步混合全注意力、稀疏索引、线性注意力、状态空间和卷积。推理引擎将围绕异构层、专家并行和分离式 prefill/decode 优化。
(二)高影响:开放 RL 环境成为新护城河
未来模型差距更多来自环境而非纯语料。谁能低成本生成可验证任务、并行运行环境、稳定训练长程策略并防止奖励黑客,谁就能持续提升代理能力。开放社区需要像数据集一样共享环境、验证器、失败轨迹和复现实验。
(三)高影响但早期:模型自我演化
MiniMax M2.7、GLM 长程优化、代码代理自动改进脚手架都指向模型参与研发自身。短期内它更像"自动化机器学习工程师",而不是完全自主自我升级。关键约束是评测是否可信、改动是否可回滚、模型是否会过拟合内部基准。
(四)多代理将从"角色扮演"转向系统调度
未来多代理系统会更像分布式计算:有任务队列、权限、状态、成本预算、超时、审阅和一致性协议。代理数量不是能力指标;有效并行度和可验证产出才是。
(五)端侧模型与云端模型形成协同
端侧原生多模态、NPU 推理和本地工具调用会快速增长。设备负责持续感知、隐私数据和实时动作;云端负责复杂规划、跨域知识和高难推理。开放权重使这种分层架构不被单一云 API 锁定。
(六)完整开放科学将成为监管和科研的重要对照组
即使商业最强模型仍主要开放权重,完整开放项目会在安全、知识溯源、版权研究、偏差分析和训练动力学中发挥不可替代作用。未来可能形成两种价值尺度:产品能力前沿和可审计科学前沿。
(七)许可将逐渐机器可读
随着模型、数据、代码、量化和衍生权重形成复杂供应链,企业需要类似 SPDX/SBOM 的 Model BOM 和机器可读许可。模型签名、哈希、来源证明和 OpenMDW 类框架会进入标准部署流程。
十五、最终判断
全球开放大模型生态已经越过"能否追上闭源聊天模型"的阶段。新的问题是:
-
能否在真实环境中连续工作数小时而不失控;
-
能否把百万级上下文转化为稳定状态,而不是更长提示词;
-
能否让模型、工具、数据和环境形成可验证学习闭环;
-
能否在清晰许可下跨硬件、跨云、跨地域部署;
-
能否让研究者追溯模型从哪里学到知识、为什么失败以及如何修复。
开放生态的下一场竞争,不是 checkpoint 数量,而是开放系统的完整度。
对模型研发者,重点应从规模叙事转向环境、验证与复现;对企业,重点应从榜单采购转向约束驱动的系统选型;对监管和科研共同体,重点应推动数据透明、模型物料清单、可重复评测和开放科学公共品。
在这个意义上,Qwen、DeepSeek、Kimi、GLM、MiniMax、Hy3、Mistral、gpt-oss、Llama、Gemma、Phi、OLMo、Granite、Nemotron、Falcon 与 LFM 并不是在同一条单轴上竞争。它们分别押注能力、效率、生态、端侧、主权、治理和科学可审计性。真正成熟的全球开放生态,恰恰需要这些路线同时存在。
参考和评估说明
开放模型评估清单
技术
-
权重是否可稳定下载,是否提供哈希和签名?
-
是否被 Transformers、vLLM、SGLang、llama.cpp 等主流框架原生支持?
-
总参数、激活参数、权重显存和 KV cache 是否分别核算?
-
长上下文是否在自有数据与并发条件下测试?
-
工具调用、JSON、重试、超时和失败恢复是否稳定?
数据与质量
-
训练数据和后训练数据的来源、截止时间、许可是否披露?
-
是否存在明显评测污染或厂商自报脚手架优势?
-
是否使用自有盲测、真实流程和人工审阅?
-
是否记录幻觉、拒答、偏差和安全边界?
法律与治理
-
权重、代码、数据和衍生模型许可是否分别审阅?
-
是否存在月活、营收、地域、署名和用途限制?
-
是否支持数据删除、审计日志、访问控制和模型回滚?
-
是否建立 Model BOM、版本记录和供应链扫描?
运营
-
每成功任务的 GPU 小时、延迟和人工接管率是多少?
-
峰值并发、故障降级和多模型路由是否验证?
-
升级新权重或推理框架时是否有回归测试?
-
是否保留可替换模型与供应商的接口层?
参考资料说明
-
R01 Open Source Initiative:Open Source AI Definition 1.0 \ The Open Source AI Definition -- 1.0 -- Open Source Initiative
-
R02 Linux Foundation:Model Openness Framework Specification \ https://www.linuxfoundation.org/resources/publications/model-openness-framework
-
R03 OpenAI:Introducing gpt-oss \ https://openai.com/index/introducing-gpt-oss/
-
R04 OpenAI:gpt-oss Model Card \ https://openai.com/index/gpt-oss-model-card/
-
R05 Meta:Llama 4 Model Card / GitHub \ https://github.com/meta-llama/llama-models/blob/main/models/llama4/model_card.md
-
R06 Qwen Team:Qwen3.6 official repository \ GitHub - QwenLM/Qwen3.6: Qwen3.6 is the large language model series developed by Qwen team, Alibaba Group. · GitHub
-
R07 Qwen Team:Qwen3.5 model card \ https://huggingface.co/Qwen/Qwen3.5-9B
-
R08 Qwen Team:Qwen3-Coder \ GitHub - QwenLM/Qwen3-Coder: Qwen3-Coder is the code version of Qwen3, the large language model series developed by Qwen team. · GitHub
-
R09 DeepSeek:DeepSeek-R1 \ GitHub - deepseek-ai/DeepSeek-R1 · GitHub
-
R10 DeepSeek:DeepSeek-V3.2-Exp \ GitHub - deepseek-ai/DeepSeek-V3.2-Exp · GitHub
-
R11 DeepSeek:DeepSeek-V3 \ GitHub - deepseek-ai/DeepSeek-V3 · GitHub
-
R12 Moonshot AI:Kimi K2.5 model card \ https://huggingface.co/moonshotai/Kimi-K2.5
-
R13 Moonshot AI:Open-source research repository \ Moonshot AI · GitHub
-
R14 Z.ai:GLM-5.2: Built for Long-Horizon Tasks \ https://z.ai/blog/glm-5.2
-
R15 Z.ai:GLM-5.1: Towards Long-Horizon Tasks \ https://z.ai/blog/glm-5.1
-
R16 MiniMax:MiniMax-M2.7 \ GitHub - MiniMax-AI/MiniMax-M2.7 · GitHub
-
R17 MiniMax:MiniMax-M2.7 License \ MiniMax-M2.7/LICENSE at main · MiniMax-AI/MiniMax-M2.7 · GitHub
-
R18 Tencent Hunyuan:Hy3 \ GitHub - Tencent-Hunyuan/Hy3: Hy3 (295B A21B), a leading reasoning and agent model in its size, with great cost efficiency. · GitHub
-
R19 Baidu:ERNIE 4.5 \ GitHub - PaddlePaddle/ERNIE: The official repository for ERNIE 4.5 and ERNIEKit -- its industrial-grade development toolkit based on PaddlePaddle. · GitHub
-
R20 ByteDance Seed:Seed-OSS \ GitHub - ByteDance-Seed/seed-oss · GitHub
-
R21 StepFun:Step-3.5-Flash \ GitHub - stepfun-ai/Step-3.5-Flash: Fast, Sharp & Reliable Agentic Intelligence · GitHub
-
R22 Shanghai AI Laboratory:Intern-S1 \ GitHub - InternLM/Intern-S1: A Scientific Multimodal Foundation Model · GitHub
-
R23 Mistral AI:Introducing Mistral 3 \ https://mistral.ai/news/mistral-3/
-
R24 Google:Gemma 4 12B Developer Guide \ https://developers.googleblog.com/gemma-4-12b-the-developer-guide/
-
R25 Microsoft:Phi-4-Reasoning-Vision-15B Model Card \ https://huggingface.co/microsoft/Phi-4-reasoning-vision-15B
-
R26 Ai2:Olmo 3: complete model flow \ https://allenai.org/blog/olmo3
-
R27 IBM:Granite 4.1 language models \ GitHub - ibm-granite/granite-4.1-language-models · GitHub
-
R28 NVIDIA:Nemotron 3 Ultra \ NVIDIA Nemotron 3 Ultra Powers Faster, More Efficient Reasoning for Long-Running Agents | NVIDIA Technical Blog
-
R29 NVIDIA:Nemotron 3 Super \ https://developer.nvidia.com/blog/introducing-nemotron-3-super-an-open-hybrid-mamba-transformer-moe-for-agentic-reasoning/
-
R30 Cohere For AI:Aya open science initiative \ Aya | Cohere Labs
-
R31 TII:Falcon H1 \ Falcon H1 - Falcon LLM
-
R32 Liquid AI:LFM2.5-8B-A1B \ LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts --- Blog --- Liquid AI
-
R33 vLLM:vLLM official repository \ GitHub - vllm-project/vllm: A high-throughput and memory-efficient inference and serving engine for LLMs · GitHub
-
R34 SGLang:SGLang official repository \ GitHub - sgl-project/sglang: SGLang is a high-performance serving framework for large language models and multimodal models. · GitHub
-
R35 ggml-org:llama.cpp \ GitHub - ggml-org/llama.cpp: LLM inference in C/C++ · GitHub
-
R36 Hugging Face:Transformers documentation \ https://huggingface.co/docs/transformers/index
-
R37 Hiyouga:LLaMA-Factory \ GitHub - hiyouga/LlamaFactory: Unified Efficient Fine-Tuning of 100+ LLMs & VLMs (ACL 2024) · GitHub
-
R38 OpenRLHF:OpenRLHF \ GitHub - OpenRLHF/OpenRLHF: An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL) · GitHub
-
R39 Volcano Engine:verl \ GitHub - verl-project/verl: verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework · GitHub
-
R40 OpenCompass:OpenCompass \ GitHub - open-compass/opencompass: OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets. · GitHub
-
R41 EleutherAI:lm-evaluation-harness \ GitHub - EleutherAI/lm-evaluation-harness: A framework for few-shot evaluation of language models. · GitHub
-
R42 Ai2:OLMES / reproducible evaluation \ https://allenai.org/blog/olmes
-
R43 Stanford CRFM:HELM \ Holistic Evaluation of Language Models (HELM)
-
R44 Ai2:Dolma dataset \ https://allenai.org/dolma
-
R45 Hugging Face:FineWeb \ https://huggingface.co/spaces/HuggingFaceFW/blogpost-fineweb-v1
-
R46 European Union:AI Act overview \ https://eur-lex.europa.eu/EN/legal-content/summary/rules-for-trustworthy-artificial-intelligence-in-the-eu.html
-
R47 Linux Foundation:OpenMDW 1.1 \ Linux Foundation Releases OpenMDW-1.1; NVIDIA Adopts OpenMDW for Cosmos, Isaac GR00T, Ising and Nemotron, AI Model Families
-
R48 Google:Gemma 4 edge workflows \ https://developers.googleblog.com/bring-state-of-the-art-agentic-skills-to-the-edge-with-gemma-4/
-
R49 Ai2:OLMoTrace \ https://allenai.org/blog/olmotrace
-
R50 Qwen Team:Qwen-AgentWorld \ Qwen