掌握一套理解模型的维度,再用自己的任务去实测选型。
1. 基础能力:它到底擅长什么任务?
看这些维度:
- 语言理解与生成:中文、英文、小语种、写作、总结、翻译。
- 推理与数学:逻辑、数学题、复杂规划。
- 代码:补全、调试、重构、SWE、Agent 编程。
- 知识问答:事实性、时效性、是否容易幻觉。
- 指令遵循:能否严格按格式、JSON、多轮要求输出。
- 多模态:看图、音频、视频、图表理解。
- 工具调用:函数调用、联网、操作软件、Agent 能力。
优点通常集中在某几项,很少有模型全部顶尖。
2. 上下文与记忆
你前面问的 200K、1M 就是这里。
- 标称上下文:200K、1M、2M。
- 有效上下文:真能记住并利用多少?很多模型有"中间遗忘"。
- 记忆机制:是否跨对话记忆?还是只能靠 RAG、外部数据库?
- 长文本任务:总结、检索、对比、跨文档推理。
长上下文不等于万能。一本《红楼梦》约 80 万 token,1M 窗口理论上能塞下,但模型未必能均匀理解每一段。
3. 架构与规模
- Dense vs MoE:MoE 总参数大、激活参数少,推理可能便宜,但显存要求高。
- 参数量:不是越大越强,还要看数据和训练质量。
- 训练数据:质量、多样性、语言比例、知识截止时间。
- 对齐方法:RLHF、DPO、 Constitutional AI 等,影响听话程度和安全性。
4. 成本、延迟与吞吐
- API 价格:输入、输出、缓存分别怎么算。
- 延迟:首 token 时间、生成速度。
- 吞吐:并发能力。
- 自托管成本:显卡、量化、运维。
- 批处理/缓存:能否省钱。
很多"最强模型"贵且慢,实际业务可能用中档模型更划算。
5. 开源 vs 闭源
| 类型 | 优点 | 缺点 |
|---|---|---|
| 闭源旗舰 | 能力强、生态好、开箱即用 | 贵、不透明、数据隐私风险、不能自托管 |
| 开源权重 | 可自托管、可微调、便宜、可控 | 部署维护麻烦、能力可能稍弱、许可限制 |
| 小模型 | 快、本地、便宜 | 复杂任务弱、知识少 |
| 垂直模型 | 医疗/法律/代码等专精 | 通用能力差、迁移难 |
还要看许可证:Apache 2.0、MIT、Llama 社区许可,商用限制不同。
6. 安全、合规与隐私
- 幻觉率:事实错误、编造引用。
- 偏见与毒性。
- 越狱风险。
- 隐私:数据是否用于训练?能否私有部署?
- 合规:GDPR、行业监管、版权。
- 许可:模型权重、输出内容能否商用。
7. 评测与基准
常见基准:
- 通用:MMLU、GPQA、Arena Elo。
- 代码:HumanEval、SWE-bench。
- 数学:GSM8K、MATH。
- 长文本:Needle、LongBench。
- 多模态:MMMU、VQA。
- Agent:WebArena、ToolBench。
但要注意:刷榜、数据污染、过拟合。跑分高不等于你的场景好用。
8. 生态与工程可用性
- API 稳定性、文档、SDK。
- 微调工具、量化、部署框架。
- 插件、MCP、Agent 生态。
- 社区活跃度。
- 是否容易接入 RAG、向量数据库、工作流。
生态往往决定实际落地难度。
9. 版本与时效
模型优缺点随版本变化极大。必须看:
- 具体型号:不是"GPT"而是"GPT-4o / GPT-4.1"等。
- 发布日期。
- 知识截止。
- 是否已下线。
- 最新排行榜。
不要用旧印象判断新模型。
10. 场景匹配
最终要问:
- 我的任务是什么?
- 输入多长?
- 输出要求多严?
- 延迟预算多少?
- 成本上限多少?
- 数据能否上云?
- 是否需要微调?
- 是否需要工具/Agent?
没有最好,只有最合适。
怎么真正掌握?
建议建一个自己的选型表:
| 模型 | 版本 | 开源/闭源 | 上下文 | 模态 | 强项 | 弱项 | 价格 | 延迟 | 许可 | 适合场景 |
|---|
然后:
- 收集 20 个你自己的真实任务,做成小评测集。
- 让候选模型跑一遍,记录质量、成本、延迟。
- 关注失败模式:幻觉、格式错、长文遗忘、工具调用失败。
- 别只看榜单,看你的业务数据。
- 组合使用:路由、级联、RAG、微调、Agent。
一句话总结:
理解模型 = 能力 × 上下文 × 成本 × 部署 × 安全 × 生态 × 场景,而且一切随版本动态变化。
掌握方法比背模型名单重要得多。
📊 主流大模型10维度评价表
| 模型 (厂商) | 1. 基础能力 | 2. 上下文与记忆 | 3. 架构与规模 | 4. 成本、延迟与吞吐 | 5. 开源 vs 闭源 | 6. 安全、合规与隐私 | 7. 评测与基准 | 8. 生态与工程可用性 | 9. 版本与时效 | 10. 场景匹配 |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 / Fable 5 (Anthropic) | 代码与复杂推理断层领先,长文本逻辑推理标杆 | 宣称1M,实际有效约600K,长文档搜索有退步 | 闭源,具体参数未公开 | 价格最高,Opus约5/25,Fable约10/50(每百万token) | 闭源 | 安全评级C+(行业最高),但未获A级 | SWE-bench Pro得分81.2%,GPQA Diamond 89.9% | Claude Code是质量之王,但生态相对封闭 | 版本迭代快,Opus 4.8提升感知有限 | 复杂Agent任务、大规模代码库重构、多步骤代码审查 |
| GPT-5.6 Sol / GPT-5.5 (OpenAI) | 最均衡的通用选手,指令跟随和结构化输出稳定 | 宣称1M,实际有效约500K-700K | 闭源,GPT-5系列采用优化注意力机制 | 价格适中,GPT-5.5约5/30,GPT-5.4约2.50/15 | 闭源 | 安全评级C | 在多项基准领先,但AA-Omniscience幻觉率高达86% | 生态最完整,工具链、插件、企业接入成熟 | 系列版本多(Sol/Terra/Luna),需注意区分 | 拿不准用什么时的默认选择,适合需要结构化返回的应用 |
| Gemini 3.1 Pro / 3.5 Flash (Google) | 多模态标杆,原生支持文本/图片/音频/视频四模态 | 宣称2M(行业最大),1.5M以内稳定,以上检索衰减 | 闭源,采用Ring Attention技术支持长上下文 | 价格友好,3.1 Pro约2/12(≤20万token) | 闭源 | 安全评级C | MMMU-Pro得分83.9%,16项基准中拿13项第一 | Gemini CLI等工具,但指令遵循精度弱于Claude | 命名混乱(Flash反而是最强稳定旗舰) | 图文混合、快速响应、对成本敏感的多模态场景 |
| DeepSeek V4 Pro / Flash (深度求索) | 代码和数学能力强,性价比炸裂 | 宣称1M,输入1M/输出384K | 开源MoE,V4 Pro总参数1.6T,激活仅49B(3%) | 价格极低,Pro约0.435/0.87,Flash约0.14/0.28 | 开源(MIT许可) | 安全评级F | 智能指数40分,是性价比密度最高的开源模型之一 | 社区活跃,适合自建部署和私有化 | V4系列已开源,迭代速度快 | 预算紧、大批量调用、本地/私有化部署的首选 |
| Qwen3.8 Max (阿里通义) | 中文场景表现稳定,多语言和Agent能力均衡 | 1M上下文 | 闭源API旗舰(开源版另有Qwen3.5-397B等) | 列表价约2.50/7.50,常有促销 | 部分开源(Apache 2.0) | 安全评级D- | SuperCLUE中文评测曾位列第一 | 生态最完整,社区微调生态全球最大,开源版本多 | 系列版本丰富,需注意Max/Plus/开源版的区别 | 中文场景、企业落地、二次开发 |
| Kimi K3 / K2.5 (月之暗面) | 长文档、长链路Agent、代码场景表现突出 | 宣称1M | 开源MoE,K3总参数达2.8T,896专家/16激活 | 价格约3/15,比Claude Opus便宜不少 | 开源(修改版MIT,非标准MIT) | 未在FLI安全指数中明确评级 | 智能指数44分(开源并列第二) | 开源生态活跃,K2.7-Code专攻编码且带视觉编码器 | 三个月三代万亿模型,迭代极快 | 长文档处理、长链路Agent、代码场景,接近国际旗舰但更便宜 |
| GLM-5.2 / GLM-5 (智谱) | 代码和Agent口碑不错 | 200K上下文 | 开源MoE,GLM-5.1为745B/44B激活 | 未明确列出API价格(开源可自部署) | 开源(MIT许可,无地区限制) | 未在FLI安全指数中明确评级 | 开源智能指数全球第一(51分),SWE-bench Pro得分58.4% | 适合工程智能体、代码相关工作,HuggingFace热度高 | GLM-5.2已发布,持续更新 | 工程智能体、代码相关任务,开源部署友好 |
| Grok 4.x (xAI) | 速度和部分任务表现不错 | 1M窗口(4.3版),标准版256K | 闭源 | 比Claude、GPT旗舰便宜一些,输入成本降约40% | 闭源 | 安全评级F | GPQA Diamond得分87.7% | 生态相对较新 | 迭代速度快 | 日常编码和快速迭代 |
| Llama 4 Scout / Maverick (Meta) | 原生多模态 | Scout最高10M(行业最长) | 开源MoE,Maverick为400B/17B激活 | 免费下载自部署,成本取决于托管方案 | 开源(Llama社区许可,<700M MAU可商用) | 安全评级D+ | 美国最强开源之一,但与中国第一梯队差距超20分 | 社区生态成熟 | 超11个月未更新,是当前最"老"的旗舰之一 | 需要超长上下文(10M)的自部署场景 |
| MiniMax M3 / M2.7 (MiniMax) | 多模态黑马,长上下文和Agent有特色 | 200K上下文 | 开源MoE,M2.7为2300亿/100亿激活 | 未明确列出API价格 | 开源 | 未在FLI安全指数中明确评级 | SWE-bench Verified得分75.4%,紧随Claude之后 | 在HuggingFace下载量可观 | 持续更新 | 代码和Agent场景,开源多模态选择 |
说明:价格单位均为"每百万token(输入/输出)",货币为美元。安全评级来自FLI《2026年夏季AI安全指数》,最高C+,无一家获A。
📌 关键提醒
- "宣称上下文" ≠ "有效上下文":厂商公布的窗口大小通常是实际有效区间的1.5-2倍。例如,1M宣称窗口的实际有效区间可能只有500K-700K。
- "Lost in the Middle"现象:即使模型支持超长上下文,关键信息放在中间也可能被忽略,准确率骤降。
- 安全评级普遍偏低:所有主流模型的安全评级都在C+及以下,在复杂推理、隐私判断等场景下稳定性不足。
- 开源许可需细读:MIT和Apache 2.0是最宽松的,但部分模型使用"修改版MIT"或自定义许可,商用前务必核对原文。
如果你有具体的应用场景(如长文档分析、代码生成、多模态理解),可以告诉我,我帮你进一步缩小选型范围。