目录
-
- 目录
- [一、认知纠偏:2026 年的 DeepSeek 是什么格局](#一、认知纠偏:2026 年的 DeepSeek 是什么格局)
-
- [1.1 "V3 还是 R1"已经是过期问题](#1.1 "V3 还是 R1"已经是过期问题)
- [1.2 R2 为什么始终没来](#1.2 R2 为什么始终没来)
- [1.3 当前模型矩阵(截至 2026-09-10)](#1.3 当前模型矩阵(截至 2026-09-10))
- [1.4 三维决策模型](#1.4 三维决策模型)
- [1.5 5R 框架:两种模式的定性对照](#1.5 5R 框架:两种模式的定性对照)
- [二、技术演进:从 R1 到 V4.1](#二、技术演进:从 R1 到 V4.1)
-
- [2.1 完整时间线](#2.1 完整时间线)
- [2.2 三条并行技术主线](#2.2 三条并行技术主线)
- 三、核心架构解析:四代降本路线
-
- [3.1 KV Cache:437 倍的压缩](#3.1 KV Cache:437 倍的压缩)
- [3.2 DSA:把 O(L²) 变成 O(L·k)](#3.2 DSA:把 O(L²) 变成 O(L·k))
- [3.3 CED:输入输出非对称](#3.3 CED:输入输出非对称)
- [3.4 CSA2:三种模式动态切换](#3.4 CSA2:三种模式动态切换)
- [3.5 DSpark:推测解码](#3.5 DSpark:推测解码)
- [四、R1 原理复盘:强化学习如何炼出推理能力](#四、R1 原理复盘:强化学习如何炼出推理能力)
-
- [4.1 R1-Zero:跳过监督微调的纯强化学习](#4.1 R1-Zero:跳过监督微调的纯强化学习)
- [4.2 GRPO:去掉 critic 的强化学习](#4.2 GRPO:去掉 critic 的强化学习)
- [4.3 Aha Moment:模型自己学会回头检查](#4.3 Aha Moment:模型自己学会回头检查)
- [4.4 正式版 R1:补上冷启动](#4.4 正式版 R1:补上冷启动)
- [4.5 蒸馏:推理能力可以迁移](#4.5 蒸馏:推理能力可以迁移)
- [4.6 基准数据(2025-02 时点快照)](#4.6 基准数据(2025-02 时点快照))
- [4.7 这条路线后来走通了吗](#4.7 这条路线后来走通了吗)
- 五、提示语工程:两套相反的逻辑
-
- [5.1 先说一个参数陷阱](#5.1 先说一个参数陷阱)
- [5.2 非思考模式:把话说完整](#5.2 非思考模式:把话说完整)
- [5.3 思考模式:少即是多](#5.3 思考模式:少即是多)
- [5.4 三个实用对话模板](#5.4 三个实用对话模板)
- [5.5 一个反例对照](#5.5 一个反例对照)
- [5.6 三个 2026 年验证有效的新技巧](#5.6 三个 2026 年验证有效的新技巧)
- [5.7 迭代追问](#5.7 迭代追问)
- [六、Agent 构建:CAP 全维度提示框架](#六、Agent 构建:CAP 全维度提示框架)
- [七、API 工程实践:思考模式与成本控制](#七、API 工程实践:思考模式与成本控制)
-
- [7.1 快速接入](#7.1 快速接入)
- [7.2 思考模式的开关与强度](#7.2 思考模式的开关与强度)
- [7.3 五个高频坑](#7.3 五个高频坑)
- [7.4 成本优化四招](#7.4 成本优化四招)
- [7.5 本地部署的现实边界](#7.5 本地部署的现实边界)
- 八、场景落地图谱
-
- [8.1 成熟应用方向](#8.1 成熟应用方向)
- [8.2 2026 年新增的三个能力窗口](#8.2 2026 年新增的三个能力窗口)
- 九、排障手册
- 十、速查表
- [十一、14 条过时认知纠正](#十一、14 条过时认知纠正)
- 参考来源
摘要
距 DeepSeek-R1 发布已过去 19 个月。这期间模型格局发生了根本性变化------"V3 还是 R1"这个曾经的核心问题,在 2025 年 8 月就已失效 。本文基于 2026 年 9 月的官方口径,系统梳理三件事:混合推理架构到底改变了什么、提示语在两种模式下为什么写法完全相反、以及 API 调用中真正决定成本的那几个参数。
文中所有结论均标注来源级别(
【官方】DeepSeek 公告与 API 文档 /【媒体】路透社、DeepLearning.AI 等 /【社区】未经官方确认的社区信息),文末附 14 条常见过时认知纠正。
关键词:DeepSeek、混合推理、思考模式、提示语工程、GRPO、稀疏注意力、大模型成本优化
目录
- [一、认知纠偏:2026 年的 DeepSeek 是什么格局](#一、认知纠偏:2026 年的 DeepSeek 是什么格局)
- [二、技术演进:从 R1 到 V4.1](#二、技术演进:从 R1 到 V4.1)
- 三、核心架构解析:四代降本路线
- [四、R1 原理复盘:强化学习如何炼出推理能力](#四、R1 原理复盘:强化学习如何炼出推理能力)
- 五、提示语工程:两套相反的逻辑
- [六、Agent 构建:CAP 全维度提示框架](#六、Agent 构建:CAP 全维度提示框架)
- [七、API 工程实践:思考模式与成本控制](#七、API 工程实践:思考模式与成本控制)
- 八、场景落地图谱
- 九、排障手册
- 十、速查表
- [十一、14 条过时认知纠正](#十一、14 条过时认知纠正)
一、认知纠偏:2026 年的 DeepSeek 是什么格局
1.1 "V3 还是 R1"已经是过期问题
如果你在 2025 年上半年接触过 DeepSeek,大概率记住的决策规则是:简单任务用 V3,推理任务用 R1。
这条规则现在错了。
自 V3.1(2025-08-21) 起,DeepSeek 转向混合推理架构 ------思考与非思考两种能力合并进同一份模型权重 ,通过一个请求参数切换。【官方】你不再需要选择模型,你需要选择的是是否开启思考。
所以:
2025 年选模型,2026 年选模式。
1.2 R2 为什么始终没来
这是搜索量极高但答案很干脆的一个问题。
| 问题 | 事实 | 来源 |
|---|---|---|
| R1 还在维护吗 | 权重仍可下载,但不再是主推模型;推理能力已并入 V 系主线 | 【官方】 |
| R2 发布了吗 | 从未发布,官方从未确认过档期 | 【官方】 |
| 为什么没发布 | 路透社报道:创始人梁文锋对 R2 性能不满意,压住不发 | 【媒体】 |
| 另一重原因 | 有报道称 R2 在昇腾芯片上训练遇稳定性问题,最终转为"英伟达训练 + 昇腾推理" | 【媒体】 |
| 网传的 R2 规格可信吗 | 全部未经证实。流传的 685B 参数 / 37B 激活 / 128K 上下文等数字来自泄露与聚合站互相引用,且不同来源互相矛盾 | 【社区】 |
工程含义 :不要在业务系统里为 R2 预留接口,也不要基于网传规格做容量规划。DeepSeek 当前的推理能力就落在 V4 系列的思考模式上。
1.3 当前模型矩阵(截至 2026-09-10)
| 模型 ID | 版本 | 总参数 / 激活 | 上下文 | 视觉 | 并发上限 |
|---|---|---|---|---|---|
deepseek-flash |
V4.1-Flash | 552B / 输入 8B、输出 16B | 1M(输出上限 384K) | 原生支持 | 2500 |
deepseek-v4-pro |
V4-Pro-0813 | 1.6T / 49B | 1M(输出上限 384K) | 不支持 | 500 |
【官方】
一次值得注意的产品决策 :官方经多方测试确认 V4.1-Flash 在性能、费用、速度、总用时四项上全面超越 V4-Pro,因此:
2026-09-14 12:00 起 ,至下一代 V4.1 Pro 上线前,所有访问
deepseek-v4-pro的请求自动路由到 V4.1-Flash,并按 Flash 单价计费。业务侧无需改动代码。【官方】
这在行业里不常见------通常是"旗舰撑能力、轻量走规模",而这次是轻量版本反超旗舰后,旗舰主动让位。
1.4 三维决策模型
现在的选择不再是单一维度,而是三个独立开关:
维度一 · 模型档位
| 场景 | 选择 | 依据 |
|---|---|---|
| 聊天、摘要、分类、翻译、初稿 | Flash | 便宜一个数量级,生成速度约为 2 倍 |
| 前沿编码、Agent 循环、长程推理 | Pro(当前已路由至 Flash) | 见 1.3 |
维度二 · 思考开关 (thinking.type)
开启思考的场景:
- 多步推理且结果需要可审计(法务、财务、复杂数学)
- Agent 循环------中间决策一旦出错会级联放大
- 愿意为输出 token 付更多钱(思维链按输出计费)
关闭思考的场景:
- 聊天回复、分类、格式化、翻译
- 绝大多数 RAG 问答------延迟和账单都不划算
维度三 · 思考强度 (reasoning_effort)
| 档位 | 适用 |
|---|---|
low |
分诊、路由、简短事实查询 |
high |
默认档;分析、代码审查、起草 |
max |
数学证明、系统迁移方案、多文件重构------凡是你愿意重读两遍的任务 |
提示:官方映射表中
medium与xhigh会被折叠到high,不产生额外效果;该映射随版本调整,以官方文档为准。【官方】
1.5 5R 框架:两种模式的定性对照
5R 是提示工程领域用于对比通用模型与推理模型的经典框架,在 2026 年它描述的不再是"两个模型",而是**"非思考模式"与"思考模式"**两种状态:
| 维度 | 非思考模式 | 思考模式 |
|---|---|---|
| Regulation 规范性 | 强规范约束,操作路径明确 | 弱规范约束,操作路径开放 |
| Result 结果导向 | 目标确定性高,结果可预期 | 目标开放性高,结果多样 |
| Route 路径灵活性 | 线性路径,流程标准化 | 网状路径,多路径探索 |
| Responsiveness 响应模式 | 被动适配,按规则执行 | 主动创新,自主决策 |
| Risk 风险特征 | 低风险,稳定可控 | 高风险,不确定性高 |
决策规则:
- 操作规范清晰、对结果有明确要求 → 关闭思考
- 操作路径多元开放、对结果没有明确要求 → 开启思考
二、技术演进:从 R1 到 V4.1
2.1 完整时间线
| 时间 | 版本 | 关键变化 |
|---|---|---|
| 2024-12-26 | V3 | 671B MoE,14.8T tokens 训练;以极低训练成本对标 GPT-4 级性能 |
| 2025-01-20 | R1 | 专用推理模型,GRPO 强化学习;开源蒸馏 6 个 dense 模型 |
| 2025-03 | V3-0324 | 代码能力增强,仍为非推理模型 |
| 2025-05 | R1-0528 | 数学/代码/科学提升;仍只能单跑思考模式,不支持结构化工具调用 |
| 2025-08-21 | V3.1 | 混合推理架构 ;上下文 64K→128K ;采用 UE8M0 FP8 精度,官方明示"为下一代国产芯片设计" |
| 2025-09-22 | V3.1-Terminus | 修复语言一致性,增强 Agent 工具调用 |
| 2025-09-29 | V3.2-Exp | 引入 DSA 稀疏注意力;长上下文推理成本降 6--7 倍;API 大幅降价 |
| 2025-12 | V3.2 正式版 | 长文本能力强化 【媒体】 |
| 2026-04-24 | V4 预览版 | V4-Pro(1.6T/49B 激活)+ V4-Flash(284B/13B 激活);1M 上下文、384K 输出;MIT 协议开源 |
| 2026-06 | DSpark | 开源推测解码框架(MIT),V4-Flash 生成提速 60--85% |
| 2026-07-15 | V4 正式版 | 启用峰谷分时计费(行业首创) |
| 2026-07-24 | --- | deepseek-chat / deepseek-reasoner 两个旧别名正式退役 |
| 2026-07-31 | V4-Flash-0731 | 官方称 Agent 能力大幅增强 |
| 2026-08 | V4-Pro-0813 | 支持 Responses API 与 Codex 接入 |
| 2026-09-10 | V4.1-Flash | 全新架构系列最小尺寸;CED 非对称结构 ;原生视觉;CSA2 注意力;KV Cache 压至 890 B/token |
| 2026-09-14 | --- | V4-Pro 请求全部路由至 V4.1-Flash |
2.2 三条并行技术主线
19 个月的迭代看似版本繁杂,归纳起来始终在三条线上推进:
主线一 · 更便宜:MoE 稀疏激活 → DSA 稀疏注意力 → CED 非对称计算 → KV Cache 压缩
主线二 · 更长:64K → 128K → 1M token
主线三 · 更会想:独立推理模型 → 混合推理 → 强度可调节
下面重点拆解主线一,这是工程收益最直接的一条。
三、核心架构解析:四代降本路线
3.1 KV Cache:437 倍的压缩
大模型做 Agent 任务时最大的痛点不是算力,而是缓存。多轮工具调用堆下来,上下文轻易冲到几十万 token,历史键值对全部要占显存。
DeepSeek 官方公布的每 token KV Cache 体积变化:【官方】
| 版本 | 每 token KV Cache | 相对上一代 |
|---|---|---|
| DeepSeek-V1(2023-11) | 389,120 字节 | --- |
| V3.2(2025-12) | 48,068 字节 | 缩小 8.1 倍 |
| V4-Flash(2026-04) | 3,514 字节 | 缩小 13.7 倍 |
| V4.1-Flash(2026-09) | 890 字节 | 缩小 3.9 倍 |
四代累计缩小 437 倍。 V4.1-Flash 对 HBM 显存需求降至上一代的 1/4,对 SSD 需求降至 1/8。
这直接改变了长上下文与 Agent 批量任务的经济性------缓存命中的费用在 Agent 场景中占比往往最高,把 KV Cache 压下来,成本会跟着直接下降。
3.2 DSA:把 O(L²) 变成 O(L·k)
V3.2-Exp 引入的 DeepSeek Sparse Attention(DSA) 是首次实现的细粒度稀疏注意力机制。【官方】
核心思路是"先筛选、后计算":
组件一 · Lightning Indexer
为每个查询 token 计算与所有前文 token 的重要性分数。设计上追求极致轻量:
- 少头设计:索引器头数仅 8--16,而传统 MHA 为 32--64
- FP8 精度:全部计算走 FP8,内存占用减少 75%
- ReLU 激活:无指数/对数运算,仅需比较与置零
- 键向量缓存:前文 token 的键向量批量计算后可复用
组件二 · 细粒度 Token 选择
对索引分数排序,取 Top-k(论文中 k=2048)个 token 做真正的注意力计算。
当序列长度 L=128K、k=2048 时,选中比例仅 1.6%,主注意力复杂度从 O(L²) 降到 O(L·k),降低约 64 倍。
训练上的巧思:DSA 采用两阶段持续预训练------
- 密集热身:冻结主模型,只训练索引器,用 KL 散度让索引器的输出分布对齐主注意力的真实分布
- 稀疏训练:启用稀疏模式,全模型继续预训练
这个"先指导、后自主"的设计避免了直接启用稀疏导致的收敛困难。官方与 DeepLearning.AI 均确认,V3.2-Exp 在绝大多数基准上与 V3.1-Terminus 基本持平。【官方 / 媒体】
实测收益:处理 128K 上下文,成本从每百万 token 约 2.30 降到 0.30。
3.3 CED:输入输出非对称
V4.1-Flash 采用的 Causal Encoder-Decoder(CED) 结构打破了传统大模型输入输出参数对称的设计逻辑:【官方】
| 阶段 | 激活参数 |
|---|---|
| 输入(读取、编码) | 8B |
| 输出(生成回答) | 16B |
| 总参数 | 552B |
传统 Decoder-only 模型不管读一万字长文还是输出一个词,激活规模基本一样。CED 把这两件事拆开:输入阶段轻一点,输出阶段重一点,算力不再平均用力。
配合 FP4 精度的 KV Cache,这才有了 890 字节/token 的结果。
3.4 CSA2:三种模式动态切换
V4.1-Flash 的注意力机制 CSA2(Compressed Sparse Attention 2) 包含三种模式:【官方】
| 模式 | 触发场景 |
|---|---|
| Full | 首次全量建索引 |
| Reindex | 后续按需重检索 |
| Reuse | 稳定生成时直接复用索引 |
通过三种模式动态切换,在长上下文与 Agent 自动化任务上兼顾能力与速度。
3.5 DSpark:推测解码
2026 年 6 月开源的 DSpark 是 DeepSeek 的推测解码框架(MIT 协议):用一个小的 draft model 批量提出候选 token,由完整模型批量验证,而非逐 token 生成。【官方】
官方报告的单用户生成提速:V4-Flash 提升 60--85%。
四、R1 原理复盘:强化学习如何炼出推理能力
理解 R1 的训练方法,才能理解为什么思考模式下的提示语要"反着写"。以下核心结论在 2026 年依然成立。
4.1 R1-Zero:跳过监督微调的纯强化学习
传统推理模型训练路径是"先 SFT、再 RL"。R1-Zero 直接跳过 SFT,在基座模型上做大规模强化学习。
结果:模型自发涌现出自我反思、长思维链等推理行为。
代价:可读性差、语言混合(中英文夹杂)。这说明纯 RL 能长出能力,但长不出"表达规范"。
4.2 GRPO:去掉 critic 的强化学习
为降低 RL 训练成本,DeepSeek 采用 GRPO(Group Relative Policy Optimization,组相对策略优化):
- 传统 PPO 需要额外训练一个与策略模型同等规模的 critic 模型,显存与算力开销翻倍;
- GRPO 直接去掉 critic ,改为对同一个问题采样一组输出,用组内的相对得分估计 baseline。
这是 R1 得以用较低成本完成大规模 RL 的关键。
4.3 Aha Moment:模型自己学会回头检查
训练过程中出现了一个被论文单独记录的现象:
在某个中间版本,R1-Zero 学会了通过重新评估自己的初始方案,来给一个问题分配更多的思考时间。
这个行为不是人工设计或注入的 ,而是强化学习自主演化的结果。它也解释了思考模式的一个使用特征------它会越想越久,且会主动推翻自己前面的判断。
4.4 正式版 R1:补上冷启动
R1-Zero 能力有了,但"话都说不利索"。正式版 R1 在 RL 之前加入:
- 冷启动数据:少量高质量长思维链数据,先把表达格式规范住
- 多阶段训练:RL 与 SFT 交替进行,兼顾能力与可读性
最终 R1 在推理任务上达到与 OpenAI-o1-1217 相当的水平。
4.5 蒸馏:推理能力可以迁移
DeepSeek 开源了从 R1 蒸馏出的 6 个 dense 模型:1.5B / 7B / 8B / 14B / 32B / 70B,基座为 Qwen 与 Llama。
实践价值:推理能力可以被蒸馏迁移,小模型也能具备链式推理能力------这是本地轻量部署可行的技术基础。
4.6 基准数据(2025-02 时点快照)
| 模型 | AIME 2024 | Codeforces | GPQA Diamond | MATH-500 | MMLU | SWE-bench Verified |
|---|---|---|---|---|---|---|
| DeepSeek-R1 | 79.8 | 96.3 | 71.5 | 97.3 | 90.8 | 49.2 |
| OpenAI-o1-1217 | 79.2 | 96.6 | 75.7 | 96.4 | 91.8 | 48.9 |
| DeepSeek-V3 | 39.2 | 58.7 | 59.1 | 90.2 | 88.5 | 42.0 |
这张表最值得读的地方不是绝对值,而是差值结构:
V3 → R1 的差距集中在 AIME(39.2 → 79.8)与 Codeforces(58.7 → 96.3)这类需要多步推理的任务;而 MMLU 这类知识覆盖型任务差距极小(88.5 → 90.8)。
结论:不要关着思考做数学与复杂代码推理,也不要开着思考做简单事实问答------后者提升有限,还要多付推理时间。
4.7 这条路线后来走通了吗
19 个月后的验证:【官方 + 媒体】
一、纯 RL 路线被继承下来了。 V3.2-Exp 的后训练阶段用 GRPO 把推理、Agent、对齐训练合并为单一阶段 ,官方与 DeepLearning.AI 均指出这规避了多阶段 RL 常见的灾难性遗忘问题。
二、R1 的两个短板都已补上。
- 可读性差 → 冷启动 + 多阶段训练(R1 自身已解决)
- 不支持结构化工具调用 → V3.1 起原生支持 Tool Calls,V4 进一步支持 Responses API
三、R1 的一个特征被产品化了。 R1 在复杂任务上的首 token 延迟曾被测到超过 100 秒。【媒体】如今这个"慢"变成了可调参数 reasoning_effort,而不是必须全盘接受的代价。
五、提示语工程:两套相反的逻辑
核心结论只有一句:
非思考模式要结构化,思考模式不要结构化。
5.1 先说一个参数陷阱
【官方】 思考模式不支持 temperature、top_p、presence_penalty、frequency_penalty。
为了兼容旧代码,设置这些参数不会报错,但完全无效。
这造成了一个广泛存在的坑:网上仍有大量教程推荐"R1 用 temperature 0.6、top_p 0.95"(2025 年 R1 官方建议),但在 V4 的思考模式下这些参数静默失效。
正确做法:
| 模式 | 采样参数 |
|---|---|
| 思考模式 | 无效。从调参词汇表里删掉,改为调 reasoning_effort 与提示语本身 |
| 非思考模式 | 有效。官方建议:代码与数学 0.0 、数据分析 1.0 、通用对话与翻译 1.3 、创意写作 1.5 |
5.2 非思考模式:把话说完整
面向"被动适配"的非思考模式,提示语的作用是替模型把路径规划好。三个成熟框架:
框架 A · RTGO
text
Role(角色) --- 定义 AI 的角色
例:经验丰富的数据分析师
Task(任务) --- 具体任务描述
例:写一份关于 XX 活动的小红书宣推文案(附背景信息)
Goal(目标) --- 期望达成什么效果
例:通过该文案吸引潜在客户、促成消费
Objective(要求)--- 字数、段落结构、用词风格、内容要点、输出格式
框架 B · CO-STAR(新加坡 GPT-4 提示工程竞赛冠军框架)
| 字母 | 含义 | 要回答的问题 |
|---|---|---|
| C | Context 上下文 | 相关背景信息是什么? |
| O | Objective 目标 | 你希望它做什么? |
| S | Style 风格 | 什么写作风格?严肃/有趣/学术/创新? |
| T | Tone 语调 | 幽默?情绪化?中立? |
| A | Audience 受众 | 是小白用户、专业人士、还是特定人群? |
| R | Response 回应 | 要什么形式?研究报告、表格、还是 Markdown? |
框架 C · 提问黄金公式
text
明确身份 + 具体任务 + 细节约束 + 输出格式
对比一下:
text
❌ 分析新能源汽车市场
✅ 作为市场专员,请对比 2024 年 Q4 比亚迪与特斯拉的社交媒体声量,
分析用户对"降价策略"的情绪倾向,用表格呈现
前者只会得到一份笼统的行业报告,后者才可能直接用于决策。
5.3 思考模式:少即是多
这是与直觉相反的部分。思考模式下:
- 不需要角色设定
- 不需要思维链提示 ------ 模型已有内部 CoT,追加"请一步步思考"是冗余且持续干扰原生推理,是官方点名的常见错误
- 不需要结构化提示词
- 不需要给示例 ------ few-shot 在思考模式下稳定降低性能;但在非思考模式下有用。这是"示例"这个手段唯一的模式差异,不要一刀切
- 不需要做太多解释
在思考模式面前,说清楚目标,剩下的交给它推理。
5.4 三个实用对话模板
模板一 · 场景化
text
我要【目标】,给【对象】用,希望达到【效果】,但担心【问题】。
实例:
我要设计一个 PPT 框架,要给一批 50 岁左右的制造业老板分享,主题是传统工厂出海战略布局。希望用他们能理解的生存压力类比国际竞争,让他们明白出海是必选项而非选择题。但我担心他们觉得海外市场遥远,担心法律风险和管理成本,害怕文化差异导致水土不服。你能帮我设计一个 PPT 框架吗?
关键在最后一项------主动告知你的担忧,模型会在输出中主动规避。
模板二 · 术语破解
text
用小学生能听懂的话解释【专业术语】
难度可通过替换"小学生/初中生/高中生"微调。
模板三 · 风格迁移
text
模仿【作家名】的【文体】写关于【主题】的【内容类型】
5.5 一个反例对照
这组对照我认为是全篇最有说服力的部分:
text
❌ 和妈妈一起去西班牙旅行 10 天,帮我安排行程
→ 只得到一份中规中矩的常规路线
✅ 妈妈 70 岁,身体还可以,不喜欢爬山和潜水;希望住宿在安全区但离景点不要太远;
自由行不开车,搭乘地铁或火车;愿意尝试当地食物,对集市、音乐会、博物馆也感兴趣
→ 模型主动考虑到步行强度、餐厅口味、小偷防范、药品准备、酒店是否有电梯
背景信息的收益,远大于任何提示词技巧。思考模式省掉的是"格式与路径描述",不是"上下文"。
5.6 三个 2026 年验证有效的新技巧
技巧一 · 用 XML 标签划边界
text
<指令>只依据以下文档回答,不得使用外部知识。</指令>
<文档>......</文档>
<输出要求>每条结论后标注来源行号。</输出要求>
防止模型把"你要它做的事"和"你要它处理的内容"混在一起。【官方】V4 推荐做法。
技巧二 · 命名一个具体的输出物
text
❌ 帮我看看这段代码
✅ 返回 JSON 格式的改动清单:每行包含「文件路径 / 行号 / 问题 / 最小修复」,
不要修改风格问题
把"帮我看看"换成可命名的交付物,效果提升最显著。
技巧三 · 追加自检指令
text
在给出最终答案前,检查:是否满足以上全部约束?
列出你所做的假设。若不确定的地方,说明需要什么信息才能确定。
5.7 迭代追问
第一版不满意时,用三类指令:
text
增加:请重点说明......
限制:排除......情况
调整:改为......风格
六、Agent 构建:CAP 全维度提示框架
当任务从"单次问答"升级为"让模型扮演一个持续履职的角色",CAP Framework(Comprehensive Agent Prompting Framework) 提供了四层结构:
| 层次 | 模块 | 内容 |
|---|---|---|
| 核心层 | 身份定义(Identity) | 角色属性、专业背景、交互特征 |
| 执行层 | 能力矩阵(Capability Matrix) | 功能范围、专业技能、决策权限 |
| 约束层 | 边界系统(Boundary System) | 伦理规范、安全限制、资源约束 |
| 操作层 | 工作引擎(Operation Engine) | 输入处理、执行流程、输出规范 |
落地为提示语的六要素:角色 / 功能 / 技能 / 约束 / 工作流程 / 输出格式。
实战示例 · Mermaid 图表生成器
text
角色: Mermaid 图表代码生成器
功能: 根据用户提供的流程或架构描述,自动生成符合 Mermaid 语法的图表代码。
技能:
- 熟悉 Mermaid 的图表类型和语法
- 理解流程分析、架构设计及结构化展示等领域知识
约束:
- 代码必须符合 Mermaid 语法规范
- 流程图需要有二级、三级等多层级
- 输出的代码格式应简洁且易于理解
工作流程:
1. 询问用户希望绘制哪种类型的图表
2. 收集详细的流程或架构描述
3. 分析并设计图表结构
4. 生成并输出符合 Mermaid 语法的代码
5. 校验代码,确保没有语法错误
输出格式: Mermaid 图表代码
2026 年的重要补充 :CAP 属于"用提示语约束行为"。但在 API 场景下,V4 系列已原生支持 Tool Calls、Responses API、FIM 补全、对话前缀续写 【官方】------能用参数约束的,就不要靠提示语。提示语约束的可靠性天然低于结构化参数。
注意:CAP 适合非思考模式或作为 Agent 设定;若开启思考模式处理开放性推理任务,应回到 5.3 的"少即是多"。
七、API 工程实践:思考模式与成本控制
7.1 快速接入
python
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com",
api_key="YOUR_KEY",
)
# 非思考模式:快且省,适合结构化任务
resp = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "你是资深 Python 审查员。用 Markdown 表格输出:"
"第 1 列 Issue,第 2 列 Fix。若代码无问题,只回复 clean。"},
{"role": "user", "content": "def add(a,b): return a+b"},
],
temperature=0.0,
max_tokens=400,
extra_body={"thinking": {"type": "disabled"}},
)
print(resp.choices[0].message.content)
两个要点:
base_url为https://api.deepseek.com;另有 Anthropic 兼容端点https://api.deepseek.com/anthropic- API 是无状态 的,多轮对话必须每次重发完整
messages(网页端与 App 才帮你保存历史)
7.2 思考模式的开关与强度
python
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": migration_brief}],
reasoning_effort="high", # low / high / max
extra_body={"thinking": {"type": "enabled"}}, # 默认即为 enabled
)
reasoning = resp.choices[0].message.reasoning_content # 思维链
answer = resp.choices[0].message.content # 最终答案
Anthropic 格式用 {"reasoning": {"effort": "none/low/high/max"}},其中 none 即关闭思考。【官方】
7.3 五个高频坑
坑 1 · 思维链和答案是两个字段
思考模式返回 reasoning_content(思维链)与 content(最终答案)两个并列字段。别只取 content 把思维链丢了,也别把 reasoning_content 当答案用。
坑 2 · 多轮回传规则不一致(最易踩)
请求是否带 tools 参数 |
中间轮 reasoning_content 如何处理 |
|---|---|
| 不带 | 不必参与上下文拼接;传了也会被忽略 |
| 带 | 必须 参与拼接并在后续每轮回传,否则返回 400 错误 |
【官方】注意:带 tools 时,即便该轮模型没有实际调用工具,也必须回传。
坑 3 · Think Max 会撑爆上下文
官方 Hugging Face 模型卡建议:使用 reasoning_effort="max" 时,上下文窗口至少设到 384K ,否则思维链会被截断。【官方】
坑 4 · JSON 模式必须在提示语里出现 "json" 字面量
【官方】使用 JSON Output 时,若不在 system 或 user 消息中指示输出 JSON,模型可能持续输出空白直到 token 上限,表现为请求"卡死"。三条规则:
- 提示语中必须出现字面量
json - 给出一个小示例 schema,而不只是描述
max_tokens留足,避免 JSON 被截断
python
resp = client.chat.completions.create(
model="deepseek-flash",
response_format={"type": "json_object"},
max_tokens=800, # 留足,避免 JSON 被截断
messages=[
# 关键点 1:必须出现字面量 json;关键点 2:给出示例 schema
{"role": "system", "content": 'Return json only. Example: {"name": "...", "score": 0}'},
{"role": "user", "content": user_input},
],
extra_body={"thinking": {"type": "disabled"}}, # 提取类任务无需思考
)
坑 5 · 思考模式调 temperature 没用
见 5.1。设置不报错,完全无效。
7.4 成本优化四招
招式一 · 错峰调用
【官方】V4.1-Flash 峰谷分时定价(2026-09-10 12:00 生效,元 / 百万 token):
| 时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| 空闲时段 | 0.02 | 1 | 4 |
| 高峰时段 | 0.04 | 2 | 8 |
高峰时段为工作日 9:00--12:00 与 14:00--18:00 。按一周 168 小时算,高峰仅 35 小时(20.8%),空闲 133 小时,周末全部算空闲。
批量任务挪到夜间或周末,成本直接减半。
招式二 · 稳定前缀前置(收益最大)
缓存命中 0.02 元 vs 未命中 1 元,相差 50 倍。由于 API 无状态、每次重发全文:
text
=== 固定的 system prompt、规则、示例 === ← 放最前面,字节级保持一致
=== 变化的文档/问题 === ← 放最后
招式三 · 审计缓存命中率
每次响应读 usage 里的 prompt_cache_hit_tokens 与 prompt_cache_miss_tokens,直到确认前缀设计生效。
招式四 · 一次请求问多个问题
同一份文档要问三件事,就在一次请求里问完并规定输出格式------避免同一份长文档被计费三次,且三次全部缓存未命中。
7.5 本地部署的现实边界
如果需要本地部署,R1 蒸馏出的 1.5B--70B dense 模型仍是最现实的选择(Ollama 等框架可直接拉取)。
但要清楚两点:
- 蒸馏版继承的是 2025 年初的架构能力
- 若想本地跑 V4.1-Flash,官方明确写出门槛------552B 总参数,大规模部署需约 2000 张 GPU 加存储集群
【官方】
单机场景不必考虑新架构,继续使用蒸馏小模型是合理选择。
八、场景落地图谱
8.1 成熟应用方向
| 场景 | 关键做法 | 要点 |
|---|---|---|
| 可视化图表 | 让模型输出 Mermaid 代码 | 要求多级流程、输出前自校验语法 |
| PPT 大纲 | 三段式:研究资料表 → Markdown 大纲 → 核心页流程图 | 三者分开输出,不要混杂 |
| 海报设计 | 生成供绘图工具使用的提示语 | 必须包含产品名称中文字;涵盖构图、色彩、风格、细节 |
| 视频生成 | 分镜脚本 + 分镜图 + 视频/音乐提示词 | 强调角色一致性与风格统一 |
| 新媒体文案批量 | 先明确"想要什么样的文案、具备哪些特征、针对什么生成" | 再谈篇幅、用词、结构优化 |
| 市场调查 | 多维度打分(经济发展/创新活力/社会治理/基础设施/宜居环境) | 可跨模型对比,观察评价偏差 |
PPT 场景的约束示例(三段分离原则值得单独记住):
text
输出内容及格式:
1、研究资料摘要,表格格式,包含报告主题、关键摘要、报告地址,不少于 5 份;
2、PPT 大纲,Markdown 格式,不少于 30 页;
3、核心内容的流程图,Mermaid 格式。
当用户输入特定主题时,请首先生成研究资料表格,其次生成 Markdown 格式的 PPT 大纲,
最后生成流程图,三者不要混杂到一起。
8.2 2026 年新增的三个能力窗口
窗口一 · 1M 上下文改变了"要不要切片"的判断
1M token 约合 75 万词。过去必须做 RAG 切片的场景(整本手册、中型代码库、整套招投标文件),现在可以整投并要求精确定位:
text
你在审阅一份完整的代码库导出。不要总结。
只回答:新接手的维护者最需要先读哪三个文件?为什么?附文件路径。
总字数不超过 200 字。
窗口二 · 原生视觉理解
V4.1-Flash 原生多模态,不再依赖外挂视觉适配器,图文理解的一致性与速度均有提升。【官方】
注意这个差异化:V4.1-Flash 支持视觉,V4-Pro 不支持。要处理图片就选 Flash。
窗口三 · Agent 成为主战场
【官方】V4.1-Flash 在官方公布的 Agentic 基准中,CyberGym(网络安全)与 Automation-Bench(自动化任务)两项位列第一,DeepSWE(软件工程)表现突出;Terminal-Bench 3.0 略低于 Claude Opus5(该项所有模型得分都不高,说明终端操作是全行业短板)。
配套工具 DeepSeek Harness v0.1.5 已同步发布,针对标准模式、程序化工具调用(PTC)模式与极简模式分别做了优化。
九、排障手册
| # | 现象 | 原因 | 对策 |
|---|---|---|---|
| 1 | 结构化提示语效果反而变差 | 思考模式下路径约束压缩了自主探索空间 | 只给目标,不给路径 |
| 2 | 回答满是术语,"太能装了" | 一上来就开思考模式 | 先用非思考模式聊几轮,再切思考 |
| 3 | 回答看不懂 | --- | 直接要求"说人话",或用术语破解模板 |
| 4 | 反复调 temperature 输出毫无变化 | 思考模式静默忽略全部采样参数 | 关掉思考再调,或改调 reasoning_effort |
| 5 | 多轮对话莫名报 400 | 带 tools 时中间轮 reasoning_content 未回传 |
见 7.3 坑 2 |
| 6 | JSON 模式请求"卡死" | 提示语未出现 "json" 字面量 | 见 7.3 坑 4 |
| 7 | Think Max 输出被截断 | 上下文窗口不足 | 上下文至少设 384K |
| 8 | 账单远超预期 | 缓存未命中 + 高峰时段 | 稳定前缀前置 + 错峰 |
关于人机协作的三条意识:
- 能动意识:让模型主动探索,而不是替它规划每一步
- 边界意识:清楚模型的能力边界,尤其是事实性内容的可靠性
- 成本意识(2026 年新增):思维链按输出 token 计费,长上下文按缓存命中率计费。同样的提示语,缓存设计不同,账单可能差一个数量级
十、速查表
text
【非思考模式】
我是【身份】,请【任务】,要求【细节】,用【格式】输出。
【思考模式】
我要【目标】,给【对象】用,希望达到【效果】,但担心【问题】。
(禁止追加:角色设定 / 逐步思考 / 结构化模板 / few-shot 示例)
【术语理解】
用小学生能听懂的话解释【术语】
【风格迁移】
模仿【作家】的【文体】写关于【主题】的【内容类型】
【Agent / CAP】
角色 / 功能 / 技能 / 约束 / 工作流程 / 输出格式
【迭代追问】
请重点说明【A】;排除【B】情况;改为【C】风格。
【XML 边界】
<指令>...</指令> <文档>...</文档> <输出要求>...</输出要求>
【自检追加】
在给出最终答案前,检查:是否满足以上全部约束?列出你所做的假设。
【长文档精确定位】
不要总结。只回答:【X】。附文件路径/行号。总字数不超过【N】字。
API 参数速查
python
# 关思考(省、快)
extra_body={"thinking": {"type": "disabled"}}
# 开思考 + 强度
reasoning_effort="high" # low / high / max
extra_body={"thinking": {"type": "enabled"}}
# Anthropic 格式关思考
{"reasoning": {"effort": "none"}}
# 取两个字段
resp.choices[0].message.reasoning_content # 思维链
resp.choices[0].message.content # 最终答案
# 审计缓存
resp.usage.prompt_cache_hit_tokens
resp.usage.prompt_cache_miss_tokens
十一、14 条过时认知纠正
大模型领域的知识半衰期极短。以下 14 条是 2025 年上半年广泛流传、到 2026 年 9 月已经失效或需要修正的认知,供对照自查:
| # | 过时认知 | 当前事实 | 性质 |
|---|---|---|---|
| 1 | "V3 与 R1 二选一" | 自 V3.1 起合并为混合推理单一模型,靠 thinking 参数切换 |
根本性失效 |
| 2 | "深度思考(R1)"是独立模型 | 现为思考模式,默认开启,另有低/高/最大三档强度 | 需更正 |
| 3 | R1 是推理旗舰 | 推理能力已并入 V 系主线,R1 不再主推 | 需更正 |
| 4 | R2 即将发布 | 从未发布,官方从未确认档期 | 需更正 |
| 5 | 通过 NVIDIA NIM / Azure / AWS / Cerebras / Groq 部署 | 该清单为 2025-02 状态,均已变化。当前官方入口为 api.deepseek.com |
已过时 |
| 6 | 上下文 64K | 1M token(输出上限 384K) | 数值过时 |
| 7 | DeepSeek 不支持图片 | V4.1-Flash 原生支持视觉理解(V4-Pro 不支持) | 能力新增 |
| 8 | 不支持工具调用 | 原生支持 Tool Calls、Responses API、FIM 补全、对话前缀续写 | 能力新增 |
| 9 | AIME 79.8 / MMLU 90.8 是最新成绩 | 仅为 2025-02 快照,已迭代四代,不可横向比较 | 仅供历史参考 |
| 10 | API 统一价 | 2026-07-15 起峰谷分时计费;2026-09-10 起新价目生效 | 机制新增 |
| 11 | 用 deepseek-chat / deepseek-reasoner |
已于 2026-07-24 15:59 UTC 退役 | 已失效 |
| 12 | 提示语"五不需要"无条件成立 | 需精确化:示例在非思考模式有用、思考模式有害 | 需精确化 |
| 13 | temperature 0.6 / top_p 0.95 | 仅对非思考模式有效;思考模式静默忽略 | 已失效 |
| 14 | 成本只看输入输出量 | 缓存命中与未命中价差 50 倍,是成本第一杠杆 | 概念缺失 |
仍然成立、不受时间影响的部分
技术演进很快,但有些东西没变:
- GRPO / R1-Zero / Aha Moment / 冷启动 + 多阶段训练:R1 技术报告的核心结论,且已被 V3.2 的 GRPO 单阶段训练进一步验证
- 5R 框架:从"两个模型"重新映射为"两种模式"后依然清晰
- RTGO / CO-STAR / 提问黄金公式:非思考模式下完全适用
- CAP 框架:Agent 设定的四层结构未变
- "背景信息 > 提示词技巧":5.5 那组西班牙行程的对照,是全篇最经得起时间检验的一条
- 三段分离、多级流程、一致性要求:方法论层面未变
参考来源
- DeepSeek 官方 API 文档:
api-docs.deepseek.com(模型与价格、思考模式、更新日志) - DeepSeek-AI,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
- DeepSeek-AI,《DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse Attention》
- DeepSeek-AI,《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》
- Hugging Face:
deepseek-ai官方模型卡与技术报告 - 路透社、DeepLearning.AI《The Batch》相关报道
- 提示工程领域公开框架:5R 分析框架、RTGO、CO-STAR、CAP Framework
说明 :本文数据截至 2026 年 9 月 10 日。大模型领域版本迭代频繁,涉及价格、模型 ID、API 参数的部分请以 DeepSeek 官方文档为准;模型原理与方法论部分不受短期版本变更影响。
如果本文对你有帮助,欢迎点赞收藏。有任何事实性错误或补充,请在评论区指出。