DeepSeek 全景技术指南:从混合推理架构到提示语工程实战(2026.09)

目录

    • 目录
    • [一、认知纠偏:2026 年的 DeepSeek 是什么格局](#一、认知纠偏:2026 年的 DeepSeek 是什么格局)
      • [1.1 "V3 还是 R1"已经是过期问题](#1.1 "V3 还是 R1"已经是过期问题)
      • [1.2 R2 为什么始终没来](#1.2 R2 为什么始终没来)
      • [1.3 当前模型矩阵(截至 2026-09-10)](#1.3 当前模型矩阵(截至 2026-09-10))
      • [1.4 三维决策模型](#1.4 三维决策模型)
      • [1.5 5R 框架:两种模式的定性对照](#1.5 5R 框架:两种模式的定性对照)
    • [二、技术演进:从 R1 到 V4.1](#二、技术演进:从 R1 到 V4.1)
      • [2.1 完整时间线](#2.1 完整时间线)
      • [2.2 三条并行技术主线](#2.2 三条并行技术主线)
    • 三、核心架构解析:四代降本路线
      • [3.1 KV Cache:437 倍的压缩](#3.1 KV Cache:437 倍的压缩)
      • [3.2 DSA:把 O(L²) 变成 O(L·k)](#3.2 DSA:把 O(L²) 变成 O(L·k))
      • [3.3 CED:输入输出非对称](#3.3 CED:输入输出非对称)
      • [3.4 CSA2:三种模式动态切换](#3.4 CSA2:三种模式动态切换)
      • [3.5 DSpark:推测解码](#3.5 DSpark:推测解码)
    • [四、R1 原理复盘:强化学习如何炼出推理能力](#四、R1 原理复盘:强化学习如何炼出推理能力)
      • [4.1 R1-Zero:跳过监督微调的纯强化学习](#4.1 R1-Zero:跳过监督微调的纯强化学习)
      • [4.2 GRPO:去掉 critic 的强化学习](#4.2 GRPO:去掉 critic 的强化学习)
      • [4.3 Aha Moment:模型自己学会回头检查](#4.3 Aha Moment:模型自己学会回头检查)
      • [4.4 正式版 R1:补上冷启动](#4.4 正式版 R1:补上冷启动)
      • [4.5 蒸馏:推理能力可以迁移](#4.5 蒸馏:推理能力可以迁移)
      • [4.6 基准数据(2025-02 时点快照)](#4.6 基准数据(2025-02 时点快照))
      • [4.7 这条路线后来走通了吗](#4.7 这条路线后来走通了吗)
    • 五、提示语工程:两套相反的逻辑
      • [5.1 先说一个参数陷阱](#5.1 先说一个参数陷阱)
      • [5.2 非思考模式:把话说完整](#5.2 非思考模式:把话说完整)
      • [5.3 思考模式:少即是多](#5.3 思考模式:少即是多)
      • [5.4 三个实用对话模板](#5.4 三个实用对话模板)
      • [5.5 一个反例对照](#5.5 一个反例对照)
      • [5.6 三个 2026 年验证有效的新技巧](#5.6 三个 2026 年验证有效的新技巧)
      • [5.7 迭代追问](#5.7 迭代追问)
    • [六、Agent 构建:CAP 全维度提示框架](#六、Agent 构建:CAP 全维度提示框架)
    • [七、API 工程实践:思考模式与成本控制](#七、API 工程实践:思考模式与成本控制)
      • [7.1 快速接入](#7.1 快速接入)
      • [7.2 思考模式的开关与强度](#7.2 思考模式的开关与强度)
      • [7.3 五个高频坑](#7.3 五个高频坑)
      • [7.4 成本优化四招](#7.4 成本优化四招)
      • [7.5 本地部署的现实边界](#7.5 本地部署的现实边界)
    • 八、场景落地图谱
      • [8.1 成熟应用方向](#8.1 成熟应用方向)
      • [8.2 2026 年新增的三个能力窗口](#8.2 2026 年新增的三个能力窗口)
    • 九、排障手册
    • 十、速查表
    • [十一、14 条过时认知纠正](#十一、14 条过时认知纠正)
    • 参考来源

摘要

距 DeepSeek-R1 发布已过去 19 个月。这期间模型格局发生了根本性变化------"V3 还是 R1"这个曾经的核心问题,在 2025 年 8 月就已失效 。本文基于 2026 年 9 月的官方口径,系统梳理三件事:混合推理架构到底改变了什么、提示语在两种模式下为什么写法完全相反、以及 API 调用中真正决定成本的那几个参数。

文中所有结论均标注来源级别(【官方】DeepSeek 公告与 API 文档 / 【媒体】路透社、DeepLearning.AI 等 / 【社区】未经官方确认的社区信息),文末附 14 条常见过时认知纠正。

关键词:DeepSeek、混合推理、思考模式、提示语工程、GRPO、稀疏注意力、大模型成本优化


目录

  • [一、认知纠偏:2026 年的 DeepSeek 是什么格局](#一、认知纠偏:2026 年的 DeepSeek 是什么格局)
  • [二、技术演进:从 R1 到 V4.1](#二、技术演进:从 R1 到 V4.1)
  • 三、核心架构解析:四代降本路线
  • [四、R1 原理复盘:强化学习如何炼出推理能力](#四、R1 原理复盘:强化学习如何炼出推理能力)
  • 五、提示语工程:两套相反的逻辑
  • [六、Agent 构建:CAP 全维度提示框架](#六、Agent 构建:CAP 全维度提示框架)
  • [七、API 工程实践:思考模式与成本控制](#七、API 工程实践:思考模式与成本控制)
  • 八、场景落地图谱
  • 九、排障手册
  • 十、速查表
  • [十一、14 条过时认知纠正](#十一、14 条过时认知纠正)

一、认知纠偏:2026 年的 DeepSeek 是什么格局

1.1 "V3 还是 R1"已经是过期问题

如果你在 2025 年上半年接触过 DeepSeek,大概率记住的决策规则是:简单任务用 V3,推理任务用 R1

这条规则现在错了。

V3.1(2025-08-21) 起,DeepSeek 转向混合推理架构 ------思考与非思考两种能力合并进同一份模型权重 ,通过一个请求参数切换。【官方】你不再需要选择模型,你需要选择的是是否开启思考

所以:

2025 年选模型,2026 年选模式。

1.2 R2 为什么始终没来

这是搜索量极高但答案很干脆的一个问题。

问题 事实 来源
R1 还在维护吗 权重仍可下载,但不再是主推模型;推理能力已并入 V 系主线 【官方】
R2 发布了吗 从未发布,官方从未确认过档期 【官方】
为什么没发布 路透社报道:创始人梁文锋对 R2 性能不满意,压住不发 【媒体】
另一重原因 有报道称 R2 在昇腾芯片上训练遇稳定性问题,最终转为"英伟达训练 + 昇腾推理" 【媒体】
网传的 R2 规格可信吗 全部未经证实。流传的 685B 参数 / 37B 激活 / 128K 上下文等数字来自泄露与聚合站互相引用,且不同来源互相矛盾 【社区】

工程含义 :不要在业务系统里为 R2 预留接口,也不要基于网传规格做容量规划。DeepSeek 当前的推理能力就落在 V4 系列的思考模式上。

1.3 当前模型矩阵(截至 2026-09-10)

模型 ID 版本 总参数 / 激活 上下文 视觉 并发上限
deepseek-flash V4.1-Flash 552B / 输入 8B、输出 16B 1M(输出上限 384K) 原生支持 2500
deepseek-v4-pro V4-Pro-0813 1.6T / 49B 1M(输出上限 384K) 不支持 500

【官方】

一次值得注意的产品决策 :官方经多方测试确认 V4.1-Flash 在性能、费用、速度、总用时四项上全面超越 V4-Pro,因此:

2026-09-14 12:00 起 ,至下一代 V4.1 Pro 上线前,所有访问 deepseek-v4-pro 的请求自动路由到 V4.1-Flash,并按 Flash 单价计费。业务侧无需改动代码。【官方】

这在行业里不常见------通常是"旗舰撑能力、轻量走规模",而这次是轻量版本反超旗舰后,旗舰主动让位。

1.4 三维决策模型

现在的选择不再是单一维度,而是三个独立开关:

维度一 · 模型档位

场景 选择 依据
聊天、摘要、分类、翻译、初稿 Flash 便宜一个数量级,生成速度约为 2 倍
前沿编码、Agent 循环、长程推理 Pro(当前已路由至 Flash) 见 1.3

维度二 · 思考开关thinking.type

开启思考的场景:

  • 多步推理且结果需要可审计(法务、财务、复杂数学)
  • Agent 循环------中间决策一旦出错会级联放大
  • 愿意为输出 token 付更多钱(思维链按输出计费)

关闭思考的场景:

  • 聊天回复、分类、格式化、翻译
  • 绝大多数 RAG 问答------延迟和账单都不划算

维度三 · 思考强度reasoning_effort

档位 适用
low 分诊、路由、简短事实查询
high 默认档;分析、代码审查、起草
max 数学证明、系统迁移方案、多文件重构------凡是你愿意重读两遍的任务

提示:官方映射表中 mediumxhigh 会被折叠到 high,不产生额外效果;该映射随版本调整,以官方文档为准。【官方】

1.5 5R 框架:两种模式的定性对照

5R 是提示工程领域用于对比通用模型与推理模型的经典框架,在 2026 年它描述的不再是"两个模型",而是**"非思考模式"与"思考模式"**两种状态:

维度 非思考模式 思考模式
Regulation 规范性 强规范约束,操作路径明确 弱规范约束,操作路径开放
Result 结果导向 目标确定性高,结果可预期 目标开放性高,结果多样
Route 路径灵活性 线性路径,流程标准化 网状路径,多路径探索
Responsiveness 响应模式 被动适配,按规则执行 主动创新,自主决策
Risk 风险特征 低风险,稳定可控 高风险,不确定性高

决策规则

  • 操作规范清晰、对结果有明确要求 → 关闭思考
  • 操作路径多元开放、对结果没有明确要求 → 开启思考

二、技术演进:从 R1 到 V4.1

2.1 完整时间线

时间 版本 关键变化
2024-12-26 V3 671B MoE,14.8T tokens 训练;以极低训练成本对标 GPT-4 级性能
2025-01-20 R1 专用推理模型,GRPO 强化学习;开源蒸馏 6 个 dense 模型
2025-03 V3-0324 代码能力增强,仍为非推理模型
2025-05 R1-0528 数学/代码/科学提升;仍只能单跑思考模式,不支持结构化工具调用
2025-08-21 V3.1 混合推理架构 ;上下文 64K→128K ;采用 UE8M0 FP8 精度,官方明示"为下一代国产芯片设计"
2025-09-22 V3.1-Terminus 修复语言一致性,增强 Agent 工具调用
2025-09-29 V3.2-Exp 引入 DSA 稀疏注意力;长上下文推理成本降 6--7 倍;API 大幅降价
2025-12 V3.2 正式版 长文本能力强化 【媒体】
2026-04-24 V4 预览版 V4-Pro(1.6T/49B 激活)+ V4-Flash(284B/13B 激活);1M 上下文、384K 输出;MIT 协议开源
2026-06 DSpark 开源推测解码框架(MIT),V4-Flash 生成提速 60--85%
2026-07-15 V4 正式版 启用峰谷分时计费(行业首创)
2026-07-24 --- deepseek-chat / deepseek-reasoner 两个旧别名正式退役
2026-07-31 V4-Flash-0731 官方称 Agent 能力大幅增强
2026-08 V4-Pro-0813 支持 Responses API 与 Codex 接入
2026-09-10 V4.1-Flash 全新架构系列最小尺寸;CED 非对称结构 ;原生视觉;CSA2 注意力;KV Cache 压至 890 B/token
2026-09-14 --- V4-Pro 请求全部路由至 V4.1-Flash

2.2 三条并行技术主线

19 个月的迭代看似版本繁杂,归纳起来始终在三条线上推进:

主线一 · 更便宜:MoE 稀疏激活 → DSA 稀疏注意力 → CED 非对称计算 → KV Cache 压缩

主线二 · 更长:64K → 128K → 1M token

主线三 · 更会想:独立推理模型 → 混合推理 → 强度可调节

下面重点拆解主线一,这是工程收益最直接的一条。


三、核心架构解析:四代降本路线

3.1 KV Cache:437 倍的压缩

大模型做 Agent 任务时最大的痛点不是算力,而是缓存。多轮工具调用堆下来,上下文轻易冲到几十万 token,历史键值对全部要占显存。

DeepSeek 官方公布的每 token KV Cache 体积变化:【官方】

版本 每 token KV Cache 相对上一代
DeepSeek-V1(2023-11) 389,120 字节 ---
V3.2(2025-12) 48,068 字节 缩小 8.1 倍
V4-Flash(2026-04) 3,514 字节 缩小 13.7 倍
V4.1-Flash(2026-09) 890 字节 缩小 3.9 倍

四代累计缩小 437 倍。 V4.1-Flash 对 HBM 显存需求降至上一代的 1/4,对 SSD 需求降至 1/8。

这直接改变了长上下文与 Agent 批量任务的经济性------缓存命中的费用在 Agent 场景中占比往往最高,把 KV Cache 压下来,成本会跟着直接下降。

3.2 DSA:把 O(L²) 变成 O(L·k)

V3.2-Exp 引入的 DeepSeek Sparse Attention(DSA) 是首次实现的细粒度稀疏注意力机制。【官方】

核心思路是"先筛选、后计算":

组件一 · Lightning Indexer

为每个查询 token 计算与所有前文 token 的重要性分数。设计上追求极致轻量:

  • 少头设计:索引器头数仅 8--16,而传统 MHA 为 32--64
  • FP8 精度:全部计算走 FP8,内存占用减少 75%
  • ReLU 激活:无指数/对数运算,仅需比较与置零
  • 键向量缓存:前文 token 的键向量批量计算后可复用

组件二 · 细粒度 Token 选择

对索引分数排序,取 Top-k(论文中 k=2048)个 token 做真正的注意力计算。

当序列长度 L=128K、k=2048 时,选中比例仅 1.6%,主注意力复杂度从 O(L²) 降到 O(L·k),降低约 64 倍

训练上的巧思:DSA 采用两阶段持续预训练------

  1. 密集热身:冻结主模型,只训练索引器,用 KL 散度让索引器的输出分布对齐主注意力的真实分布
  2. 稀疏训练:启用稀疏模式,全模型继续预训练

这个"先指导、后自主"的设计避免了直接启用稀疏导致的收敛困难。官方与 DeepLearning.AI 均确认,V3.2-Exp 在绝大多数基准上与 V3.1-Terminus 基本持平。【官方 / 媒体】

实测收益:处理 128K 上下文,成本从每百万 token 约 2.30 降到 0.30。

3.3 CED:输入输出非对称

V4.1-Flash 采用的 Causal Encoder-Decoder(CED) 结构打破了传统大模型输入输出参数对称的设计逻辑:【官方】

阶段 激活参数
输入(读取、编码) 8B
输出(生成回答) 16B
总参数 552B

传统 Decoder-only 模型不管读一万字长文还是输出一个词,激活规模基本一样。CED 把这两件事拆开:输入阶段轻一点,输出阶段重一点,算力不再平均用力。

配合 FP4 精度的 KV Cache,这才有了 890 字节/token 的结果。

3.4 CSA2:三种模式动态切换

V4.1-Flash 的注意力机制 CSA2(Compressed Sparse Attention 2) 包含三种模式:【官方】

模式 触发场景
Full 首次全量建索引
Reindex 后续按需重检索
Reuse 稳定生成时直接复用索引

通过三种模式动态切换,在长上下文与 Agent 自动化任务上兼顾能力与速度。

3.5 DSpark:推测解码

2026 年 6 月开源的 DSpark 是 DeepSeek 的推测解码框架(MIT 协议):用一个小的 draft model 批量提出候选 token,由完整模型批量验证,而非逐 token 生成。【官方】

官方报告的单用户生成提速:V4-Flash 提升 60--85%


四、R1 原理复盘:强化学习如何炼出推理能力

理解 R1 的训练方法,才能理解为什么思考模式下的提示语要"反着写"。以下核心结论在 2026 年依然成立。

4.1 R1-Zero:跳过监督微调的纯强化学习

传统推理模型训练路径是"先 SFT、再 RL"。R1-Zero 直接跳过 SFT,在基座模型上做大规模强化学习。

结果:模型自发涌现出自我反思、长思维链等推理行为。

代价:可读性差、语言混合(中英文夹杂)。这说明纯 RL 能长出能力,但长不出"表达规范"。

4.2 GRPO:去掉 critic 的强化学习

为降低 RL 训练成本,DeepSeek 采用 GRPO(Group Relative Policy Optimization,组相对策略优化)

  • 传统 PPO 需要额外训练一个与策略模型同等规模的 critic 模型,显存与算力开销翻倍;
  • GRPO 直接去掉 critic ,改为对同一个问题采样一组输出,用组内的相对得分估计 baseline。

这是 R1 得以用较低成本完成大规模 RL 的关键。

4.3 Aha Moment:模型自己学会回头检查

训练过程中出现了一个被论文单独记录的现象:

在某个中间版本,R1-Zero 学会了通过重新评估自己的初始方案,来给一个问题分配更多的思考时间

这个行为不是人工设计或注入的 ,而是强化学习自主演化的结果。它也解释了思考模式的一个使用特征------它会越想越久,且会主动推翻自己前面的判断

4.4 正式版 R1:补上冷启动

R1-Zero 能力有了,但"话都说不利索"。正式版 R1 在 RL 之前加入:

  1. 冷启动数据:少量高质量长思维链数据,先把表达格式规范住
  2. 多阶段训练:RL 与 SFT 交替进行,兼顾能力与可读性

最终 R1 在推理任务上达到与 OpenAI-o1-1217 相当的水平。

4.5 蒸馏:推理能力可以迁移

DeepSeek 开源了从 R1 蒸馏出的 6 个 dense 模型:1.5B / 7B / 8B / 14B / 32B / 70B,基座为 Qwen 与 Llama。

实践价值:推理能力可以被蒸馏迁移,小模型也能具备链式推理能力------这是本地轻量部署可行的技术基础。

4.6 基准数据(2025-02 时点快照)

模型 AIME 2024 Codeforces GPQA Diamond MATH-500 MMLU SWE-bench Verified
DeepSeek-R1 79.8 96.3 71.5 97.3 90.8 49.2
OpenAI-o1-1217 79.2 96.6 75.7 96.4 91.8 48.9
DeepSeek-V3 39.2 58.7 59.1 90.2 88.5 42.0

这张表最值得读的地方不是绝对值,而是差值结构

V3 → R1 的差距集中在 AIME(39.2 → 79.8)与 Codeforces(58.7 → 96.3)这类需要多步推理的任务;而 MMLU 这类知识覆盖型任务差距极小(88.5 → 90.8)。

结论:不要关着思考做数学与复杂代码推理,也不要开着思考做简单事实问答------后者提升有限,还要多付推理时间。

4.7 这条路线后来走通了吗

19 个月后的验证:【官方 + 媒体】

一、纯 RL 路线被继承下来了。 V3.2-Exp 的后训练阶段用 GRPO 把推理、Agent、对齐训练合并为单一阶段 ,官方与 DeepLearning.AI 均指出这规避了多阶段 RL 常见的灾难性遗忘问题。

二、R1 的两个短板都已补上。

  • 可读性差 → 冷启动 + 多阶段训练(R1 自身已解决)
  • 不支持结构化工具调用 → V3.1 起原生支持 Tool Calls,V4 进一步支持 Responses API

三、R1 的一个特征被产品化了。 R1 在复杂任务上的首 token 延迟曾被测到超过 100 秒。【媒体】如今这个"慢"变成了可调参数 reasoning_effort,而不是必须全盘接受的代价。


五、提示语工程:两套相反的逻辑

核心结论只有一句:

非思考模式要结构化,思考模式不要结构化。

5.1 先说一个参数陷阱

【官方】 思考模式不支持 temperaturetop_ppresence_penaltyfrequency_penalty

为了兼容旧代码,设置这些参数不会报错,但完全无效

这造成了一个广泛存在的坑:网上仍有大量教程推荐"R1 用 temperature 0.6、top_p 0.95"(2025 年 R1 官方建议),但在 V4 的思考模式下这些参数静默失效。

正确做法

模式 采样参数
思考模式 无效。从调参词汇表里删掉,改为调 reasoning_effort 与提示语本身
非思考模式 有效。官方建议:代码与数学 0.0 、数据分析 1.0 、通用对话与翻译 1.3 、创意写作 1.5

5.2 非思考模式:把话说完整

面向"被动适配"的非思考模式,提示语的作用是替模型把路径规划好。三个成熟框架:

框架 A · RTGO

text 复制代码
Role(角色)     --- 定义 AI 的角色
                   例:经验丰富的数据分析师
Task(任务)     --- 具体任务描述
                   例:写一份关于 XX 活动的小红书宣推文案(附背景信息)
Goal(目标)     --- 期望达成什么效果
                   例:通过该文案吸引潜在客户、促成消费
Objective(要求)--- 字数、段落结构、用词风格、内容要点、输出格式

框架 B · CO-STAR(新加坡 GPT-4 提示工程竞赛冠军框架)

字母 含义 要回答的问题
C Context 上下文 相关背景信息是什么?
O Objective 目标 你希望它做什么?
S Style 风格 什么写作风格?严肃/有趣/学术/创新?
T Tone 语调 幽默?情绪化?中立?
A Audience 受众 是小白用户、专业人士、还是特定人群?
R Response 回应 要什么形式?研究报告、表格、还是 Markdown?

框架 C · 提问黄金公式

text 复制代码
明确身份 + 具体任务 + 细节约束 + 输出格式

对比一下:

text 复制代码
❌ 分析新能源汽车市场
✅ 作为市场专员,请对比 2024 年 Q4 比亚迪与特斯拉的社交媒体声量,
   分析用户对"降价策略"的情绪倾向,用表格呈现

前者只会得到一份笼统的行业报告,后者才可能直接用于决策。

5.3 思考模式:少即是多

这是与直觉相反的部分。思考模式下:

  • 不需要角色设定
  • 不需要思维链提示 ------ 模型已有内部 CoT,追加"请一步步思考"是冗余且持续干扰原生推理,是官方点名的常见错误
  • 不需要结构化提示词
  • 不需要给示例 ------ few-shot 在思考模式下稳定降低性能;但在非思考模式下有用。这是"示例"这个手段唯一的模式差异,不要一刀切
  • 不需要做太多解释

在思考模式面前,说清楚目标,剩下的交给它推理。

5.4 三个实用对话模板

模板一 · 场景化

text 复制代码
我要【目标】,给【对象】用,希望达到【效果】,但担心【问题】。

实例:

我要设计一个 PPT 框架,要给一批 50 岁左右的制造业老板分享,主题是传统工厂出海战略布局。希望用他们能理解的生存压力类比国际竞争,让他们明白出海是必选项而非选择题。但我担心他们觉得海外市场遥远,担心法律风险和管理成本,害怕文化差异导致水土不服。你能帮我设计一个 PPT 框架吗?

关键在最后一项------主动告知你的担忧,模型会在输出中主动规避。

模板二 · 术语破解

text 复制代码
用小学生能听懂的话解释【专业术语】

难度可通过替换"小学生/初中生/高中生"微调。

模板三 · 风格迁移

text 复制代码
模仿【作家名】的【文体】写关于【主题】的【内容类型】

5.5 一个反例对照

这组对照我认为是全篇最有说服力的部分:

text 复制代码
❌ 和妈妈一起去西班牙旅行 10 天,帮我安排行程
   → 只得到一份中规中矩的常规路线

✅ 妈妈 70 岁,身体还可以,不喜欢爬山和潜水;希望住宿在安全区但离景点不要太远;
   自由行不开车,搭乘地铁或火车;愿意尝试当地食物,对集市、音乐会、博物馆也感兴趣
   → 模型主动考虑到步行强度、餐厅口味、小偷防范、药品准备、酒店是否有电梯

背景信息的收益,远大于任何提示词技巧。思考模式省掉的是"格式与路径描述",不是"上下文"。

5.6 三个 2026 年验证有效的新技巧

技巧一 · 用 XML 标签划边界

text 复制代码
<指令>只依据以下文档回答,不得使用外部知识。</指令>
<文档>......</文档>
<输出要求>每条结论后标注来源行号。</输出要求>

防止模型把"你要它做的事"和"你要它处理的内容"混在一起。【官方】V4 推荐做法。

技巧二 · 命名一个具体的输出物

text 复制代码
❌ 帮我看看这段代码
✅ 返回 JSON 格式的改动清单:每行包含「文件路径 / 行号 / 问题 / 最小修复」,
   不要修改风格问题

把"帮我看看"换成可命名的交付物,效果提升最显著。

技巧三 · 追加自检指令

text 复制代码
在给出最终答案前,检查:是否满足以上全部约束?
列出你所做的假设。若不确定的地方,说明需要什么信息才能确定。

5.7 迭代追问

第一版不满意时,用三类指令:

text 复制代码
增加:请重点说明......
限制:排除......情况
调整:改为......风格

六、Agent 构建:CAP 全维度提示框架

当任务从"单次问答"升级为"让模型扮演一个持续履职的角色",CAP Framework(Comprehensive Agent Prompting Framework) 提供了四层结构:

层次 模块 内容
核心层 身份定义(Identity) 角色属性、专业背景、交互特征
执行层 能力矩阵(Capability Matrix) 功能范围、专业技能、决策权限
约束层 边界系统(Boundary System) 伦理规范、安全限制、资源约束
操作层 工作引擎(Operation Engine) 输入处理、执行流程、输出规范

落地为提示语的六要素:角色 / 功能 / 技能 / 约束 / 工作流程 / 输出格式

实战示例 · Mermaid 图表生成器

text 复制代码
角色: Mermaid 图表代码生成器
功能: 根据用户提供的流程或架构描述,自动生成符合 Mermaid 语法的图表代码。
技能:
  - 熟悉 Mermaid 的图表类型和语法
  - 理解流程分析、架构设计及结构化展示等领域知识
约束:
  - 代码必须符合 Mermaid 语法规范
  - 流程图需要有二级、三级等多层级
  - 输出的代码格式应简洁且易于理解
工作流程:
  1. 询问用户希望绘制哪种类型的图表
  2. 收集详细的流程或架构描述
  3. 分析并设计图表结构
  4. 生成并输出符合 Mermaid 语法的代码
  5. 校验代码,确保没有语法错误
输出格式: Mermaid 图表代码

2026 年的重要补充 :CAP 属于"用提示语约束行为"。但在 API 场景下,V4 系列已原生支持 Tool Calls、Responses API、FIM 补全、对话前缀续写 【官方】------能用参数约束的,就不要靠提示语。提示语约束的可靠性天然低于结构化参数。

注意:CAP 适合非思考模式或作为 Agent 设定;若开启思考模式处理开放性推理任务,应回到 5.3 的"少即是多"。


七、API 工程实践:思考模式与成本控制

7.1 快速接入

python 复制代码
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_KEY",
)

# 非思考模式:快且省,适合结构化任务
resp = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "你是资深 Python 审查员。用 Markdown 表格输出:"
                                      "第 1 列 Issue,第 2 列 Fix。若代码无问题,只回复 clean。"},
        {"role": "user", "content": "def add(a,b): return a+b"},
    ],
    temperature=0.0,
    max_tokens=400,
    extra_body={"thinking": {"type": "disabled"}},
)
print(resp.choices[0].message.content)

两个要点:

  1. base_urlhttps://api.deepseek.com;另有 Anthropic 兼容端点 https://api.deepseek.com/anthropic
  2. API 是无状态 的,多轮对话必须每次重发完整 messages(网页端与 App 才帮你保存历史)

7.2 思考模式的开关与强度

python 复制代码
resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": migration_brief}],
    reasoning_effort="high",                      # low / high / max
    extra_body={"thinking": {"type": "enabled"}}, # 默认即为 enabled
)

reasoning = resp.choices[0].message.reasoning_content  # 思维链
answer    = resp.choices[0].message.content            # 最终答案

Anthropic 格式用 {"reasoning": {"effort": "none/low/high/max"}},其中 none 即关闭思考。【官方】

7.3 五个高频坑

坑 1 · 思维链和答案是两个字段

思考模式返回 reasoning_content(思维链)与 content(最终答案)两个并列字段。别只取 content 把思维链丢了,也别把 reasoning_content 当答案用。

坑 2 · 多轮回传规则不一致(最易踩)

请求是否带 tools 参数 中间轮 reasoning_content 如何处理
不带 不必参与上下文拼接;传了也会被忽略
必须 参与拼接并在后续每轮回传,否则返回 400 错误

【官方】注意:带 tools 时,即便该轮模型没有实际调用工具,也必须回传

坑 3 · Think Max 会撑爆上下文

官方 Hugging Face 模型卡建议:使用 reasoning_effort="max" 时,上下文窗口至少设到 384K ,否则思维链会被截断。【官方】

坑 4 · JSON 模式必须在提示语里出现 "json" 字面量

【官方】使用 JSON Output 时,若不在 system 或 user 消息中指示输出 JSON,模型可能持续输出空白直到 token 上限,表现为请求"卡死"。三条规则:

  1. 提示语中必须出现字面量 json
  2. 给出一个小示例 schema,而不只是描述
  3. max_tokens 留足,避免 JSON 被截断
python 复制代码
resp = client.chat.completions.create(
    model="deepseek-flash",
    response_format={"type": "json_object"},
    max_tokens=800,                                  # 留足,避免 JSON 被截断
    messages=[
        # 关键点 1:必须出现字面量 json;关键点 2:给出示例 schema
        {"role": "system", "content": 'Return json only. Example: {"name": "...", "score": 0}'},
        {"role": "user", "content": user_input},
    ],
    extra_body={"thinking": {"type": "disabled"}},   # 提取类任务无需思考
)

坑 5 · 思考模式调 temperature 没用

见 5.1。设置不报错,完全无效。

7.4 成本优化四招

招式一 · 错峰调用

【官方】V4.1-Flash 峰谷分时定价(2026-09-10 12:00 生效,元 / 百万 token):

时段 缓存命中输入 缓存未命中输入 输出
空闲时段 0.02 1 4
高峰时段 0.04 2 8

高峰时段为工作日 9:00--12:00 与 14:00--18:00 。按一周 168 小时算,高峰仅 35 小时(20.8%),空闲 133 小时,周末全部算空闲

批量任务挪到夜间或周末,成本直接减半。

招式二 · 稳定前缀前置(收益最大)

缓存命中 0.02 元 vs 未命中 1 元,相差 50 倍。由于 API 无状态、每次重发全文:

text 复制代码
=== 固定的 system prompt、规则、示例 ===   ← 放最前面,字节级保持一致
=== 变化的文档/问题 ===                    ← 放最后

招式三 · 审计缓存命中率

每次响应读 usage 里的 prompt_cache_hit_tokensprompt_cache_miss_tokens,直到确认前缀设计生效。

招式四 · 一次请求问多个问题

同一份文档要问三件事,就在一次请求里问完并规定输出格式------避免同一份长文档被计费三次,且三次全部缓存未命中。

7.5 本地部署的现实边界

如果需要本地部署,R1 蒸馏出的 1.5B--70B dense 模型仍是最现实的选择(Ollama 等框架可直接拉取)。

但要清楚两点:

  1. 蒸馏版继承的是 2025 年初的架构能力
  2. 若想本地跑 V4.1-Flash,官方明确写出门槛------552B 总参数,大规模部署需约 2000 张 GPU 加存储集群 【官方】

单机场景不必考虑新架构,继续使用蒸馏小模型是合理选择。


八、场景落地图谱

8.1 成熟应用方向

场景 关键做法 要点
可视化图表 让模型输出 Mermaid 代码 要求多级流程、输出前自校验语法
PPT 大纲 三段式:研究资料表 → Markdown 大纲 → 核心页流程图 三者分开输出,不要混杂
海报设计 生成供绘图工具使用的提示语 必须包含产品名称中文字;涵盖构图、色彩、风格、细节
视频生成 分镜脚本 + 分镜图 + 视频/音乐提示词 强调角色一致性与风格统一
新媒体文案批量 先明确"想要什么样的文案、具备哪些特征、针对什么生成" 再谈篇幅、用词、结构优化
市场调查 多维度打分(经济发展/创新活力/社会治理/基础设施/宜居环境) 可跨模型对比,观察评价偏差

PPT 场景的约束示例(三段分离原则值得单独记住):

text 复制代码
输出内容及格式:
1、研究资料摘要,表格格式,包含报告主题、关键摘要、报告地址,不少于 5 份;
2、PPT 大纲,Markdown 格式,不少于 30 页;
3、核心内容的流程图,Mermaid 格式。

当用户输入特定主题时,请首先生成研究资料表格,其次生成 Markdown 格式的 PPT 大纲,
最后生成流程图,三者不要混杂到一起。

8.2 2026 年新增的三个能力窗口

窗口一 · 1M 上下文改变了"要不要切片"的判断

1M token 约合 75 万词。过去必须做 RAG 切片的场景(整本手册、中型代码库、整套招投标文件),现在可以整投并要求精确定位

text 复制代码
你在审阅一份完整的代码库导出。不要总结。
只回答:新接手的维护者最需要先读哪三个文件?为什么?附文件路径。
总字数不超过 200 字。

窗口二 · 原生视觉理解

V4.1-Flash 原生多模态,不再依赖外挂视觉适配器,图文理解的一致性与速度均有提升。【官方】

注意这个差异化:V4.1-Flash 支持视觉,V4-Pro 不支持。要处理图片就选 Flash。

窗口三 · Agent 成为主战场

【官方】V4.1-Flash 在官方公布的 Agentic 基准中,CyberGym(网络安全)与 Automation-Bench(自动化任务)两项位列第一,DeepSWE(软件工程)表现突出;Terminal-Bench 3.0 略低于 Claude Opus5(该项所有模型得分都不高,说明终端操作是全行业短板)。

配套工具 DeepSeek Harness v0.1.5 已同步发布,针对标准模式、程序化工具调用(PTC)模式与极简模式分别做了优化。


九、排障手册

# 现象 原因 对策
1 结构化提示语效果反而变差 思考模式下路径约束压缩了自主探索空间 只给目标,不给路径
2 回答满是术语,"太能装了" 一上来就开思考模式 先用非思考模式聊几轮,再切思考
3 回答看不懂 --- 直接要求"说人话",或用术语破解模板
4 反复调 temperature 输出毫无变化 思考模式静默忽略全部采样参数 关掉思考再调,或改调 reasoning_effort
5 多轮对话莫名报 400 tools 时中间轮 reasoning_content 未回传 见 7.3 坑 2
6 JSON 模式请求"卡死" 提示语未出现 "json" 字面量 见 7.3 坑 4
7 Think Max 输出被截断 上下文窗口不足 上下文至少设 384K
8 账单远超预期 缓存未命中 + 高峰时段 稳定前缀前置 + 错峰

关于人机协作的三条意识

  • 能动意识:让模型主动探索,而不是替它规划每一步
  • 边界意识:清楚模型的能力边界,尤其是事实性内容的可靠性
  • 成本意识(2026 年新增):思维链按输出 token 计费,长上下文按缓存命中率计费。同样的提示语,缓存设计不同,账单可能差一个数量级

十、速查表

text 复制代码
【非思考模式】
我是【身份】,请【任务】,要求【细节】,用【格式】输出。

【思考模式】
我要【目标】,给【对象】用,希望达到【效果】,但担心【问题】。
(禁止追加:角色设定 / 逐步思考 / 结构化模板 / few-shot 示例)

【术语理解】
用小学生能听懂的话解释【术语】

【风格迁移】
模仿【作家】的【文体】写关于【主题】的【内容类型】

【Agent / CAP】
角色 / 功能 / 技能 / 约束 / 工作流程 / 输出格式

【迭代追问】
请重点说明【A】;排除【B】情况;改为【C】风格。

【XML 边界】
<指令>...</指令> <文档>...</文档> <输出要求>...</输出要求>

【自检追加】
在给出最终答案前,检查:是否满足以上全部约束?列出你所做的假设。

【长文档精确定位】
不要总结。只回答:【X】。附文件路径/行号。总字数不超过【N】字。

API 参数速查

python 复制代码
# 关思考(省、快)
extra_body={"thinking": {"type": "disabled"}}

# 开思考 + 强度
reasoning_effort="high"          # low / high / max
extra_body={"thinking": {"type": "enabled"}}

# Anthropic 格式关思考
{"reasoning": {"effort": "none"}}

# 取两个字段
resp.choices[0].message.reasoning_content   # 思维链
resp.choices[0].message.content             # 最终答案

# 审计缓存
resp.usage.prompt_cache_hit_tokens
resp.usage.prompt_cache_miss_tokens

十一、14 条过时认知纠正

大模型领域的知识半衰期极短。以下 14 条是 2025 年上半年广泛流传、到 2026 年 9 月已经失效或需要修正的认知,供对照自查:

# 过时认知 当前事实 性质
1 "V3 与 R1 二选一" 自 V3.1 起合并为混合推理单一模型,靠 thinking 参数切换 根本性失效
2 "深度思考(R1)"是独立模型 现为思考模式,默认开启,另有低/高/最大三档强度 需更正
3 R1 是推理旗舰 推理能力已并入 V 系主线,R1 不再主推 需更正
4 R2 即将发布 从未发布,官方从未确认档期 需更正
5 通过 NVIDIA NIM / Azure / AWS / Cerebras / Groq 部署 该清单为 2025-02 状态,均已变化。当前官方入口为 api.deepseek.com 已过时
6 上下文 64K 1M token(输出上限 384K) 数值过时
7 DeepSeek 不支持图片 V4.1-Flash 原生支持视觉理解(V4-Pro 不支持) 能力新增
8 不支持工具调用 原生支持 Tool Calls、Responses API、FIM 补全、对话前缀续写 能力新增
9 AIME 79.8 / MMLU 90.8 是最新成绩 仅为 2025-02 快照,已迭代四代,不可横向比较 仅供历史参考
10 API 统一价 2026-07-15 起峰谷分时计费;2026-09-10 起新价目生效 机制新增
11 deepseek-chat / deepseek-reasoner 已于 2026-07-24 15:59 UTC 退役 已失效
12 提示语"五不需要"无条件成立 需精确化:示例在非思考模式有用、思考模式有害 需精确化
13 temperature 0.6 / top_p 0.95 仅对非思考模式有效;思考模式静默忽略 已失效
14 成本只看输入输出量 缓存命中与未命中价差 50 倍,是成本第一杠杆 概念缺失

仍然成立、不受时间影响的部分

技术演进很快,但有些东西没变:

  • GRPO / R1-Zero / Aha Moment / 冷启动 + 多阶段训练:R1 技术报告的核心结论,且已被 V3.2 的 GRPO 单阶段训练进一步验证
  • 5R 框架:从"两个模型"重新映射为"两种模式"后依然清晰
  • RTGO / CO-STAR / 提问黄金公式:非思考模式下完全适用
  • CAP 框架:Agent 设定的四层结构未变
  • "背景信息 > 提示词技巧":5.5 那组西班牙行程的对照,是全篇最经得起时间检验的一条
  • 三段分离、多级流程、一致性要求:方法论层面未变

参考来源

  • DeepSeek 官方 API 文档:api-docs.deepseek.com(模型与价格、思考模式、更新日志)
  • DeepSeek-AI,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
  • DeepSeek-AI,《DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse Attention》
  • DeepSeek-AI,《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》
  • Hugging Face:deepseek-ai 官方模型卡与技术报告
  • 路透社、DeepLearning.AI《The Batch》相关报道
  • 提示工程领域公开框架:5R 分析框架、RTGO、CO-STAR、CAP Framework

说明 :本文数据截至 2026 年 9 月 10 日。大模型领域版本迭代频繁,涉及价格、模型 ID、API 参数的部分请以 DeepSeek 官方文档为准;模型原理与方法论部分不受短期版本变更影响。

如果本文对你有帮助,欢迎点赞收藏。有任何事实性错误或补充,请在评论区指出。

相关推荐
智驭未来掌门人1 小时前
从LLM Gateway到Agent Gateway:大模型网关架构演进的技术分析
人工智能
阿拉斯攀登1 小时前
自动化漏洞扫描:Xray部署、扫描规则、漏洞验证方法
架构
空堂与归1 小时前
dsh 插件报「未注册 hmr」又空白?两处根因排查与解决
人工智能
能源革命1 小时前
AI 日报 2026-09-10
人工智能·dubbo
武子康1 小时前
SGLang 回答慢,时间究竟花在了哪里?
人工智能·llm·agent
派大_星1 小时前
PyTorch CNN图片分类与数据增强实践
人工智能·深度学习·机器学习
2503_931712481 小时前
具身机器人和人形机器人的区别是什么?两者是否有什么关系
大数据
jay神1 小时前
【计算机毕业设计项目】基于 YOLO + ArcFace 的人脸识别检测系统
人工智能·深度学习·计算机视觉·毕业设计·课程设计·计算机毕业设计
赖赖-1 小时前
工业一体机在机器人领域的应用:从控制架构到场景选型的全面解读
ai·架构·机器人·电脑