文章目录
-
- [一、DeepSeek V4 Pro正式版发布](#一、DeepSeek V4 Pro正式版发布)
- [二、 DeepSeek Api 涨价](#二、 DeepSeek Api 涨价)
- [DeepSeek Harness](#DeepSeek Harness)
-
- [DSH 使用](#DSH 使用)
- 总结
一、DeepSeek V4 Pro正式版发布
今天昨天(2026-08-13),DeepSeek V Pro正式版发布,其实凌晨的时候Api就更新了,下午才发的新闻。
主要更新点:
🟢(1)Agent 能力大幅提升
仅从跑分来看,DeepSeek-V4-Pro-0813和Claude、K3似乎旗鼓相当了。GLM-5.2发布已经快两个月了,略逊一筹。
相比此前的V4-Pro-Preview提升很大。
预览版我之前使用时感觉最大的一个问题是:有效上下文达不到1M,500k左右就不遵循指令瞎搞了,会话开始我就要求它修改代码后只提交不推送,结果后面不仅推送了,还给我瞎合并分支、甚至发布了Release😅
下图是官方发布的跑分数据,我仅做了数据可视化:
*对于公开基准测试集中的 Code Agent 任务,DeepSeek-V4-Pro-0813 使用 DeepSeek Harness 极简模式作为框架进行测试(使用 max 档位,topp=0.95,temperature=1.0),其他框架下结果可能略有不同。
在Artificial Analysis 的Intelligence里面的排名:

仅从上图来看,Grok4.6似乎挺厉害啊,Gemini怎么一直在更新Flash,3.7 Flash 表现倒是很厉害啊,Pro很久没更新了,难道要在沉默中爆发吗?Kimi K3(国产开源)很厉害,不过真的很贵(见下文)。
🟢(2)原生支持 Responses API
这个主要就是方便在codex中使用了,之前最先支持的是Anthropic API格式。
现在可以直接修改codex配置文件,实现在codex中使用DeepSeek模型了,官方教程:https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex
本质就是修改一下codex配置文件里面的**config.toml和 models.json**,将codex请求地址变成:https://api.deepseek.com,并将模型列表换成flash和pro。(这个是codex官宣支持的事情)
不过我还是习惯使用CC Switch,这样方便管理不同的模型,无需每次手动修改配置文件,而且还能使用skill、插件、以及聊天记录。
🟢(3)更灵活的思考强度控制
V4-Pro 和 V4-Flash 思考模式现支持 low / high / max 三档思考强度,用户在实际使用中可以根据任务复杂度灵活选择:简单任务使用 low,日常 Agent 任务使用 high,高度复杂的任务场景使用 max。设置方法请参考官方 API 文档:API 指南-思考模式。
二、 DeepSeek Api 涨价
这个此前就发邮件通知过用户了。
以前的价格(空闲时段):
| 计费项 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 百万 tokens 输入(缓存命中) | 0.02元 | 0.025元 |
| 百万 tokens 输入(缓存未命中) | 1元 | 3元 |
| 百万 tokens 输出 | 2元 | 6元 |
👇涨价后:
采用峰谷定价,空闲时段价格为高峰时段价格的一半。
高峰时段为北京时间 9:00 - 12:00、14:00 - 18:00(其余为空闲时段)。
新价格将于北京时间 2026 年 8 月 17 日 00:00 开始生效,具体如下:
| 模型 | 时段 | 百万tokens输入 (缓存命中) | 百万tokens输入 (缓存未命中) | 百万tokens输出 |
|---|---|---|---|---|
| deepseek-v4-flash | 空闲时段 | 0.05元 | 1.5元 | 4.5元 |
| deepseek-v4-flash | 高峰时段 | 0.10元 | 3.0元 | 9.0元 |
| deepseek-v4-pro | 空闲时段 | 0.15元 | 4.5元 | 13.5元 |
| deepseek-v4-pro | 高峰时段 | 0.30元 | 9.0元 | 27.0元 |
对比一下:
- GLM-5.2:API(1M tokens): 输入8元,输出28元,缓存命中2元,缓存存储限时免费。
- Kimi K3:API(1M tokens): 输入20元,输出100元,缓存命中2元。
我发现涨价后(再加上模型似乎没有预期强),有一些人对DS创始人的称呼从"梁圣",变成"梁子"了。
这种行为(人身攻击)是不可取的,可以批判它的模型和定价,可以不用,但是人身攻击的行为和风气是不好的。
DeepSeek Harness
DeepSeek Harness组成员崔添翼下午微博发文:
DeepSeek Harness 已经以MIT协议开源发布。目前的版本还很不完善,请大家多提提意见。
DeepSeek Harness(dsh)是由 DeepSeek AI 开发的开源 agent harness(智能体框架)。
开发语言:TypeScript。
它采用一切皆插件的架构,并由 Cordis 驱动(负责插件的加载、卸载和依赖关系),其设计参见论文 A Programming Paradigm for Spatiotemporal Composability(https://github.com/cordiverse/paper)。
DeepSeek Harness 目前处于 开发者预览 阶段,正在快速迭代。未来将出现破坏兼容性的变更。
🔗Github:https://github.com/deepseek-ai/deepseek-harness
DSH的设计理念:
- 一切皆插件:
基于 Cordis 插件系统构建。模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件提供,并通过 Cordis 服务与事件彼此协作。开发者无需改动 DeepSeek Harness 源码,即可在配置层选择、替换或扩展任一能力。
- 每一次运行都有迹可循
模型看到的一切都会写入仅追加设计的会话日志,包括系统提示词、思维链、工具调用与结果、子 Agent 调度,以及每一次上下文注入。在 Trajectory 视图中,你可以按来源查看这些信息。恢复、分叉、检索与回放也共享同一份事件流。
- 多种运行模式
标准模式提供完整的工具组合;PTC 模式通过模型生成的一段代码组合多轮工具调用;极简模式仅保留一个 shell 工具与一个文件编辑工具,用于最小化环境下的模型基准测试;创造模式可以检查当前运行时、在内存中试验 Cordis 插件,并据此组合和创作新的模式。
DSH 使用
🟢(1)npm Web UI
自行安装nodejs环境(https://nodejs.org/en)。
要 Node.js 的版本至少达到 22.19.0
命令行运行:
npx @deepseek-ai/dsh web
该命令会启动 Web UI,默认地址为 http://127.0.0.1:3080。

dsh 进程会把调用目录(即运行命令的目录)作为默认文件系统位置,但新的 Web UI 在添加工作区前不会选中任何工作区。
打开设置 → 模型,输入 DeepSeek API 密钥并保存。模型路由会立即可用,不需要重启服务器。
更多的可以看官方文档:https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/user/guide/index.zh.md
🟢(2)从源码运行
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
运行后就是一个网页版的Agent,配置模型、密钥,选择工作区即可工作。
默认模型是DeepSeek,你也可以添加其它任何模型(open router这种中转站也支持)。
默认的DeepSeek官方模型的密钥是无法在网页端直接配置的(只读),需要你自己添加到环境变量。
需要添加到系统变量(用户变量不行):
- 变量名:
DEEPSEEK_API_KEY - 值:你的api key

不知道咋添加系统环境变量问AI。
运行时页面截图:

会详细地显示运行步骤、token消耗灯信息。
还可以实时显示任务执行轨迹:核心过程就是:思考--工具调用 循环。

代码搜索它用的
grep,我感觉rg更快。
执行参数:
- 用时:50分钟
- 步骤:258步
- 缓存命中:100%
- 输入token:56M
- 输出token:178K
结果评价:功能基本实现,但是有Bug,如程序崩溃,修改了2次才差不多搞定。
最终合计用时66分钟。
花的API费用倒是不多,token也相对较少:

相同的任务(clone相通的代码库,使用相同的需求.md),我还使用DeepSeek-V4-Pro在codex里面跑了一次。
结果:
- 近2小时完成
- 一样不是一次完成,有Bug,后续对话5次基本搞定
- token使用更多
API花费如图:token消耗是dsh里面的近3倍
主要任务是8点前完成的,后面有事情,没有修改的Bug修改在14:00左右才改。
总结
纯主观感受,没有做重复测试,没有做不同场景的测试(那要不少钱和时间),就是对同一个C++代码块按照相同的需求进行修改。
- 能力的确提高很多,大概比K3差一点的水平,比不过Fable 5和5.6那是肯定的(但它们也贵很多)
- 没有多模态,比较遗憾
- DeepSeek Harness 挺不错(还在开发与快速迭代阶段)
- 在 DeepSeek Harness 里面的token消耗量控制的挺好