2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。
一、模型速览
| 项目 | 详情 |
|---|---|
| 模型名称 | DeepSeek-V4-Flash-Vision-Exp |
| 性质 | 实验性模型 |
| 上线日期 | 2026年8月21日 |
| 基于 | DeepSeek-V4-Flash 正式版 |
| 总参数量 | 2840 亿(284B),激活参数 130 亿(13B/每 token) |
| 架构 | Mixture-of-Experts (MoE) |
| 上下文窗口 | 1,048,576 tokens(约 100 万) |
| 最大输出 | 384,000 tokens |
| 默认并发限制 | 2,500 请求 |
| 是否开源 | 权重未开源 |
核心能力定位 :在纯文本能力(Agent、推理、世界知识等)上与 DeepSeek-V4-Flash 正式版完全持平 ;在需要视觉理解的 Agent Benchmark 上实现大幅跃升 ,多模态 Agent 能力已接近 Claude Opus 4.8。
简单来说:DeepSeek 不再只是"别人负责看、DeepSeek 负责想",而是变成了"自己看、自己理解、自己推理、自己调用工具完成任务"的完整 Agent 闭环。
二、如何调用 API
2.1 调用入口
只需将 model 参数设置为 deepseek-v4-flash-vision-exp,即可通过 DeepSeek API 调用视觉理解能力。
python
# 最简调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com",
api_key="YOUR_API_KEY"
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片的内容"},
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
]
}
]
)
print(response.choices[0].message.content)
2.2 三种 API 调用格式
本次多模态 API 同时兼容三种格式,方便接入各类 Agent 工具:
| 格式 | 说明 |
|---|---|
| Chat Completions | 标准 OpenAI 兼容格式,支持图文混合输入 |
| Messages | Anthropic 兼容格式 |
| Responses | DeepSeek 原生格式 |
三种格式均支持图文混合输入,在用户消息中同时包含文本和图片即可。
注意:图片只能出现在用户消息中。如果图片出现在 system 或 assistant 消息中,会返回 400 错误。
2.3 三种图片传入方式
| 方式 | 说明 | 适用场景 |
|---|---|---|
| Base64 内联 | 将图片编码为 Base64 字符串直接嵌入请求体 | 小图片、离线环境 |
| 外部 URL | 提供图片的 HTTP/HTTPS 链接 | 图片已托管在服务器 |
| Files API | 先上传图片获取 file_id,后续请求中引用 | 同一图片反复使用、省带宽 |
方式一:Base64 内联
python
import base64
with open("screenshot.png", "rb") as f:
img_b64 = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "分析这张截图中的错误信息"},
{"type": "image_url", "image_url": {
"url": f"data:image/png;base64,{img_b64}"
}}
]
}]
)
方式二:外部 URL
python
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这个图表说明了什么?"},
{"type": "image_url", "image_url": {
"url": "https://cdn.example.com/report-chart.png"
}}
]
}]
)
方式三:Files API(推荐,完全免费)
python
# 第一步:上传图片,获取 file_id
upload_response = client.files.create(
file=open("report-chart.png", "rb"),
purpose="vision"
)
file_id = upload_response.id # 例如: "file_abc123"
# 第二步:在请求中引用 file_id
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "分析这张图表的趋势"},
{"type": "image_url", "image_url": {
"url": f"file://{file_id}"
}}
]
}]
)
# 第三步:同一张图片可反复使用,无需重复上传
# 适用于多轮 Agent 工作流中持续处理同一批视觉素材
2.4 支持的文件格式
| 格式 | 支持 |
|---|---|
| JPEG | ✅ |
| PNG | ✅ |
| GIF | ✅ |
| WebP | ✅ |
格式检测基于文件的实际内容而非扩展名或 MIME 类型。
2.5 图片输入限制
| 限制项 | 内联(Base64/URL) | Files API |
|---|---|---|
| 单文件大小上限 | 32 MiB | 64 MiB |
| 最大图片边长 | 8,192 px(≥15 张图时降至 4,096 px) | --- |
| 单请求最多图片数 | 600 张 | --- |
| 请求体大小上限 | 48 MiB | 200 MiB |
| 图片 token 预算 | 最多 384 tokens/张 | 同样 |
重要提示 :所有图片会被自动缩放到约 800×800 像素等效分辨率,超过该有效分辨率的细节会被丢弃------这是 384 token 固定预算的直接结果。
三、调用效果:基准测试全面对比
3.1 核心结论
在 11 项基准测试中,DeepSeek-V4-Flash-Vision-Exp 的表现可以概括为:
- 赢下 3 项(vs Opus 4.8):DeepSWE(+1.3)、Agents' Last Exam(+1.6)、ZeroBench(+1.0)
- 多项差距在 1-2 分以内:Terminal Bench、Toolathlon-Verified、Chartography、AutomationBench
- 差距最大的 2 项:NL2Repo(差 12 分)、DSBench-Hard(差 8.1 分)
3.2 完整基准测试数据
文本型 Agent 评估
| 基准测试 | Vision-Exp | Flash-0731 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
多模态 Agent 评估
| 基准测试 | Vision-Exp | Flash-0731 | Opus 4.8 |
|---|---|---|---|
| ApexBench (Pass@1) | 36.5 | 26.2** | 39.4 |
| Agents' Last Exam | 27.3 | 25.2** | 25.7 |
| Chartography | 64.3 | --- | 65.0 |
| ZeroBench (Pass@5) | 35.0 | --- | 34.0 |
** Flash-0731 在这两项多模态基准上是"无视其中包含的多模态元素"进行评分的(纯文本模型盲测),对比不完全对等。
3.3 实际应用场景
官方展示了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力:
- 商业 PPT 制作:模型可以理解真实摄影图片风格、"野性""原始""探索感"等抽象风格化要求
- 网站视觉重构:对 DeepSeek Harness 官网进行二次创作
- 前端 Mini Demo:制作黏土怪物风格动态特效的前端 Mini Demo
- 图片内容描述:自然语言描述图片内容
- 截图文字识别(OCR):识别截图中的文字
- 图表分析:解析图表数据并给出洞察
四、中间层架构详解:DeepSeek Harness 0.1.1
多模态 API 的上线并非孤立事件,DeepSeek 同日发布了 Harness v0.1.1-rc.1 版本更新,这是整个多模态生态的"中间层"------连接开发者与模型能力的关键桥梁。
4.1 版本迭代历程
自开发者预览版 v0.1.0-rc.6 首日发布以来,DeepSeek Harness 已连续完成三次版本更新:
| 版本 | 核心内容 |
|---|---|
| v0.1.0-rc.7 | 多模态核心能力开放 |
| v0.1.0-rc.8 | 多模态基础支持 |
| v0.1.1-rc.1 | 原生图片请求、多模态模型选项、持久化附件 |
4.2 多模态能力增强
| 功能 | 说明 |
|---|---|
| 模型适配器 | 新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,支持配置原生图片请求 |
| /goal、/plan 命令 | 从纯文本升级为支持图文混合输入 |
| @ 菜单 | 从仅引用文件扩展为可引用文件和历史会话 |
| MCP/ACP 附件持久化 | 图片附件在多次调用间保持,不会随单次调用结束而消失 |
| PTC Mode | 支持转发嵌套图片 |
4.3 子代理与插件架构
| 功能 | 说明 |
|---|---|
| Codex 与 Claude Code | 从捆绑分发改为按需安装的 Profile Bundle |
| Codex 非交互权限模式 | 支持在无人值守流程中运行 |
| Codex 多命名实例 | 允许同时运行多个配置不同、名称各异的子智能体 |
| 回报路径优化 | reportDelivery 及时反馈并唤醒父任务,消除盲目等待 |
| 插件注册 | 插件可自行注册设置卡片,能力扩展与任务管理更便捷 |
4.4 稳定性与性能优化
| 项目 | 说明 |
|---|---|
| web_search | 支持并发查询 |
| Windows PTY | 正式加入持久 PowerShell 会话支持,极简模式默认开启 |
| SQLite 后端 | 读写和分叉性能显著提升,存储体积降低 |
| 修复项 | 长会话、终端兼容、模型请求、沙箱权限等问题 |
| 交互细节 | 提问卡片、Markdown 表格、多行输入、会话切换优化 |
4.5 架构关系图
五、价格:一张图不到 1 分钱
5.1 计费方式
图片会转换为 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 DeepSeek-V4-Flash 完全一致。
5.2 价格表(每百万 tokens)
| 费率 | 非高峰时段 | 高峰时段 |
|---|---|---|
| 输入(缓存未命中) | $0.22 | $0.44 |
| 输入(缓存命中) | $0.007 | $0.014 |
| 输出 | $0.66 | $1.32 |
高峰时段:UTC 时间 01:00--04:00 和 06:00--10:00
5.3 换算成"每张图"
| 场景 | 单张图片成本 |
|---|---|
| 非高峰,缓存未命中 | 约 $0.000084(不到 1 美分) |
| 高峰时段最高 | 约 0.001152 元(不到 0.002 元) |
5.4 Files API
| 项目 | 详情 |
|---|---|
| 费用 | 完全免费 |
| 单文件上限 | 64 MiB |
| 总存储容量 | 约 25 GiB |
| 核心价值 | 同一张图片无需重复上传,省带宽 |
六、注意事项
- 实验性质:该模型为实验性版本,能力可能随后续迭代调整
- 权重未开源:不同于 V4-Flash-0731 和 V4-Pro 0813,Vision-Exp 权重未公开
- 图片分辨率:所有图片会被自动缩放到约 800×800 像素等效,超过此分辨率的细节会丢失
- 基准测试:所有对比数据来自 DeepSeek 内部跑分(DeepSeek Harness Minimal Mode),尚无独立实验室复现
- 费率变动:非高峰费率较 7 月 31 日 V4-Flash-0731 发布时(0.14/0.28)有所上涨
七、总结
DeepSeek-V4-Flash-Vision-Exp 的上线标志着 DeepSeek 正式进入多模态 Agent 赛道。核心亮点可以概括为三句话:
- 能力:文本能力不降级,视觉能力逼近 Opus 4.8
- 价格:一张图不到 1 分钱,Files API 免费
- 生态:Harness 中间层同步更新,Agent 框架开箱即用
对于开发者来说,现在就可以用 model="deepseek-v4-flash-vision-exp" 开始接入多模态能力,无需等待正式版。