DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透

2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。


一、模型速览

项目 详情
模型名称 DeepSeek-V4-Flash-Vision-Exp
性质 实验性模型
上线日期 2026年8月21日
基于 DeepSeek-V4-Flash 正式版
总参数量 2840 亿(284B),激活参数 130 亿(13B/每 token)
架构 Mixture-of-Experts (MoE)
上下文窗口 1,048,576 tokens(约 100 万)
最大输出 384,000 tokens
默认并发限制 2,500 请求
是否开源 权重未开源

核心能力定位 :在纯文本能力(Agent、推理、世界知识等)上与 DeepSeek-V4-Flash 正式版完全持平 ;在需要视觉理解的 Agent Benchmark 上实现大幅跃升 ,多模态 Agent 能力已接近 Claude Opus 4.8

简单来说:DeepSeek 不再只是"别人负责看、DeepSeek 负责想",而是变成了"自己看、自己理解、自己推理、自己调用工具完成任务"的完整 Agent 闭环。


二、如何调用 API

2.1 调用入口

只需将 model 参数设置为 deepseek-v4-flash-vision-exp,即可通过 DeepSeek API 调用视觉理解能力。

python 复制代码
# 最简调用示例
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_API_KEY"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "请描述这张图片的内容"},
                {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
            ]
        }
    ]
)

print(response.choices[0].message.content)

2.2 三种 API 调用格式

本次多模态 API 同时兼容三种格式,方便接入各类 Agent 工具:

格式 说明
Chat Completions 标准 OpenAI 兼容格式,支持图文混合输入
Messages Anthropic 兼容格式
Responses DeepSeek 原生格式

三种格式均支持图文混合输入,在用户消息中同时包含文本和图片即可。

注意:图片只能出现在用户消息中。如果图片出现在 system 或 assistant 消息中,会返回 400 错误。

2.3 三种图片传入方式

方式 说明 适用场景
Base64 内联 将图片编码为 Base64 字符串直接嵌入请求体 小图片、离线环境
外部 URL 提供图片的 HTTP/HTTPS 链接 图片已托管在服务器
Files API 先上传图片获取 file_id,后续请求中引用 同一图片反复使用、省带宽

方式一:Base64 内联

python 复制代码
import base64

with open("screenshot.png", "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "分析这张截图中的错误信息"},
            {"type": "image_url", "image_url": {
                "url": f"data:image/png;base64,{img_b64}"
            }}
        ]
    }]
)

方式二:外部 URL

python 复制代码
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这个图表说明了什么?"},
            {"type": "image_url", "image_url": {
                "url": "https://cdn.example.com/report-chart.png"
            }}
        ]
    }]
)

方式三:Files API(推荐,完全免费)

python 复制代码
# 第一步:上传图片,获取 file_id
upload_response = client.files.create(
    file=open("report-chart.png", "rb"),
    purpose="vision"
)
file_id = upload_response.id  # 例如: "file_abc123"

# 第二步:在请求中引用 file_id
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "分析这张图表的趋势"},
            {"type": "image_url", "image_url": {
                "url": f"file://{file_id}"
            }}
        ]
    }]
)

# 第三步:同一张图片可反复使用,无需重复上传
# 适用于多轮 Agent 工作流中持续处理同一批视觉素材

2.4 支持的文件格式

格式 支持
JPEG
PNG
GIF
WebP

格式检测基于文件的实际内容而非扩展名或 MIME 类型。

2.5 图片输入限制

限制项 内联(Base64/URL) Files API
单文件大小上限 32 MiB 64 MiB
最大图片边长 8,192 px(≥15 张图时降至 4,096 px) ---
单请求最多图片数 600 张 ---
请求体大小上限 48 MiB 200 MiB
图片 token 预算 最多 384 tokens/张 同样

重要提示 :所有图片会被自动缩放到约 800×800 像素等效分辨率,超过该有效分辨率的细节会被丢弃------这是 384 token 固定预算的直接结果。


三、调用效果:基准测试全面对比

3.1 核心结论

在 11 项基准测试中,DeepSeek-V4-Flash-Vision-Exp 的表现可以概括为:

  • 赢下 3 项(vs Opus 4.8):DeepSWE(+1.3)、Agents' Last Exam(+1.6)、ZeroBench(+1.0)
  • 多项差距在 1-2 分以内:Terminal Bench、Toolathlon-Verified、Chartography、AutomationBench
  • 差距最大的 2 项:NL2Repo(差 12 分)、DSBench-Hard(差 8.1 分)

3.2 完整基准测试数据

文本型 Agent 评估

基准测试 Vision-Exp Flash-0731 Opus 4.8
Terminal Bench 2.1 83.9 82.7 85.0
NL2Repo 57.7 54.2 69.7
Cybergym 75.3 76.7 78.3
DeepSWE 59.3 54.4 58.0
Toolathlon-Verified 75.9 70.3 76.2
DSBench-Hard 63.6 59.6 71.7
AutomationBench (Public) 25.7 25.1 27.2

多模态 Agent 评估

基准测试 Vision-Exp Flash-0731 Opus 4.8
ApexBench (Pass@1) 36.5 26.2** 39.4
Agents' Last Exam 27.3 25.2** 25.7
Chartography 64.3 --- 65.0
ZeroBench (Pass@5) 35.0 --- 34.0

** Flash-0731 在这两项多模态基准上是"无视其中包含的多模态元素"进行评分的(纯文本模型盲测),对比不完全对等。

3.3 实际应用场景

官方展示了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力:

  • 商业 PPT 制作:模型可以理解真实摄影图片风格、"野性""原始""探索感"等抽象风格化要求
  • 网站视觉重构:对 DeepSeek Harness 官网进行二次创作
  • 前端 Mini Demo:制作黏土怪物风格动态特效的前端 Mini Demo
  • 图片内容描述:自然语言描述图片内容
  • 截图文字识别(OCR):识别截图中的文字
  • 图表分析:解析图表数据并给出洞察

四、中间层架构详解:DeepSeek Harness 0.1.1

多模态 API 的上线并非孤立事件,DeepSeek 同日发布了 Harness v0.1.1-rc.1 版本更新,这是整个多模态生态的"中间层"------连接开发者与模型能力的关键桥梁。

4.1 版本迭代历程

自开发者预览版 v0.1.0-rc.6 首日发布以来,DeepSeek Harness 已连续完成三次版本更新

版本 核心内容
v0.1.0-rc.7 多模态核心能力开放
v0.1.0-rc.8 多模态基础支持
v0.1.1-rc.1 原生图片请求、多模态模型选项、持久化附件

4.2 多模态能力增强

功能 说明
模型适配器 新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,支持配置原生图片请求
/goal、/plan 命令 从纯文本升级为支持图文混合输入
@ 菜单 从仅引用文件扩展为可引用文件和历史会话
MCP/ACP 附件持久化 图片附件在多次调用间保持,不会随单次调用结束而消失
PTC Mode 支持转发嵌套图片

4.3 子代理与插件架构

功能 说明
Codex 与 Claude Code 从捆绑分发改为按需安装的 Profile Bundle
Codex 非交互权限模式 支持在无人值守流程中运行
Codex 多命名实例 允许同时运行多个配置不同、名称各异的子智能体
回报路径优化 reportDelivery 及时反馈并唤醒父任务,消除盲目等待
插件注册 插件可自行注册设置卡片,能力扩展与任务管理更便捷

4.4 稳定性与性能优化

项目 说明
web_search 支持并发查询
Windows PTY 正式加入持久 PowerShell 会话支持,极简模式默认开启
SQLite 后端 读写和分叉性能显著提升,存储体积降低
修复项 长会话、终端兼容、模型请求、沙箱权限等问题
交互细节 提问卡片、Markdown 表格、多行输入、会话切换优化

4.5 架构关系图


五、价格:一张图不到 1 分钱

5.1 计费方式

图片会转换为 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 DeepSeek-V4-Flash 完全一致。

5.2 价格表(每百万 tokens)

费率 非高峰时段 高峰时段
输入(缓存未命中) $0.22 $0.44
输入(缓存命中) $0.007 $0.014
输出 $0.66 $1.32

高峰时段:UTC 时间 01:00--04:00 和 06:00--10:00

5.3 换算成"每张图"

场景 单张图片成本
非高峰,缓存未命中 $0.000084(不到 1 美分)
高峰时段最高 0.001152 元(不到 0.002 元)

5.4 Files API

项目 详情
费用 完全免费
单文件上限 64 MiB
总存储容量 约 25 GiB
核心价值 同一张图片无需重复上传,省带宽

六、注意事项

  1. 实验性质:该模型为实验性版本,能力可能随后续迭代调整
  2. 权重未开源:不同于 V4-Flash-0731 和 V4-Pro 0813,Vision-Exp 权重未公开
  3. 图片分辨率:所有图片会被自动缩放到约 800×800 像素等效,超过此分辨率的细节会丢失
  4. 基准测试:所有对比数据来自 DeepSeek 内部跑分(DeepSeek Harness Minimal Mode),尚无独立实验室复现
  5. 费率变动:非高峰费率较 7 月 31 日 V4-Flash-0731 发布时(0.14/0.28)有所上涨

七、总结

DeepSeek-V4-Flash-Vision-Exp 的上线标志着 DeepSeek 正式进入多模态 Agent 赛道。核心亮点可以概括为三句话:

  • 能力:文本能力不降级,视觉能力逼近 Opus 4.8
  • 价格:一张图不到 1 分钱,Files API 免费
  • 生态:Harness 中间层同步更新,Agent 框架开箱即用

对于开发者来说,现在就可以用 model="deepseek-v4-flash-vision-exp" 开始接入多模态能力,无需等待正式版。

相关推荐
VIP_CQCRE1 小时前
用 Ace Data Cloud 快速接入 MiniMax H3:把 AI 视频生成能力变成可调用的生产力
ai·aigc·api·视频生成·acedatacloud
赵大仁2 小时前
AI 限流 UX 设计:排队、降级、告知与用户预期管理
前端·ai·限流·用户体验·产品设计
秋饼2 小时前
LangChain4j + Java 实现企业级 Text-to-SQL 智能问数系统:从自然语言到安全可控的数据洞察
java·ai·技术分享·后端开发
前沿在线2 小时前
WRC2026丨当机器开始理解人的意图,人机交互走向更多场景
人工智能·ai·大模型
CoderJia程序员甲2 小时前
GitHub 热榜项目 - 周榜(2026-08-22)
ai·大模型·llm·github·ai教程
俊哥V2 小时前
每日 AI 研究简报 · 2026-08-22
人工智能·ai
AI导出鸭PC端3 小时前
文心怎样生成word文档?一键智能排版,AI导出鸭解决格式错乱痛点
人工智能·ai·word·豆包·deepseek·ai导出鸭
liulilittle3 小时前
llmx 学习手册 06 —— CPU 指令集优化(AVX-512 三层演进)
c++·学习·算法·ai·llm
界面开发小八哥3 小时前
界面控件DevExpress XAF v26.1新版亮点——AI Agent Skills
ai·c#·跨平台·devexpress·ui开发·xaf