DeepSeek 视觉 API 刚上线:单张图 0.001 元,Agent 终于能看图

你昨天还在给 Agent 接 OCR 服务,今天 DeepSeek 直接把眼睛递到你手里了。

2026 年 8 月 21 日,DeepSeek 在 API 平台上线了实验性多模态视觉模型 deepseek-v4-flash-vision-exp。一句话讲清楚,开发者第一次能用自己的 API Key,把图片塞进 DeepSeek 的上下文,让模型看、再让 Agent 接着干活。

先泼盆冷水,免得你白高兴。

这不是 DeepSeek 第一次「识图」。网页和 App 端的「识图模式」早在 2026 年 4 月底灰度、6 月全量上线了。今天开放的是开发者 API,你能在代码里传图,而不是在对话框里传图。

另一个坑更隐蔽,模型名带 exp,是实验版本,不是 V4-Flash 的正式多模态版。别拿它当生产稳定版梭哈。

文本没掉,多模态直接跃升

光看「能看图」没意思,得看加了视觉后文本能力掉没掉。官方给的答案是,纯文本 Agent、推理、世界知识,和 V4-Flash 正式版持平,加视觉没有牺牲老本行。

再看多模态 Agent 能力,官方定位是「接近 Opus-4.8」。拉几组能对比的数字,来源都是 DeepSeek 官方 benchmark 表。

  • ApexBench(Pass@1),vision-exp 36.5,V4-Flash-0731 只有 26.2(标注忽略多模态),Opus-4.8 是 39.4。视觉一加,直接从 26 蹦到 36。
  • Agents' Last Exam,vision-exp 27.3,比 Opus-4.8 的 25.7 还高一点。
  • ZeroBench(Pass@5),vision-exp 35.0,Opus-4.8 是 34.0,反超。
  • Chartography,vision-exp 64.3,Opus-4.8 65.0,几乎贴脸。

剩下那一串 Agent 评测也都在 25 到 84 的区间,Terminal Bench 2.1 是 83.9,NL2Repo 57.7,Cybergym 75.3,DeepSWE 59.3,Toolathlon-Verified 75.9,DSBench-Hard 63.6,AutomationBench(Public)25.7(来源,DeepSeek API Docs Updates)。

结论很清楚,它补齐的是「Agent 能看图」这块拼图,不是给你做个图片问答玩具。对做后端的我们来说,这才是今天这条消息真正值钱的地方。

三行核心改动,把图塞进现有工作流

如果你是 OpenAI SDK 用户,几乎不用改架构,只换 model 参数。下面这段能直接跑,依赖 openai==1.55.0

python 复制代码
# requirements.txt: openai==1.55.0
import base64
import os
from openai import OpenAI

# DeepSeek 兼容 OpenAI 格式,只换 base_url 和 model
client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

# 读图并 base64 编码(支持 JPEG/PNG/GIF/WebP)
with open("error_screenshot.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

# 图片只能放在 user message,图文混排成一个 content 数组
resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这是一次构建失败的截图,帮我定位报错根因并给出修复步骤。"},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}},
        ],
    }],
)
print(resp.choices[0].message.content)

注意两点。图片只能放在 user message 里,塞进 systemassistant 会直接返 400。detail 参数支持 low(缩到 512×512)/ high / original / auto,默认 auto,按你想要的画质和成本权衡。

同一张图要反复用?上 Files API

每次 base64 内联,图都要跟着请求体走,单请求体上限 48 MiB、单图最大 32 MiB。如果你的 Agent 要在多轮里反复引用同一张设计稿或同一张报错图,用 Files API 上传一次拿 file_id,后面只传 id。

python 复制代码
# 上传一次,拿 file_id 反复引用,省带宽
with open("dashboard.png", "rb") as f:
    upload = client.files.create(file=f, purpose="user_data")
file_id = upload.id

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "解释这张监控大盘的异常波动,并给出排查方向。"},
            # 官方格式:用 file 内容块引用 file_id
            {"type": "file", "file_id": file_id},
        ],
    }],
)

关键点,Files API 上传和引用本身不收费,但模型处理图片的 token 照样计费。它省的是带宽和重复编码,不是 token。单图最大 64 MiB,比内联的 32 MiB 宽松一倍。

三种传图方式怎么选

方式 适合场景 限制 成本注意
base64 内联 本地小图、一次性请求 单图 ≤ 32 MiB,请求体 ≤ 48 MiB 图片占请求体,大图片增加延迟
外部 URL 图片已托管在 CDN/图床 URL ≤ 8192 字符,下载限时 60 秒 DeepSeek 侧下载,不占用请求体
Files API 同一张图反复用、大图 单图 ≤ 64 MiB,总存储 25 GiB 上传/引用免费,token 照计

核心建议,单次分析用小图直接 base64;团队协作或 Agent 多轮复用同一份设计稿/监控图,优先 Files API。

多少钱?单张图最高也就 0.001 元

图片按 token 计费,最多算 384 tokens(官方 resize 后约 800×800 等效)。定价和 V4-Flash 一致,per 1M tokens。

  • 输入缓存命中,0.007(非峰)/ 0.014(峰)
  • 缓存未命中,0.22(非峰)/ 0.44(峰)
  • 输出,0.66 / 1.32

峰值时段是 UTC 01:00--04:00、06:00--10:00。最坏情况,峰值加缓存未命中,单张图,384 × 0.44 / 1,000,000 ≈ 0.000169,按汇率 7.2 算约 ¥0.0012,不到两厘。平时非峰加缓存命中还能再砍一个数量级。

举个实务的数。一个每天处理 1000 张报错截图的排障 Agent,按峰值最坏单价算,图片成本约 1000 × ¥0.0012 = ¥1.2/天,月成本不到 40 块。这还没算文本 token,但视觉这部分基本可以忽略不计。对比你自维护一套 OCR 服务的机器和运维钱,原生视觉几乎白送。

为什么图片最多只算 384 token

你可能会问,DeepSeek 明明能把图缩到 512 或保留原尺寸,为什么计费上限卡在 384 token。这其实是个成本和能力的取舍,不是技术做不到。

视觉理解大多数时候不需要像素级精度。看明白 UI 布局、图表趋势、报错红字,低分辨率就够用。官方把图 resize 到约 800×800 等效再编码,既压住了 token 成本,也避免一张长截图把上下文窗口撑爆,挤掉真正要处理的文本和工具调用。

反例就摆在眼前。早年没有原生视觉 API 时,工程师得先接 OCR 服务抽出文字,再自己拼 prompt 喂给文本模型。这套链路脆弱,表格一歪、字体一花,OCR 就漏字,模型跟着瞎猜。现在模型自己看图,那层胶水代码可以直接删了。

真能用在哪?官方三个 demo 已经说明问题

DeepSeek 自己放出的三个 Agent 场景,全是把视觉理解嵌进多轮工具调用,不是单轮问答。

  1. 西藏自驾游 PPT,丢一堆旅行截图,Agent 自己整理行程、出可演示的 PPT。
  2. Harness 官网二次创作,把官网截图喂进去,模型读懂结构后重构页面。
  3. 黏土怪物前端 Demo,看一张参考图,直接产出带动态特效的前端代码。

对后端和 Agent 开发者最实在的一点,你不用再自己写「截图 → OCR → 拼 prompt → LLM」那层胶水代码了。UI、图表、报错截图,模型能看懂,然后接着调你的工具。同天更新的 DeepSeek Harness v0.1.1 也接上了这个模型,工具链算是闭环了。

反过来看,如果还是老办法,你得先 OCR 抽文字再拼 prompt,表格一歪模型就瞎猜,报错截图里的红字还可能被漏掉。原生视觉把这一步直接吞掉了,Agent 拿到的就是「看懂了」的结果,而不是一段可能出错的文本中转。

对后端 / Agent 开发者,这事到底改变了什么

说白了,以前想让 Agent 处理视觉输入,你得自己当中间商。截图落库、调 OCR、清洗文本、拼进 prompt、再让文本模型决策。每一步都可能在生产环境半夜把你叫醒修。

现在模型原生看图,这个中间商被取消了。Agent 的工作流变成,把图直接丢进 user message,模型看懂后继续调你的工具。西藏 PPT、网页重构、前端 Demo 这三个官方 demo 全是这个套路,没有一个是单轮图片问答。

顺着这个想,这会催生一批「能看屏幕的 Agent」。排障 Agent 看报错截图、数据 Agent 看报表、运维 Agent 看监控大盘。这类场景过去因为缺原生视觉,做出来都半残,现在门槛塌了。

常见问题

Q1:这是正式版吗,能直接上生产吗?

命名带 exp,实验版。官方没给 SLA,建议先在内部流程或非关键链路试,别梭哈。

Q2:和网页、App 的识图模式有什么区别?

识图模式是 4 月底灰度、6 月全量的 C 端能力;今天是开发者 API,能在代码里传图、接进 Agent 工作流。

Q3:图片支持哪些格式和大小?

JPEG、PNG、GIF、WebP。内联单图 ≤ 32 MiB、请求体 ≤ 48 MiB、单请求最多 600 张;Files API 单图 ≤ 64 MiB。

Q4:用 Anthropic SDK 也能调吗?

能。官方支持 Chat Completions、Anthropic Messages、Responses API 三种入口,Anthropic 格式直接传 image 块即可。

Q5:看图免费吗?

不免费。Files API 上传和引用不收接口费,但模型推理时图片 token(最多 384)照常计费。

参考资料

  • DeepSeek 官方 API Docs / Updates,模型发布、11 项 benchmark、定价页
  • DeepSeek 官方 Vision guide,三种传图方式、限额、detail 参数
  • 公开报道,DeepSeek Harness v0.1.1 同日更新支持该模型

我的判断很直接,DeepSeek 这次补齐的不是「能看图」的噱头,是「Agent 能看图」的生产拼图。对每天跟截图、报表、UI 打交道的后端来说,那层 OCR 胶水代码可以开始拆了。

想第一时间试,把上面那段 OpenAI SDK 代码里的 model 换成 deepseek-v4-flash-vision-exp、配好 API Key 就能跑。下篇我打算写「如何用 Files API 加多轮工具调用,搭一个能看报错截图的排障 Agent」,感兴趣的关注一下,别错过。

下期写什么你定,想看我用 Files API 实搭一个「看报错截图排障」的 Agent,还是横向对比 Gemini、Claude 视觉 API 的成本?留言区告诉我。身边有同事还在用 OCR 服务接 LLM 的,这篇直接甩给他,省得他下周还在调那层胶水。顺手点个「在看」,让更多被 API 账单和胶水代码折磨的工程师看到。


🔧 文中用到的完整调用模板

以上我分享了最核心的接入代码,完整版(含 Files API 上传示例、Anthropic 格式对照、detail 参数选型表)已整理好。

回复「vision」即可获取,持续更新。


如果这篇帮你省了时间,转发给你的程序员朋友------大家都在摸索 Agent 提效,你的分享可能帮他少写一层胶水代码。

相关推荐
oscar9994 小时前
用 Opik 记录多模态追踪:图像、视频、音频附件的完整指南
多模态·opik
星空inn4 小时前
DeepSeek V4.1 Flash 实测:分数持平 GPT-6 Astra,单任务成本低 15 倍
ai·chatgpt·deepseek
华科大胡子4 小时前
DeepSeek Harness 开源贡献手记:从入门到合入主线的完整旅程
deepseek
冬奇Lab16 小时前
DeepSeek Harness 系列(09):可观测性——怎么知道 Agent 在干什么
人工智能·deepseek
星云_byto1 天前
大模型测评:从最新出的DeepSeekV4.1模型看这19项指标
chatgpt·agent·多模态·codex·deepseek·大模型测评·opus-4.8
JaydenAI2 天前
[DeepSeek Harness深度拆解-04]完整的插件配置树如何构建?
ai·agent·deepseek·harness·cordis
东姬AI2 天前
当世界模型学会“开口说话“:从EchoWM开源,看AI生成内容的音画合流
多模态·ai数字人·世界模型·ai视频生成·音画同步
hoaxxcj2 天前
DeepSeek Harness 本地部署与第三方插件排障实录:从 fetch failed 到 preset not found
人工智能·windows·开源·ai agent·deepseek
对角2 天前
摸鱼神器:一边写代码,一边刷剧,从此没有一点摸鱼时间会被浪费!
ai编程·deepseek·vibecoding