期待了很久的DeepSeek多模态视觉模型终于上线了

大家好,我是晓凡。

等了这么久,DeepSeek 终于有视觉模型了。8 月 21 日,DeepSeek 悄悄上线了多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,DeepSeek 终于自己能看图了。


一、这是个什么模型?

先说定位。V4-Flash-Vision-Exp 是一个实验性质的模型,你可以理解为 DeepSeek 在视觉方向的第一个正式产物。它有两个特点:

  1. 文本能力没缩水:在 Agent、推理、世界知识这些纯文本任务上,跟 V4-Flash 正式版持平,没有因为加了视觉模块就变弱。
  2. 视觉理解是新增的:在需要看图的 Agent Benchmark 上,相比 V4-Flash 实现了大幅跃升,官方说法是"多模态 Agent 能力已接近 Opus-4.8"。

翻译成人话就是:原来 DeepSeek 只能读字,现在能看图了,而且看图干活的能力跟 Claude Opus 差不多在一个量级。对于做 Agent 开发的人来说,这意义很大,因为很多实际场景里,光靠文字描述是不够的,模型得能"看"才行。

支持的图片格式:JPEG、PNG、GIF、WebP,主流格式全覆盖。


二、基准测试:它到底有多强?

官方这次直接给出了 V4-Flash-Vision-Exp 跟 V4-Flash、Opus-4.8 的对比。结论很清晰:

纯文本能力基本持平

在 Code Agent、推理、世界知识这些纯文本基准测试上,V4-Flash-Vision-Exp 和 V4-Flash 打平。这意味着你原来用 V4-Flash 写的文本任务、Agent 流程,换成这个视觉版不会掉链子。

多模态 Agent 能力大幅跃升

到了需要看图的 Agent Benchmark(比如 ApexBench、Agents' Last Exam 这类测评),V4-Flash 因为没视觉能力,基本会忽略其中的多模态元素。而 V4-Flash-Vision-Exp 不仅能看图,还能把视觉信息和文本任务结合起来做推理,表现接近 Opus-4.8。

这意味着什么?做 Agent 的小伙伴可以开始把"看"这个维度加进去了。比如截图识别、UI 自动化、文档理解这些场景,原来只能通过其他多模态模型识图,把图片转换成文字再投喂给DeepSeek,现在可以端到端扔给自己模型处理了。


三、多少钱?

这个可能是大家最关心的。好消息是:计费价格跟 V4-Flash 一模一样,图片不额外加价,而是换算成 token 跟文本一起计费。

项目 空闲时段 高峰时段
输入(缓存命中) 0.05 元/百万 tokens 0.10 元/百万 tokens
输入(缓存未命中) 1.5 元/百万 tokens 3.0 元/百万 tokens
输出 4.5 元/百万 tokens 9.0 元/百万 tokens

几个要点说清楚:

  • 高峰时段:北京时间 9:00-12:00、14:00-18:00,其余都是空闲时段。空闲时段价格直接半价,这个区分挺实在的。
  • 图片怎么算钱 :图片会根据尺寸换算成 token,一张图最多占 384 个 tokens 。具体换算逻辑是:小于约 384×384 的图会被等比放大,大于这个尺寸的会被等比缩小到约 800×800 的总像素量。所以不管你丢进去一张 2000×2000 还是 5000×5000 的图,经过缩放后消耗的 token 数是一样的,封顶就是 384 个 token
  • 并发限制:2500,跟 V4-Flash 一样。
  • 另外有个 Files API 也同步上线了,不收费。可以先上传图片拿到 file_id,后面多个请求复用,不用每次重复传,省带宽。

如果你想精确估算某张图的 token 消耗,DeepSeek 官方提供了一个图片 Token 计算器,输入宽高就能出结果。比如 1920×1080 的截图,预估消耗 369 个 tokens,离 384 的上限很近了。


四、识图能力能干嘛?

光说参数没意思,说说实际能干什么。结合官方信息和文档,V4-Flash-Vision-Exp 的视觉能力主要用在这些场景:

  • 看图说话:丢一张图让它描述内容、识别图中文字
  • 截图分析:前端报错截图、UI 设计稿,让它看懂并给出修复方案或还原代码
  • 图表理解:丢一张数据图表,让它分析趋势、提取关键数据
  • 文档识别:识别文档页面、表格内容
  • Agent 场景:这是重点。在 Agent 框架内,模型可以同时接收文字和图片输入,然后调用工具完成任务。比如看一张设计图直接生成前端页面,或者根据截图信息执行操作。

官方给了 3 个演示案例:

示例 1:生成商业定制西藏自驾游 PPT,要求高端大气、野性粗粝,最后给三种定价方案。

示例 2:对 DeepSeek Harness 官网进行二次创作,用黑蓝深海、玻璃 UI 和 ASCII 像素风格重构。

示例 3:制作黏土怪物风格动态特效的前端 Mini Demo。


五、3 个实操案例提示词

官方的案例偏展示,我给大家准备了 3 个更贴近日常使用的提示词,可以直接拿去试:

案例 1:看 UI 截图还原前端代码

请看这张 UI 设计截图,帮我用 HTML + Tailwind CSS 还原这个页面布局。要求:1)整体布局 1:1 还原;2)配色用截图中的实际色值;3)先给我完整 HTML 代码,再说明你识别到的关键设计元素。

案例 2:分析数据图表并生成文字摘要

这是一张影片票房详情截图。请帮我:1)读出图表中的关键数据点;2)识别增长趋势和异常波动;3)用一段话总结基本情况。

案例 3:识别架构图并转为结构化文档

这是一张我们系统架构的白板手绘照片。请帮我:1)识别图中的所有组件和它们之间的连接关系;2)将识别结果整理成 Markdown 格式的架构文档,包含组件列表、数据流向说明;3)如果有些地方看不清楚,标注出来让我确认。


六、怎么调 API?

调 API 不复杂,跟 OpenAI 格式完全兼容。核心就是 content 传一个数组,里面放文本块和图片块。

方式一:Base64 内联(本地图片最简单)

python 复制代码
import base64
from openai import OpenAI

client = OpenAI(api_key="<你的API Key>", base_url="https://api.deepseek.com")

with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图片里有什么?"},
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/jpeg;base64,{b64}"},
                },
            ],
        }
    ],
)
print(response.choices[0].message.content)

方式二:外部图片 URL

python 复制代码
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "描述一下这张图片。"},
                {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
            ],
        }
    ],
)

URL 方式有限制:链接最长 8192 字符,图片最大 32 MiB,需 60 秒内下载完。

方式三:Files API(多请求复用同一张图)

python 复制代码
# 先上传图片(通过 Files API),拿到 file_id
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图片里有什么?"},
                {"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"},
            ],
        }
    ],
)

Files API 方式的图片最大可达 64 MiB,而且不受 32 MiB 单图限制。

除了上面三种方式,模型还支持通过 Anthropic API/messages 端点)和 Responses API 调用,三种格式的图片传入方式都覆盖了,接入现有 Agent 工具链很方便。

有个小技巧:image_url 可以传 detail 参数控制精度。low 会把图缩到 512×512,更快更省 token;original 保留原图。不需要精细细节的时候用 low 就行。

最后贴一下官方文档里的限制表,调用前最好扫一眼:


七、怎么在 DeepSeek Harness 里用?

DeepSeek Harness 也同步更新了,支持视觉模型。操作很简单:

第一步:将DeepSeek Harness更新到最新版

bash 复制代码
npm install -g @deepseek-ai/dsh@latest

第二步:配置模型

在 Harness 配置里选择 deepseek-v4-flash-vision-exp。Harness 会自动适配图片请求,不需要额外配置转换层。

第三步:用起来

直接把牛来的宣传海报丢给它,然后让它帮分析下

简单说就是:更新 Harness → 选模型 → 丢图 → 干活。跟原来用纯文本模型一样,只不过现在能看图了。

如果你是在 Codex 里用 DeepSeek,可以通过 CC Switch 配置,获取模型列表后切换到 deepseek-v4-flash-vision-exp 即可。

① 配置deepseek

② 获取并选择deepseek-v4-flash-vision-exp模型


写在最后

DeepSeek 这个视觉模型来得不算早,但价格确实有诚意。跟 V4-Flash 同价,空闲时段输入缓存命中只要 0.05 元/百万 tokens,图片封顶 384 token,试错成本很低。

模型名字带个 "Exp"(实验性),说明还在迭代,但能力已经接近 Opus-4.8 了,后续正式版应该会更强。对于做 Agent 开发、需要视觉理解能力的场景,现在就可以上手试了。

官方文档链接放这里,想了解更多的小伙伴看过来:

我是晓凡,再小的帆也能远航。热衷于分享一些好玩的实用的干货内容。

如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。

相关推荐
xiezhr1 小时前
期待已久的DeepSeek多模态视觉模型终于上线了
aigc·agent·deepseek
MicrosoftReactor11 小时前
技术速递|Canvas 如何让 Agentic Workflow 更可见、可控、更高效
ai·agent·canvas
前沿在线12 小时前
百度文心助手推出任务引擎 2.0,日活用户同比增长 83%,日均对话轮次增长超 2 倍
人工智能·ai·大模型
我才是银古12 小时前
给 AI 编程代理集群加"眼睛":一次真实的多模态接入与健壮性加固实录
deepseek·opencode
努力就够了15 小时前
搭建属于自己的 AI 智能体以及多 Agent 协作
springboot·ai agent·ai 智能体·多 agent 协作
张忠琳16 小时前
【deepseek-harness】DeepSeek Harness (dsh) 系统级架构分析之二
ai·agent·deepseek·harness
DevOps老兵16 小时前
AI全栈知识07:向量数据库 - Milvus/Chroma实战
数据库·ai·milvus
故作春风17 小时前
钱包顶不住了:从 FRP 内网穿透本地 Ollama 到 DeepSeek Harness 多模型实战全记录
agent·deepseek