
今天刷到 DeepSeek API 文档更新,我第一反应其实不是「DeepSeek 又发新模型了」,而是:
DeepSeek 终于把"眼睛"补上了。
8 月 21 日,DeepSeek 上线了新的实验性视觉模型:
text
deepseek-v4-flash-vision-exp
它可以直接接收图片,让 DeepSeek 不只是读文字、写代码,而是开始真正理解截图、图表、界面和图片内容。公开信息显示,它保持了 V4 Flash 的文本能力,同时加入视觉理解能力,DeepSeek 官方还表示,它在部分视觉 Agent Benchmark 上的表现已经接近 Opus 4.8。
我觉得,重点其实不是"识图"
现在会看图片的大模型已经很多了。
GPT、Claude、Gemini,包括很多国产模型,早就已经支持图片输入。
所以如果 DeepSeek 只是增加一个「上传图片 → 告诉你图片里有什么」的功能,我觉得没什么值得大惊小怪的。
真正让我觉得有意思的是:DeepSeek 正在补齐 Agent 最重要的一块能力。
以前一个 AI Agent 写代码很厉害,但它很可能是"瞎的"。
比如让它:
打开网页 → 看页面 → 点击按钮 → 发现报错 → 截图 → 修改代码 → 再测试
这里面大量信息根本不在文本里,而是在界面和截图里。
有了 Vision 以后,AI 才真正开始具备:
看见 → 理解 → 判断 → 操作
这才是 Agent 应该走的方向。
而且 DeepSeek 这次价格依然很凶
目前的信息显示,Vision 版本依然延续 V4 Flash 的低价策略,图片会转换成视觉 Token,一张图片最高约 384 Token。
这件事对普通聊天可能没那么明显。
但对于 Computer Use、浏览器自动化、AI 编程 Agent 来说非常重要。
因为这些 Agent 一次任务可能不是看一张截图,而是连续看几十张截图。
当视觉成本足够低以后,以前只能做 Demo 的东西,才有可能真正大规模跑起来。
对开发者来说,还有一个好消息
DeepSeek API 本身兼容 OpenAI 和 Anthropic API 格式,而且官方已经明确在往 Claude Code、OpenCode 等 Agent 工具方向做适配。
所以我觉得接下来真正值得关注的,不是拿 DeepSeek Vision 做一道「看图说话」测试题。
而是把它塞进:
Claude Code、OpenCode、DeepSeek Harness、浏览器 Agent、自动化工具。
看看一个便宜、能写代码、能调用工具、现在又能看见屏幕的 DeepSeek,到底能把 Agent 做到什么程度。
最后
我一直觉得,大模型的发展正在经历一个很明显的变化:
以前大家比的是:
谁更聪明。
现在开始比的是:
谁能真正把事情做完。
而一个连屏幕都看不见的 AI,显然很难真正替你操作电脑。
所以 DeepSeek V4 Flash Vision 在我看来,并不只是增加了一个多模态模型。
它更像是在给 DeepSeek Agent 装上一双眼睛。
现在它还是 Exp 实验版,真正效果怎么样,还需要实际跑 Agent 场景验证。
但这个方向,我觉得值得持续关注。
官方文档:
现在是最好的时代。中国有全世界最高性价比的制造业,有发达的网络和全球物流。
只要你愿意,你几乎可以买到这个世界上任何地方生产的、任何你想要的商品。你可以用很低的成本,撬动全球的资源为你服务。
不过,真正稀缺的,从来不是商品,而是注意力、判断力,以及把事情做成的能力。
所以,这是最好的时代,也是最坏的时代。
我是王仕宇,关注 AI、Web3 与开源,持续探索如何把技术做成产品,把产品转化为真实价值。