北大燕姐 · 2026年8月22日
【背景】
DeepSeek 今日推出面向 Agent 时代的多模态模型 deepseek-v4-flash-vision-exp(实验性质),已上线 DeepSeek API 平台,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问。
【核心能力】
能力清单:
文本能力与 V4-Flash 保持一致(Agent 能力、推理能力、世界知识)
新增视觉理解能力,支持图片输入
多模态 Agent 基准测试相比 V4-Flash 明显提升,表现接近 Opus-4.8 等高端模型
【接入方式】
开发要点:
支持混合文本和图片输入:图片可通过 Base64、外部 URL 或 Files API 提供
可通过 Chat Completions、Messages 以及 Responses API 调用
DeepSeek Harness 0.1.1 已原生支持该模型
【典型场景】
办公场景:Agent 读取截图、分析文档页面、理解表格内容。开发场景:将图像理解能力接入现有 Agent 工作流。
【技术观察】
从文本模型到多模态 Agent,AI Agent 的竞争重点正从"生成能力"转向"任务执行能力"。视觉能力是 Agent 完成真实工作的关键一环。deepseek-v4-flash-vision-exp 的发布,标志着 DeepSeek 多模态能力从"看图问答"走向更复杂的任务执行场景。
【开发建议】
建议:
现有 V4-Flash 工作流可直接替换模型名升级视觉能力,接口兼容
图片理解场景建议优先用 Base64 内联,减少外部依赖
注意该模型为实验性质,生产环境需评估稳定性
我做过从0到破亿的品牌,最深的体会是:
机会从来不是等来的,是提前看见的。
机器睁眼那天,有人还在等,有人已经开始铺路。
#DeepSeek #多模态 #Agent #AI开发 #大模型 #北大燕姐
北大燕姐 · AI定位与GEO增长|放大企业锋芒,看见个人光芒