DeepSeek发布多模态模型deepseek-v4-flash-vision-exp:视觉能力正式接入Agent工作流

北大燕姐 · 2026年8月22日

【背景】

DeepSeek 今日推出面向 Agent 时代的多模态模型 deepseek-v4-flash-vision-exp(实验性质),已上线 DeepSeek API 平台,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问。

【核心能力】

能力清单:

文本能力与 V4-Flash 保持一致(Agent 能力、推理能力、世界知识)

新增视觉理解能力,支持图片输入

多模态 Agent 基准测试相比 V4-Flash 明显提升,表现接近 Opus-4.8 等高端模型

【接入方式】

开发要点:

支持混合文本和图片输入:图片可通过 Base64、外部 URL 或 Files API 提供

可通过 Chat Completions、Messages 以及 Responses API 调用

DeepSeek Harness 0.1.1 已原生支持该模型

【典型场景】

办公场景:Agent 读取截图、分析文档页面、理解表格内容。开发场景:将图像理解能力接入现有 Agent 工作流。

【技术观察】

从文本模型到多模态 Agent,AI Agent 的竞争重点正从"生成能力"转向"任务执行能力"。视觉能力是 Agent 完成真实工作的关键一环。deepseek-v4-flash-vision-exp 的发布,标志着 DeepSeek 多模态能力从"看图问答"走向更复杂的任务执行场景。

【开发建议】

建议:

现有 V4-Flash 工作流可直接替换模型名升级视觉能力,接口兼容

图片理解场景建议优先用 Base64 内联,减少外部依赖

注意该模型为实验性质,生产环境需评估稳定性

我做过从0到破亿的品牌,最深的体会是:

机会从来不是等来的,是提前看见的。

机器睁眼那天,有人还在等,有人已经开始铺路。

#DeepSeek #多模态 #Agent #AI开发 #大模型 #北大燕姐

北大燕姐 · AI定位与GEO增长|放大企业锋芒,看见个人光芒

beidayan.com

相关推荐
猎头南楼7 小时前
空调/家电嵌入式软件架构设计与 AI 辅助开发实践
人工智能
知几蜗牛7 小时前
Java 17调用gpt-transcribe实现会议录音转写与术语提示
人工智能
海盗12347 小时前
AI 新闻日报 2026-10-02:Claude Code 开放 Mods、13 自由度直驱灵巧手同日双发、代码评审成新瓶颈
人工智能·机器人·aigc
nhdh7 小时前
模型三剑客:工具、函数调用与MCP协同之道
人工智能·springai·智能客服、知识库问答
天国梦7 小时前
英语听说教学三大痛点与AI解决方案:从课堂困境到落地成效
人工智能
西索斯coding7 小时前
grok-4.7 调用一直 429 怎么办?不是额度用完——是 RPM 和 TPM 双桶限流,附响应头读取代码和退避策略
大数据·人工智能·机器学习·ai
ccstuck7 小时前
AI安全系列:给最小 Agent 做提示注入测试
人工智能·安全·ai安全
Dovis(誓平步青云)7 小时前
多个链接不等于多份证据,新闻核验看板怎样合并来源
java·服务器·前端·javascript·人工智能·pdf·电脑
连涨- AI脑波英语7 小时前
教育集团新增脑机单词速记产品线,怎样把教练工时算进试点成本?
人工智能·脑机单词速记
打工仔折腾 AI7 小时前
从BPE到SentencePiece:Transformer分词原理与Python实战对比
android·人工智能·python·深度学习·langchain·transformer·ai agent 实战