DeepSeek发布多模态模型deepseek-v4-flash-vision-exp:视觉能力正式接入Agent工作流

北大燕姐 · 2026年8月22日

【背景】

DeepSeek 今日推出面向 Agent 时代的多模态模型 deepseek-v4-flash-vision-exp(实验性质),已上线 DeepSeek API 平台,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问。

【核心能力】

能力清单:

文本能力与 V4-Flash 保持一致(Agent 能力、推理能力、世界知识)

新增视觉理解能力,支持图片输入

多模态 Agent 基准测试相比 V4-Flash 明显提升,表现接近 Opus-4.8 等高端模型

【接入方式】

开发要点:

支持混合文本和图片输入:图片可通过 Base64、外部 URL 或 Files API 提供

可通过 Chat Completions、Messages 以及 Responses API 调用

DeepSeek Harness 0.1.1 已原生支持该模型

【典型场景】

办公场景:Agent 读取截图、分析文档页面、理解表格内容。开发场景:将图像理解能力接入现有 Agent 工作流。

【技术观察】

从文本模型到多模态 Agent,AI Agent 的竞争重点正从"生成能力"转向"任务执行能力"。视觉能力是 Agent 完成真实工作的关键一环。deepseek-v4-flash-vision-exp 的发布,标志着 DeepSeek 多模态能力从"看图问答"走向更复杂的任务执行场景。

【开发建议】

建议:

现有 V4-Flash 工作流可直接替换模型名升级视觉能力,接口兼容

图片理解场景建议优先用 Base64 内联,减少外部依赖

注意该模型为实验性质,生产环境需评估稳定性

我做过从0到破亿的品牌,最深的体会是:

机会从来不是等来的,是提前看见的。

机器睁眼那天,有人还在等,有人已经开始铺路。

#DeepSeek #多模态 #Agent #AI开发 #大模型 #北大燕姐

北大燕姐 · AI定位与GEO增长|放大企业锋芒,看见个人光芒

beidayan.com

相关推荐
海兰1 小时前
【插件】OpenClaw 上下文引擎指南
人工智能·agent·openclaw
Rocky Ding*1 小时前
【三年面试五年模拟】2026-08-18_哔哩哔哩AI应用岗Agent开发一面面经全解析(含完整答案)
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
geneculture1 小时前
基于融智学框架的领军人才实训实操示范基地建设: 课题、课程与项目的系统工程(人机三双协同即人机双脑双智双语协同)
人工智能·融智学的重要应用·哲学与科学统一性·融智时代(杂志)·序位逻辑的实例化·人机三双协同
key_3_feng1 小时前
智能体 Loop 工程:循环架构与状态机
人工智能·loop·智能体
冬奇Lab1 小时前
Code Agent 解剖(08):一个任务太复杂,怎么拆给子 agent 做?
人工智能·开源
冬奇Lab1 小时前
开源项目第195期:OpenTelemetry Demo(Astronomy Shop)— 官方出品的分布式系统可观测性实战教材
人工智能·开源·前端工程化
海兰1 小时前
【原理】OpenClaw Agent 运行时回顾一文清
人工智能·agent
民乐团扒谱机1 小时前
【微实验】物理启发神经网络(PINN):当AI学会遵守物理定律(附matlab代码))
人工智能·神经网络·matlab
极客互动API2 小时前
企业微信 iPad 协议消息接口开发:文本 / 图片 / 群发消息的统一封装
人工智能·ios·微信·机器人·企业微信·ipad