本文针对 2026 年 9 月 8 日出现的 DeepSeek V4.1 Flash 限时中间版本内测,说明如何通过 OpenAI 兼容接口调用、如何传入图片,以及当前价格和生产迁移边界。
重要说明:目前公开信息来自内测通知转述;DeepSeek 官方公开 API 文档和价格页尚未列出 V4.1 Flash,因此本文不把它写成 GA 稳定版,也不把"更快、更强、更低成本"写成本地实测结论。

1. 当前可确认信息
| 项目 | 当前信息 |
|---|---|
| 模型名称 | DeepSeek V4.1 Flash |
| 临时模型 ID | deepseek-v4.1-flash-expires-on-0910 |
| API 地址 | https://api.deepseek.com |
| 可用性质 | 限时中间版本内测 |
| 预计期限 | 2026-09-10 |
| 并发限制 | 公开报道转述为单账号 20 并发 |
| 多模态 | 内测通知转述为原生支持 |
| 独立官方价格 | 暂未在公开价格页列出 |
官方当前公开模型列表仍是:
text
deepseek-v4-flash
deepseek-v4-pro
deepseek-v4-flash-vision-exp
因此,调用临时 ID 前必须确认账号是否有资格。模型列表接口、第三方平台和稳定版配置不能据此推断 V4.1 Flash 已经全面开放。
2. OpenAI SDK 调用示例
安装 SDK:
bash
pip install -U openai
设置密钥:
bash
export DEEPSEEK_API_KEY="你的密钥"
调用代码:
python
import os
from openai import OpenAI
MODEL = "deepseek-v4.1-flash-expires-on-0910"
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model=MODEL,
messages=[
{
"role": "system",
"content": "你是一个谨慎的代码审查助手。先指出问题,再给出最小修改建议。",
},
{
"role": "user",
"content": "请检查这个函数的边界条件,并给出三个测试用例。",
},
],
stream=False,
)
print(response.choices[0].message.content)
print(response.usage)
如果当前账号没有内测权限,常见表现可能是模型不存在、权限不足或请求被拒绝。应用侧应保留回退模型,不要只判断 HTTP 200:还要记录模型名、结束原因、usage 和错误信息。
3. 多模态请求格式
V4.1 Flash 的内测信息提到原生多模态,但公开文档暂未完整列出该临时 ID 的图片参数。对于 OpenAI 兼容的 chat/completions 请求,图片内容应优先按 image_url 结构组织:
python
import base64
import os
from openai import OpenAI
with open("screen.png", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("ascii")
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4.1-flash-expires-on-0910",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "识别截图中的报错,并按原因、影响、建议输出。"},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_b64}",
"detail": "low",
},
},
],
}
],
)
print(response.choices[0].message.content)
不要将 Anthropic 兼容接口里的下面这种结构直接复制过来:
json
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/png",
"data": "<BASE64>"
}
}
不同入口的消息块类型不是完全相同的。OpenAI 兼容端点使用错误结构时,请求会在模型推理前返回 400。
4. 价格口径
DeepSeek 官方价格页目前没有单独的 deepseek-v4.1-flash-expires-on-0910 价格行。内测通知称它沿用 V4 Flash 计费,因此只能把下面数据作为参考基准,而不是 V4.1 Flash 已确认的独立价目:
deepseek-v4-flash 计费项 |
非高峰 | 高峰 |
|---|---|---|
| 输入,缓存命中 / 1M tokens | $0.007 | $0.014 |
| 输入,缓存未命中 / 1M tokens | $0.22 | $0.44 |
| 输出 / 1M tokens | $0.66 | $1.32 |
官方价格页的高峰时间为周一至周五 UTC 01:00-04:00 和 06:00-10:00,其余时间是非高峰。价格可能调整,实际扣费以平台账单为准。
如果用它跑代码 Agent,建议至少记录:
- 输入缓存是否命中;
- 输出 Token 数;
- 请求失败和重试次数;
- 每个任务的人工接管次数;
- 临时模型到期后的回退结果。
5. 配置回退
不要在源码里散落临时模型名,可以集中到环境变量:
bash
export DEEPSEEK_MODEL="deepseek-v4.1-flash-expires-on-0910"
代码里增加显式回退:
python
import os
from openai import OpenAI
model = os.getenv("DEEPSEEK_MODEL", "deepseek-v4-flash")
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
try:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "检查这个函数的错误。"}],
)
except Exception:
if model == "deepseek-v4.1-flash-expires-on-0910":
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "检查这个函数的错误。"}],
)
else:
raise
生产环境还应对回退原因做日志记录,避免把权限错误、限流、网络故障和模型到期混成一个异常。
6. 结论
V4.1 Flash 当前适合做小范围验证:新模型结构、多模态输入、速度和成本是否真的适合你的任务,都需要在统一提示、相同代码和相同验收标准下比较。
当前不适合直接迁移生产的原因也很明确:临时模型 ID 带有到期日期,官方公开模型列表尚未同步,公开 benchmark 和独立价格表也尚未完整出现。
因此,建议将它当作可回滚的预览端点使用,而不是把它当作已经稳定替换 V4 Flash 或 V4 Pro 的新默认模型。
参考资料:
#DeepSeek #V41Flash #API #OpenAI兼容 #多模态