黑森林研究所提出KV缓存方式让生图模型能更好地多参考编辑


FLUX.2 [klein] 9B-KV 是 FLUX.2 klein 9B 的优化版本,具备KV缓存加速多参考图编辑功能。该变体在首次去噪步骤中缓存参考图的键值对,消除后续步骤的冗余计算,显著加速多图编辑流程。

了解更多 FLUX.2 klein 信息,请阅读我们的博客文章

核心特性

  1. KV缓存优化:参考图键值对仅计算一次并缓存,多参考图编辑任务可减少计算量,推理速度提升高达2.5倍
  2. 完整保留 FLUX.2 klein 9B 所有能力:亚秒级生成、文生图、多参考图编辑的统一模型
  3. 特别适合需要重复使用相同参考图的交互式应用和实时编辑场景
  4. 90亿参数流模型,搭配80亿参数Qwen3文本编码器,通过步数蒸馏实现4步推理
  5. 仅供非商业用途使用

KV缓存原理

标准图像编辑流程会在每个去噪步骤重复处理参考图token。采用KV缓存后:

  • 步骤0:完整前向传播处理参考图token,提取键值对存入缓存
  • 步骤1-3:复用缓存键值对,跳过冗余的参考图token计算

该技术特别适用于:

  • 多参考图编辑场景
  • 使用相同参考图生成变体
  • 开发交互式编辑应用

使用方式

我们在GitHub仓库提供了参考实现。

API接口

可通过 BFL API 使用 FLUX.2 klein 9B-KV,访问 bfl.ai

搭配Diffusers 🧨使用

如需通过 🧨 Diffusers python库使用 FLUX.2 klein 9B-KV,请先安装或升级diffusers:

shell 复制代码
pip install git+https://github.com/huggingface/diffusers.git

然后你可以使用Flux2KleinKVPipeline来运行模型:

python 复制代码
import torch
from diffusers import Flux2KleinKVPipeline

device = "cuda"
dtype = torch.bfloat16
model_path = "black-forest-labs/FLUX.2-klein-9b-kv"

pipe = Flux2KleinKVPipeline.from_pretrained(model_path, torch_dtype=dtype)
pipe.to(device)

# Text-to-image (no reference image)
print("Generating text-to-image...")
image = pipe(
    prompt="A cat holding a sign that says hello world",
    height=1024,
    width=1024,
    num_inference_steps=4,
    generator=torch.Generator(device=device).manual_seed(0),
).images[0]
image.save("t2i_output.png")
print("Saved t2i_output.png")

# Image-to-image with KV cache (using the generated image as reference)
print("Generating image-to-image with KV cache...")
image_kv = pipe(
    prompt="A cat dressed like a wizard",
    image=image,
    height=1024,
    width=1024,
    num_inference_steps=4,
    generator=torch.Generator(device=device).manual_seed(0),
).images[0]
image_kv.save("kv_output.png")
print("Saved kv_output.png")

局限性

  • 本模型不具备亦不意图提供事实性信息
  • 生成的文本内容可能存在不准确或失实表述
  • 作为统计模型可能反映或放大训练数据中的偏见
  • 存在无法按提示要求生成内容的情况
  • 输出结果对提示风格极为敏感

禁止用途

依据使用政策规定,禁止将本模型及其衍生品用于违法、欺诈、诽谤、滥用等违反许可协议的用途。

硬件要求

FLUX.2 klein 9B-KV模型需约29GB显存,需配备NVIDIA RTX 5090及以上显卡。


负责任AI开发

黑森林实验室致力于负责任的模型开发与部署。在发布FLUX.2 klein 9B-KV前,我们已评估并缓解了包括儿童性虐待材料(CSAM)和非自愿亲密影像(NCII)在内的多项风险。完整评估流程、内容溯源功能及政策详见博文:强大、开放与安全:防范AI滥用

安全事项举报请联系:safety@blackforestlabs.ai


许可协议

本模型采用FLUX非商业许可

商标与知识产权

本项目可能包含相关项目的商标或标识。修改版本中使用黑森林实验室及FLUX商标时不得暗示官方授权。第三方商标及知识产权的使用受相关方政策约束。

相关推荐
vibecoding775 小时前
一文搞懂企业级 API 网关选型:12 个维度、4 类企业、7 步落地
人工智能·大模型·ai编程
Rocktech_ruixun5 小时前
机器人本地跑LLM大模型对主板硬件有什么要求?瑞迅科技RK3588/3568方案选型解析
人工智能·科技·嵌入式硬件·机器人·边缘计算
yxlalm5 小时前
Spring AI+RAG 01-项目背景与技术选型
java·人工智能·spring
tedcloud1235 小时前
Wand-Enhancer 怎么搭建?开源 Wand 客户端增强与远程控制工具介绍
大数据·服务器·人工智能·开源·音视频
科技苑6 小时前
如何用Python编程实现一个简单的Web爬虫?
人工智能·python
迅利科技6 小时前
新能源汽车零部件研发,SIMULIA一站式仿真解决方案如何缩短研发周期
人工智能·汽车
嘉琪coder6 小时前
我做了一个 Chrome 扩展,把 YouTube 播放列表批量变成 AI 可读的本地 Markdown
chrome·开源·浏览器
Databuff6 小时前
AI SSH工具,集齐SSH、SFTP、知识库RAG、AI助手
网络·人工智能·ssh
Blockchina7 小时前
从一篇文章到一条完整视频:用 Codex 搭建可复用的 AI 视频生产线
人工智能
Proaiapi7 小时前
一张图介绍gpt-image-2.5
人工智能·gpt