一、本地环境配置
我这边配置较低,如参考,请以我的配置为最低配置参考
- win10
- Python 3.9
- 硬件配置:4GB 显存、8 核 CPU、16G 内存,512+1024 固态硬盘
二、下载 ComfyUI 桌面版
注:本文推荐此方案,该方案较为简便

2、按照推荐方案新建comfy实例

跳过即可,用我们自己安装部署的本地模型
等待下载完毕

3、进入工作区 安装 GGUF 插件
如果此处出现打不开,一直卡住的情况,请前往英伟达官网搜索本机显卡的最新版驱动下载安装后重启电脑再重试

安装ComfyUI-GGUF 插件
三、下载 Qwen-Image-2.1-GGUF量化版模型
此处博主使用Q3_K_M版本量化模型,显卡比较好的可以选择更好的或者官方原版,生图质量会更好
2、下载文本编码器

注:如果配置和博主一样低,推荐使用qwen3vl_8b_w4a8.safetensors,量化方式:权重 4-bit,激活值 8-bit(压缩过,省显存)。

如果是配置较高,推荐选择这两种文本编辑器,上面是图生图,下面是文生图,这里主要是负责把图片或者文本转换成向量化数据给qwen_image_2.1来画图。
3、下载VAE
VAE:负责把qwen_image_2.1生成的图像还原成人类能看懂的PNG图片
4、将上述下载内容放到Comfy实例对应的文件夹目录内
bash
models/
├── diffusion_models/
│ └── qwen_image_2.1_Q3_K_M.gguf ← 生图模型
├── clip/
│ └── qwen3vl_8b_w4a8.safetensors ← 文本编码器
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors ← VAE文件
5、下载即用型工作流
-
文生图: Qwen_Image_2.1_GGUF_Text2Image.json
文生图工作流参数如下:

1、
cfg(全称:CFG Scale(Classifier Free Guidance,无分类器引导)):提示词权重【1:AI自由发挥;4-7:平衡;8及以上:严格贴合提示词】2、
steps:画多少笔(AI 从噪点"擦"出图片的迭代次数)3、
sampler:用什么笔法画(决定每一步怎么从噪点里抠出图像。不同算法风格不同)4、
scheduler(全称:Scheduler(调度器 / 噪声调度)):每一步擦多少(控制每一步去多少噪点。和 sampler 是搭档。)5、
seed= 随机种子【593103825222985:每次画一样的图;-1 或设为 random:每次随机】6、
unet_name:主模型(画图的画师)7、
clip_name:文本编码器(翻译官)8、
vae_name:解码器(打印机)9、
width / height:分辨率10、
positive_prompt:正向提示词(告诉AI你想要什么)11、
negative_prompt:反向提示词(告诉AI你不想要什么)
四、下载 通义万相2.2-图文生视频模型
配置有限,未完待续......
五、加载工作流 处理生图
拖拽下载好的json工作流直接到comfy,编辑即可;
参考:https://www.modelscope.cn/models/Abiray/Qwen-Image-2.1-GGUF


六、加载工作流 处理生视频
配置有限,未完待续......