这是一份史上最全的 ComfyUI models 目录详解。31个文件夹,逐个拆解:英文全称、中文含义、命名由来、核心作用、存放什么模型、常见模型举例。让你从零基础到彻底搞懂每个文件夹的用途。
📖 为什么需要了解这些文件夹?
ComfyUI 采用模块化设计 ,不同类型的 AI 模型各司其职。这种目录结构并非随意设定,而是 ComfyUI 核心代码通过 folder_paths.py 文件严格定义的标准路径。只有把模型文件放到正确的位置,ComfyUI 才能在加载节点时自动识别它们。
一句话:放对位置,才能正常工作。放错位置,节点里根本看不到你的模型。
🗺️ 完整目录全景图(31个文件夹)
ComfyUI/models/
├── 1. audio_encoders/ # 音频编码器(视频生成专用)
├── 2. background_removal/ # 背景移除模型
├── 3. checkpoints/ # ⭐ 基础大模型(最常用)
├── 4. clip/ # CLIP 文本编码器
├── 5. clip_vision/ # CLIP 图像编码器
├── 6. configs/ # 配置文件
├── 7. controlnet/ # ControlNet 控制模型
├── 8. detection/ # 目标检测模型
├── 9. diffusers/ # Diffusers 格式模型
├── 10. diffusion_models/ # 新一代扩散模型(FLUX/WAN等)
├── 11. embeddings/ # Textual Inversion 嵌入
├── 12. frame_interpolation/ # 帧插值(视频补帧)
├── 13. geometry_estimation/ # 几何估计(深度/法线)
├── 14. gligen/ # GLIGEN 布局控制
├── 15. hypernetworks/ # 超网络微调
├── 16. latent_upscale_models/ # 潜空间放大模型
├── 17. LLM/ # 大语言模型
├── 18. loras/ # ⭐ LoRA 微调模型
├── 19. model_patches/ # 模型补丁
├── 20. onnx/ # ONNX 格式模型
├── 21. optical_flow/ # 光流估计
├── 22. photomaker/ # PhotoMaker 人像定制
├── 23. sams/ # SAM 图像分割
├── 24. style_models/ # 风格迁移模型
├── 25. text_encoders/ # 大语言文本编码器(T5/Gemma等)
├── 26. ultralytics/ # YOLO 检测模型
├── 27. unet/ # UNet 模型(旧版目录)
├── 28. upscale_models/ # 超分辨率放大
├── 29. vae/ # ⭐ VAE 图像编解码器
├── 30. vae_approx/ # VAE 近似(轻量版)
└── 31. yolo/ # YOLO 专用目录
第一部分:核心生成模型(最常用)
1. checkpoints/ ------ 基础大模型
英文全称:Checkpoint(检查点)
中文含义 :AI 模型在训练过程中保存的"快照",包含完整的神经网络参数。简单说,它就是生成图像的"大脑",决定了图像的基础画风、质量和内容范围。
为什么这么命名? 在深度学习中,"checkpoint"指训练到某个阶段时保存的模型状态,方便后续恢复训练或直接使用。
作用 :所有图像生成的起点 。没有它,其他模型都无法工作。这是你最常访问的文件夹。
常见模型举例:
| 模型名称 | 特点 | 适用场景 |
|---|---|---|
sd_xl_base_1.0.safetensors |
SDXL 基础模型,画质细腻 | 写实、艺术创作 |
v1-5-pruned-emaonly.safetensors |
SD 1.5 经典模型,生态丰富 | 动漫、二次元 |
Illustrious-XL-v0.1.safetensors |
高表现力 XL 模型 | 高质量插画 |
RealisticVision_xxx.safetensors |
写实风格 | 人像摄影 |
DreamShaper_xx.safetensors |
梦幻风格 | 插画、概念艺术 |
💡 建议 :优先使用
.safetensors格式,它比.ckpt更安全、加载更快。
2. loras/ ------ LoRA 微调模型
英文全称:Low-Rank Adaptation(低秩适配)
中文含义 :LoRA 是一种轻量级微调技术,通过额外的小文件(通常几十到几百MB)在不修改主模型的前提下,注入特定风格、角色或特征。
为什么这么命名? "LoRA"这个名称来源于其核心数学原理------对权重矩阵进行低秩分解(Low-Rank Decomposition),从而大幅减少需要训练的参数数量(仅为原始模型的 0.1%~1%)。
作用 :作为 Checkpoint 的"插件",用于调整特定特征。可以同时叠加多个 LoRA,实现风格、角色、服装等多个维度的组合控制。
常见模型举例:
- 角色 LoRA:
chara_xxx.safetensors(固定特定动漫角色) - 风格 LoRA:
watercolor_style.safetensors(水彩风格) - 服装 LoRA:
suit_armor.safetensors(盔甲服装) - 细节增强:
detail_enhancer.safetensors(增强纹理细节)
💡 建议 :LoRA 可以叠加使用,权重通常设置在 0.2~0.8 之间。按功能建立子目录分类,如
loras/character/、loras/style/、loras/clothing/。
3. vae/ ------ VAE 图像编解码器
英文全称:Variational Autoencoder(变分自编码器)
中文含义 :VAE 由两部分组成------编码器(Encoder)将像素图像压缩成 AI 内部的"潜空间(latent space)"数据;解码器(Decoder)负责将潜空间数据解码成我们能看到的像素图像。在图像生成中,我们最常用的是解码器部分。
为什么这么命名? "变分"指其数学优化方式(变分推断),"自编码器"指其编码-解码的对称结构。
作用 :直接影响生成图像的清晰度、色彩和细节表现。换一个更好的 VAE,图像质量会有肉眼可见的提升。好的 VAE 能消除图像中的"色块感",让色彩过渡更自然。
常见模型举例:
| 模型名称 | 说明 |
|---|---|
vae-ft-mse-840000-ema-pruned.safetensors |
最常用的高质量 VAE,SD1.5/SDXL 通用 |
flux-ae.safetensors |
Flux 模型专用 |
sdxl_vae.safetensors |
SDXL 优化版 |
sdxl_vae_fp16.safetensors |
SDXL 半精度版,省显存 |
💡 建议 :有些 Checkpoint 已经内置了 VAE,但如果单独加载 VAE 节点,会覆盖内置版本,通常能获得更好的效果。
4. diffusion_models/ ------ 新一代扩散模型
英文全称:Diffusion Models(扩散模型)
中文含义 :这是 ComfyUI 中较新的官方目录,用于存放骨干扩散模型,特别是那些按"模型家族"组织的模型(如 FLUX、WAN、QWEN、HiDream、LTX 等)。
为什么这样命名和组织? 随着模型生态日益丰富,FLUX、WAN 等新一代模型如果全放进 checkpoints/ 会非常杂乱。按模型家族分类存放,管理更清晰,也便于维护。
作用 :和 checkpoints/ 功能类似(都是基础生成模型),但更强调按模型家族分类。如果你使用的是 FLUX、WAN 等新模型,应该来这里找对应的子目录。
常见模型举例:
| 子目录 | 包含模型 |
|---|---|
FLUX/ |
flux1-dev.safetensors、flux1-schnell.safetensors |
WAN/ |
WAN 视频生成模型系列 |
QWEN/ |
Qwen 系列模型 |
LTX-2/、LTXV/ |
LTX 视频生成模型 |
HiDream/ |
HiDream 图像生成模型 |
MiniMax/ |
MiniMax H3 系列 |
💡 建议:优先查看这个目录是否已有你需要的模型家族分类,按分类放入对应的子目录。
5. unet/ ------ UNet 模型
英文全称:U-Net(U 形网络)
中文含义 :UNet 是一种经典的卷积神经网络架构,因其网络结构呈"U"形而得名(先下采样编码,再上采样解码,中间有跳跃连接)。
为什么这样命名? UNet 最早用于医学图像分割,因其 U 形架构图而得名。在 Stable Diffusion 中,UNet 是扩散模型的核心组件,负责"去噪"过程------从随机噪声逐步生成图像。
作用 :在早期版本中,unet/ 用于存放单独的 UNet 模型文件。现在已逐步被 checkpoints/ 和 diffusion_models/ 取代,但仍被一些旧版插件或自定义节点使用。
常见模型举例:
- 一些旧版 SD1.5 的 UNet 分离文件
- 自定义训练的分割模型
💡 注意 :新用户建议优先使用
checkpoints/或diffusion_models/,除非你明确知道自己在做什么。
6. configs/ ------ 配置文件
英文全称:Configurations(配置文件)
中文含义 :存放 YAML、JSON 等格式的模型配置文件,定义模型架构参数(如层数、通道数、注意力头数等)。
为什么这样命名? 简单的英文直译,表示"配置"文件。
作用:当模型文件本身不包含架构信息时,需要配套的配置文件来告诉 ComfyUI "这个模型长什么样"。
常见模型举例:
| 文件名 | 对应模型 |
|---|---|
v1-inference.yaml |
SD1.5 配置 |
v1-inference-vae.yaml |
SD1.5+VAE 配置 |
sd_xl_base.yaml |
SDXL 配置 |
💡 建议 :一般情况下不需要手动修改,但如果你下载了单独的模型权重文件(非 safetensors 完整包),可能需要配合
.yaml文件使用。
第二部分:文本与图像编码器
7. clip/ ------ CLIP 文本编码器
英文全称:Contrastive Language-Image Pre-training(对比语言-图像预训练)
中文含义 :CLIP 模型由 OpenAI 开发,包含文本编码器 和图像编码器 两个分支。这里的 clip/ 存放的是文本编码器 ,负责将你的文字提示词(Prompt)转换成 AI 能理解的向量表示。
为什么这样命名? "CLIP"既是缩写,也形象地描述了其核心思想------通过对比学习将文本和图像"拉近"到同一个向量空间进行匹配。
作用:你的正向/负向提示词就是通过 CLIP 文本编码器处理后,才能传递给生成模型。CLIP 的质量直接影响模型对文字的理解能力。
常见模型举例:
| 文件名 | 说明 |
|---|---|
clip_l.safetensors |
SD1.5 标配 |
clip_g.safetensors |
SDXL 使用的更大版本(有更多参数) |
longclip-L.safetensors |
支持更长文本输入(最多 248 个 token) |
💡 ⚠️ 重要区分 :
clip/和text_encoders/是两个不同的目录!clip/仅存放 CLIP 系列的文本编码器 ,而text_encoders/用于存放 T5、QWEN、GEMMA、LLAMA 等大语言模型编码器。
8. clip_vision/ ------ CLIP 图像编码器
英文全称:CLIP Vision(CLIP 的视觉分支)
中文含义 :和 CLIP 文本编码器对应,CLIP Vision 是 CLIP 模型的图像编码分支 ,负责将图像转换成向量表示。
为什么这样命名? 它是 CLIP 模型的一部分,专门处理视觉(Vision)输入,因此叫 clip_vision。
作用 :用于图生图(img2img)、IP-Adapter(图像风格迁移)、Redux(图像重绘)、ControlNet 的图像引导等需要理解图像内容的场景。简单说,当你想让 AI "看懂"一张图时,就需要用到它。
常见模型举例:
| 文件名 | 说明 |
|---|---|
clip_vision_h.safetensors |
标准版本,最常用 |
sigclip_vision.safetensors |
更强大的变体(SigLIP) |
ViT-H-14-378-quickgelu.safetensors |
ViT 架构的大尺寸版本 |
9. text_encoders/ ------ 大语言模型编码器
英文全称:Text Encoders(文本编码器)
中文含义 :存放用于理解文本的大语言模型(LLM) 编码器。这些模型通常比 CLIP 更强大,能处理更复杂的语义、更长上下文和更细致的描述。
作用:新一代模型(如 Flux、MiniMax H3、LTX 视频模型)常常使用 T5、Gemma、Qwen 等强大的文本编码器来解析提示词,比传统 CLIP 理解更精准、更深入。
常见模型举例:
| 文件名 | 对应模型 | 用途 |
|---|---|---|
t5xxl_fp16.safetensors |
T5-XXL | Flux 系列常用 |
gemma-3-12b-it |
Gemma 3 | LTX 2.3 视频模型使用 |
qwen3vl_32b_minimax_h3.safetensors |
Qwen3VL | MiniMax H3 视频模型专用 |
t5-v1_1-xxl-encoder |
T5 v1.1 | 兼容多种模型 |
💡 ⚠️ 重要 :不要把 T5、Gemma 等模型放到
clip/目录,否则 ComfyUI 无法正确加载。它们走的是不同的代码路径!
第三部分:控制与引导模型
10. controlnet/ ------ ControlNet 精准控制
英文全称:ControlNet(控制网络)
中文含义 :ControlNet 是一种辅助控制模型,通过输入额外的引导信息(如线稿、深度图、姿态骨架、边缘图等)来精确控制生成图像的构图、姿态和布局。
为什么这样命名? 直译"控制网络",一语中的------它就是用来"控制"图像生成过程的额外网络。
作用 :让 AI 生成符合你指定姿态、构图的图像。比如,你可以先画一个简单的人体骨架(OpenPose),ControlNet 会强制生成的人物符合这个姿态。
常见模型举例:
| 文件名 | 控制类型 | 用途 |
|---|---|---|
control_v11p_sd15_canny.safetensors |
Canny 边缘检测 | 保持线稿轮廓 |
control_v11p_sd15_openpose.safetensors |
OpenPose 姿态 | 人体姿态控制 |
control_v11p_sd15_depth.safetensors |
深度图 | 三维构图控制 |
control_v11p_sd15_seg.safetensors |
语义分割 | 区域颜色控制 |
xinsir-controlnet-union-sdxl.safetensors |
多合一 | 一个模型支持多种控制类型 |
sai_xl_depth_256lora.safetensors |
SDXL 深度控制 | SDXL 场景深度控制 |
11. gligen/ ------ GLIGEN 布局控制
英文全称:Grounded Language-Image Generation(基于语言的图像生成)
中文含义 :GLIGEN 是一种通过文字描述指定物体位置的控制模型。你可以说"在图片左侧有一只猫,右侧有一只狗",GLIGEN 就会精确控制物体出现在指定区域。
为什么这样命名? 缩写,完整名称描述了其核心思想:将语言"落地"到图像的具体空间位置。
作用 :比 ControlNet 更直观------直接用坐标和文字控制物体位置。适合需要精确布局的场景(如海报设计、产品展示)。
常见模型举例:
gligen_sd15.safetensors:SD1.5 的 GLIGEN 模型- 相关配置文件(
.yaml)
💡 使用方式 :GLIGEN 需要配合 GLIGEN 节点,输入类似
(0.2, 0.3, 0.6, 0.8)的坐标框和对应的物体描述文字。
12. photomaker/ ------ PhotoMaker 人像定制
英文全称:PhotoMaker(照片制作者)
中文含义 :PhotoMaker 是一种人像生成技术,输入几张不同角度的人脸照片,就能在生成图像中保持该人物的身份特征。
为什么这样命名? 直译"照片制作者"------用照片生成新的人物形象。
作用 :实现人像一致性生成,输入 3~5 张人脸照片,输出同一人物的不同场景/姿态图像。
常见模型举例:
photomaker-v1.safetensorsphotomaker_style.safetensors
第四部分:目标检测、分割与几何估计
13. ultralytics/ ------ Ultralytics 检测模型
英文全称:Ultralytics(公司名)
中文含义 :Ultralytics 是开发 YOLO(You Only Look Once)目标检测系列的公司。这个目录存放 Ultralytics 格式的目标检测模型文件。
为什么这样命名? 直接以开发公司名称命名,因为 Ultralytics 生态庞大,YOLO 系列在目标检测领域地位举足轻重。
作用:用于检测图像中的人脸、手势、人体姿态、物体等位置和类别。
常见模型举例:
| 文件名 | 检测类型 |
|---|---|
yolov8n-face.pt |
人脸检测 |
yolov8n-pose.pt |
人体姿态关键点检测 |
yolov8x.pt |
通用目标检测(80 类别) |
yolov8m-seg.pt |
目标分割(带掩膜) |
yolov9c.pt |
YOLOv9 通用检测 |
14. yolo/ ------ YOLO 专用目录
英文全称:You Only Look Once(你只看一次)
中文含义 :YOLO 是一种经典的目标检测算法 ,特点是速度快------只需"看一眼"就能同时检测出图像中所有目标的位置和类别。
为什么这样命名? 这个名字有两层含义:一是算法本身采用单阶段检测(一次性完成所有目标的识别和定位,区别于两阶段方法);二是一种自豪的命名------"我只看一眼就能认出一切"。
作用 :yolo/ 是用于存放 YOLO 模型的另一个目录 。在部分 ComfyUI 版本或插件中,会直接读取这里而非 ultralytics/。两者功能重叠,需要看具体插件读取哪个目录。
常见模型举例:
yolov8n-face.ptyolov8n-pose.ptyolov8x.pt
💡 注意 :
ultralytics/和yolo/功能重叠,具体使用哪个取决于插件。建议两边都保留一份常用的 YOLO 模型,确保兼容。
15. detection/ ------ 检测模型通用目录
英文全称:Detection(检测)
中文含义 :存放各类目标检测模型的通用目录,不限于 YOLO。
作用:作为检测模型的补充存放位置,容纳各种检测相关的模型文件。
常见模型举例:
- 其他开源检测模型(如 DETR、FCOS 等)
- 专用检测器(如手部检测、人脸检测)
16. sams/ ------ SAM 图像分割
英文全称:Segment Anything Model(分割万物模型)
中文含义 :Meta(Facebook)推出的图像分割模型,可以精确分割图像中的任何对象,无需额外训练。用户可以通过点击/框选指定要分割的区域。
为什么这样命名? 直接沿用 Meta 的官方名称 "Segment Anything"(分割万物),体现了其强大的通用分割能力。
作用 :用于精准抠图、物体分离、背景移除等任务。是 ComfyUI 中图像编辑工作流的利器。
常见模型举例:
| 文件名 | 说明 |
|---|---|
sam_vit_h_4b8939.pth |
SAM 基础版(ViT-H,最大版本) |
sam_vit_l_0b3195.pth |
SAM 大版本(ViT-L) |
sam_vit_b_01ec64.pth |
SAM 小版本(ViT-B,最快) |
sam2_hiera_large.pt |
SAM2 最新版本 |
mobile_sam.pt |
移动端轻量版 SAM |
17. background_removal/ ------ 背景移除
英文全称:Background Removal(背景移除)
中文含义 :专门存放用于移除图像背景的模型。
作用:一键抠图,去除背景,保留前景主体。
常见模型举例:
u2net.pth:最常用的背景移除模型u2netp.pth:轻量版birefnet系列
💡 建议 :常用模型
u2net.pth也可以放在这里,配合 RMBG、BRIA 等插件使用。
18. geometry_estimation/ ------ 几何估计
英文全称:Geometry Estimation(几何估计)
中文含义 :存放用于估计图像几何信息的模型,如深度图(Depth Map)、法线图(Normal Map)等。
作用:从 2D 图像中提取 3D 几何信息,用于 ControlNet 的 depth、normal 控制,或用于 3D 重建。
常见模型举例:
| 文件名 | 估计类型 |
|---|---|
depth_anything_v2_vits.pth |
深度估计 |
MiDaS 系列 |
多版本深度估计 |
normal_estimation 模型 |
法线估计 |
第五部分:视频与序列处理
19. frame_interpolation/ ------ 帧插值
英文全称:Frame Interpolation(帧插值)
中文含义 :用于在视频的两帧之间生成中间过渡帧,提升视频流畅度(如从 15fps 提升到 60fps)。
作用 :视频生成后的后处理,让生成的视频看起来更流畅、更自然。
常见模型举例:
| 文件名 | 说明 |
|---|---|
film_net_fp16.pt |
FILM 模型,Google 出品 |
rife-v4.safetensors |
RIFE 模型,高质量补帧 |
gma-sintel.safetensors |
GMA 光流模型 |
20. optical_flow/ ------ 光流估计
英文全称:Optical Flow(光流)
中文含义 :光流是计算机视觉中的一个重要概念,指图像中像素的运动轨迹和速度场。通过分析连续两帧图像,计算每个像素点的运动方向和速度。
作用:用于视频生成、运动分析和帧插值等任务。光流信息可以帮助模型理解视频中的"运动规律"。
常见模型举例:
| 文件名 | 说明 |
|---|---|
raft-things.pth |
RAFT 光流模型 |
gmflow 系列 |
GMFlow 光流模型 |
gma-sintel.pth |
GMA 光流模型 |
21. audio_encoders/ ------ 音频编码器
英文全称:Audio Encoders(音频编码器)
中文含义 :专门用于将音频信号转换为向量表示的编码器,使得 AI 模型能够"理解"音频内容。
作用 :用于视频生成模型中需要根据音频生成画面的场景(如 MiniMax H3、WAN 等视频模型可根据音频生成对口型视频)。
常见模型举例:
| 文件名 | 对应模型 |
|---|---|
minimax_h3_audio_vae_fp32.safetensors |
MiniMax H3 专用音频 VAE |
wav2vec 系列 |
通用音频特征提取 |
第六部分:图像增强与风格
22. upscale_models/ ------ 超分辨率放大
英文全称:Upscale Models(超分辨率模型)
中文含义 :用于将低分辨率图像放大到更高分辨率,同时尽可能保持清晰度和细节。
作用:提升图像分辨率,用于最终输出高清大图或修复模糊图像。
常见模型举例:
| 文件名 | 说明 |
|---|---|
RealESRGAN_x4plus.pth |
通用超分,效果优秀(4倍放大) |
RealESRGAN_x4plus_anime.pth |
动漫专用超分 |
4x-UltraSharp.pth |
清晰度极高 |
Real_HAT_GAN_sharper.pth |
更锐利的超分 |
ESRGAN_4x 系列 |
经典 ESRGAN 系列 |
💡 建议 :如果有多个放大倍数需求,可以用子目录分类,如
upscale_models/2x/、upscale_models/4x/。
23. latent_upscale_models/ ------ 潜空间放大
英文全称:Latent Upscale Models(潜空间放大模型)
中文含义:在 AI 的**潜空间(latent space)**内直接对图像进行放大,而不是在像素空间。这种方式速度更快,但对放大质量有一定要求。
作用 :用于图像生成的放大阶段,在图像完全"解码"之前就进行放大,效率更高。
常见模型举例:
| 文件名 | 说明 |
|---|---|
x4-upsampler-ema.safetensors |
SD 潜空间放大模型 |
💡 区分 :
latent_upscale_models/是在潜空间放大(更快,配合采样流程),upscale_models/是在像素空间放大(更精细,作为后处理)。两者定位不同。
24. style_models/ ------ 风格迁移模型
英文全称:Style Models(风格模型)
中文含义 :存放用于风格迁移的模型,可以将一种图像的风格"迁移"到另一张图像上。
作用:实现图像风格转换,比如将写实照片转换成梵高画风。
常见模型举例:
- 各种风格迁移模型(如 AdaIN、Fast Style Transfer 等)
- ComfyUI 部分风格插件的专用模型
第七部分:微调与嵌入
25. embeddings/ ------ Textual Inversion 嵌入
英文全称:Embeddings(嵌入)
中文含义 :存放 Textual Inversion(文本反转) 的嵌入文件。这是一种通过 3~5 张图片"教会"模型特定概念或物体的技术,生成的文件通常只有几十 KB。
作用 :让模型"认识"某个特定物体、角色或概念。使用时在提示词中输入对应的触发词即可调用。
常见模型举例:
| 文件名 | 对应触发词 | 用途 |
|---|---|---|
my-cat.pt |
my-cat |
让模型认识"我的猫" |
sks-style.pt |
sks-style |
自定义风格 |
avatar.pt |
avatar |
固定角色特征 |
💡 注意 :Textual Inversion(
.pt)和 LoRA(.safetensors)是不同的技术,虽然都是微调方式,但文件大小和原理不同。
26. hypernetworks/ ------ 超网络
英文全称:Hypernetworks(超网络)
中文含义 :Hypernetwork 是另一种微调技术,通过一个较小的"超网络"来修改主模型的行为。在 Stable Diffusion 早期版本中较流行,目前已逐渐被 LoRA 取代。
作用:调整生成图像的风格、构图或特定特征。和 LoRA 功能类似,但实现方式不同。
常见模型举例:
- 各种风格 Hypernetwork(
.pt文件)
💡 建议:如果你有 LoRA 可用,优先用 LoRA。Hypernetwork 的支持已不如 LoRA 广泛。
27. model_patches/ ------ 模型补丁
英文全称:Model Patches(模型补丁)
中文含义 :存放用于修补或扩展模型功能的补丁文件,通常用于修复模型的特定问题或添加新功能。
作用:灵活扩展模型功能,无需重新训练完整模型。
常见模型举例:
- 特定模型的补丁文件
- 功能扩展插件生成的补丁
第八部分:大语言模型
28. LLM/ ------ 大语言模型
英文全称:Large Language Model(大语言模型)
中文含义 :存放完整的大语言模型 。注意这里是包含完整权重和架构的 LLM,而非仅仅是编码器(与 text_encoders/ 区分)。
作用:用于高级提示词理解、图像描述生成(如 BLIP)、自动提示词优化等需要完整自然语言理解/生成能力的任务。
常见模型举例:
| 模型 | 用途 |
|---|---|
Florence-2 |
图像描述生成、物体检测 |
Qwen 系列 |
中文/多语言理解 |
LLaMA 系列 |
通用语言模型 |
第九部分:格式与平台相关
29. diffusers/ ------ Diffusers 格式模型
英文全称:Diffusers(扩散器)
中文含义 :Hugging Face 的 diffusers 库定义了一种标准的模型组织格式 ,以完整文件夹(包含多个子文件)而非单个文件的形式存放模型。
为什么这样命名? 直接采用 Hugging Face diffusers 库的名称。该库已成为扩散模型社区的事实标准。
作用:以 Hugging Face 标准格式加载模型,支持从 Hugging Face Hub 直接下载和使用。
常见模型举例:
runwayml/stable-diffusion-v1-5的 diffusers 版stabilityai/stable-diffusion-xl-base-1.0的 diffusers 版
💡 区别 :
checkpoints/放.safetensors或.ckpt单文件,diffusers/放多个文件的文件夹。
30. onnx/ ------ ONNX 格式模型
英文全称:Open Neural Network Exchange(开放神经网络交换格式)
中文含义 :ONNX 是一种开放的模型格式标准,可以在不同的深度学习框架(PyTorch、TensorFlow 等)之间进行模型转换和部署。
为什么这样命名? 直接使用该格式标准的官方名称。
作用 :存放 ONNX 格式的模型,通常用于推理加速(配合 TensorRT、OpenVINO 等)或在资源受限的设备上部署。
常见模型举例:
- 转换后的 ControlNet ONNX 版本
- 轻量化推理模型
💡 注意:ONNX 模型的加载路径在部分 ComfyUI 变体中可能是**硬编码(hardcoded)**的,不要随意移动此目录。
31. vae_approx/ ------ VAE 近似(轻量版)
英文全称:VAE Approximate(VAE 近似)
中文含义 :存放 VAE 的近似模型,通常是用更小、更快的网络来"近似"完整 VAE 的功能。
作用 :在低显存设备上,作为完整 VAE 的轻量替代方案。牺牲少量质量换取更快的速度和更低的内存占用。
常见模型举例:
taesd_encoder.safetensors/taesd_decoder.safetensors:Tiny AutoEncoder(极度轻量)taesdxl_encoder.safetensors/taesdxl_decoder.safetensors:SDXL 版的 tiny VAE
💡 建议 :如果你的显存充足(8GB+),直接使用
vae/中的完整模型。显存紧张的设备(4GB 以下),vae_approx/是不错的备选。
✅ 完整速查表(31个目录总览)
| # | 目录名 | 核心作用 | 关键提醒 |
|---|---|---|---|
| 1 | audio_encoders/ |
音频→向量 | 视频生成(MiniMax)专用 |
| 2 | background_removal/ |
背景移除 | 抠图用 |
| 3 | checkpoints/ |
⭐ 基础大模型 | 最常用,放 SD/XL 等 |
| 4 | clip/ |
CLIP 文本→向量 | 别和 text_encoders 搞混 |
| 5 | clip_vision/ |
CLIP 图像→向量 | IP-Adapter 等需要 |
| 6 | configs/ |
模型配置文件 | 配合 .ckpt 使用 |
| 7 | controlnet/ |
精准姿态/构图控制 | 配线稿/深度图等 |
| 8 | detection/ |
目标检测 | 检测物体/人脸 |
| 9 | diffusers/ |
Diffusers 格式 | Hugging Face 标准 |
| 10 | diffusion_models/ |
新一代扩散模型 | FLUX/WAN 等放这里 |
| 11 | embeddings/ |
Textual Inversion | 几十 KB 的 .pt 文件 |
| 12 | frame_interpolation/ |
视频补帧 | 提升视频流畅度 |
| 13 | geometry_estimation/ |
深度/法线估计 | ControlNet 深度控制用 |
| 14 | gligen/ |
坐标布局控制 | 精确控制物体位置 |
| 15 | hypernetworks/ |
超网络微调 | 已逐渐被 LoRA 取代 |
| 16 | latent_upscale_models/ |
潜空间放大 | 采样流程内放大 |
| 17 | LLM/ |
大语言模型 | 完整 LLM(不只是编码器) |
| 18 | loras/ |
⭐ LoRA 微调 | 最常用!放风格/角色 LoRA |
| 19 | model_patches/ |
模型补丁 | 扩展功能用 |
| 20 | onnx/ |
ONNX 格式 | 推理加速/跨框架 |
| 21 | optical_flow/ |
光流估计 | 视频运动分析 |
| 22 | photomaker/ |
人像定制 | 保持人物身份一致 |
| 23 | sams/ |
SAM 图像分割 | 精准抠图神器 |
| 24 | style_models/ |
风格迁移 | 图像风格转换 |
| 25 | text_encoders/ |
LLM 文本编码器 | T5/Gemma/Qwen 放这里 |
| 26 | ultralytics/ |
YOLO 检测 | Ultralytics 官方格式 |
| 27 | unet/ |
UNet 模型 | 旧版目录,部分插件仍用 |
| 28 | upscale_models/ |
超分辨率放大 | 最终高清输出 |
| 29 | vae/ |
⭐ VAE 编解码器 | 影响画质关键 |
| 30 | vae_approx/ |
VAE 轻量近似 | 低显存用 |
| 31 | yolo/ |
YOLO 专用 | 部分插件读取此目录 |
📌 最后的小贴士
- 文件格式 :优先使用
.safetensors格式,比.ckpt和.pt更安全、加载更快。 - 子目录分类 :在
loras/、checkpoints/等目录中建立子目录进行分类管理。 - 命名规范:避免中文字符、空格及特殊符号,防止编码错误。
- 硬编码警告 :
onnx/、tensorrt/等目录路径是硬编码的,不要随意移动。 - 双目录注意 :
ultralytics/和yolo/功能重叠,具体看插件读取哪个;clip/和text_encoders/也完全不同。
掌握了这 31 个文件夹的用途,你就能在 ComfyUI 的模型海洋中游刃有余了!🎉