ComfyUI models 目录完整指南(31个文件夹全解析)

这是一份史上最全的 ComfyUI models 目录详解。31个文件夹,逐个拆解:英文全称、中文含义、命名由来、核心作用、存放什么模型、常见模型举例。让你从零基础到彻底搞懂每个文件夹的用途。


📖 为什么需要了解这些文件夹?

ComfyUI 采用模块化设计 ,不同类型的 AI 模型各司其职。这种目录结构并非随意设定,而是 ComfyUI 核心代码通过 folder_paths.py 文件严格定义的标准路径。只有把模型文件放到正确的位置,ComfyUI 才能在加载节点时自动识别它们。

一句话:放对位置,才能正常工作。放错位置,节点里根本看不到你的模型。


🗺️ 完整目录全景图(31个文件夹)

复制代码
ComfyUI/models/
├── 1.  audio_encoders/          # 音频编码器(视频生成专用)
├── 2.  background_removal/      # 背景移除模型
├── 3.  checkpoints/             # ⭐ 基础大模型(最常用)
├── 4.  clip/                    # CLIP 文本编码器
├── 5.  clip_vision/             # CLIP 图像编码器
├── 6.  configs/                 # 配置文件
├── 7.  controlnet/              # ControlNet 控制模型
├── 8.  detection/               # 目标检测模型
├── 9.  diffusers/               # Diffusers 格式模型
├── 10. diffusion_models/        # 新一代扩散模型(FLUX/WAN等)
├── 11. embeddings/              # Textual Inversion 嵌入
├── 12. frame_interpolation/     # 帧插值(视频补帧)
├── 13. geometry_estimation/     # 几何估计(深度/法线)
├── 14. gligen/                  # GLIGEN 布局控制
├── 15. hypernetworks/           # 超网络微调
├── 16. latent_upscale_models/   # 潜空间放大模型
├── 17. LLM/                     # 大语言模型
├── 18. loras/                   # ⭐ LoRA 微调模型
├── 19. model_patches/           # 模型补丁
├── 20. onnx/                    # ONNX 格式模型
├── 21. optical_flow/            # 光流估计
├── 22. photomaker/              # PhotoMaker 人像定制
├── 23. sams/                    # SAM 图像分割
├── 24. style_models/            # 风格迁移模型
├── 25. text_encoders/           # 大语言文本编码器(T5/Gemma等)
├── 26. ultralytics/             # YOLO 检测模型
├── 27. unet/                    # UNet 模型(旧版目录)
├── 28. upscale_models/          # 超分辨率放大
├── 29. vae/                     # ⭐ VAE 图像编解码器
├── 30. vae_approx/              # VAE 近似(轻量版)
└── 31. yolo/                    # YOLO 专用目录

第一部分:核心生成模型(最常用)

1. checkpoints/ ------ 基础大模型

英文全称:Checkpoint(检查点)

中文含义 :AI 模型在训练过程中保存的"快照",包含完整的神经网络参数。简单说,它就是生成图像的"大脑",决定了图像的基础画风、质量和内容范围。

为什么这么命名? 在深度学习中,"checkpoint"指训练到某个阶段时保存的模型状态,方便后续恢复训练或直接使用。

作用 :所有图像生成的起点 。没有它,其他模型都无法工作。这是你最常访问的文件夹。

常见模型举例

模型名称 特点 适用场景
sd_xl_base_1.0.safetensors SDXL 基础模型,画质细腻 写实、艺术创作
v1-5-pruned-emaonly.safetensors SD 1.5 经典模型,生态丰富 动漫、二次元
Illustrious-XL-v0.1.safetensors 高表现力 XL 模型 高质量插画
RealisticVision_xxx.safetensors 写实风格 人像摄影
DreamShaper_xx.safetensors 梦幻风格 插画、概念艺术

💡 建议 :优先使用 .safetensors 格式,它比 .ckpt 更安全、加载更快。


2. loras/ ------ LoRA 微调模型

英文全称:Low-Rank Adaptation(低秩适配)

中文含义 :LoRA 是一种轻量级微调技术,通过额外的小文件(通常几十到几百MB)在不修改主模型的前提下,注入特定风格、角色或特征。

为什么这么命名? "LoRA"这个名称来源于其核心数学原理------对权重矩阵进行低秩分解(Low-Rank Decomposition),从而大幅减少需要训练的参数数量(仅为原始模型的 0.1%~1%)。

作用 :作为 Checkpoint 的"插件",用于调整特定特征。可以同时叠加多个 LoRA,实现风格、角色、服装等多个维度的组合控制。

常见模型举例

  • 角色 LoRA:chara_xxx.safetensors(固定特定动漫角色)
  • 风格 LoRA:watercolor_style.safetensors(水彩风格)
  • 服装 LoRA:suit_armor.safetensors(盔甲服装)
  • 细节增强:detail_enhancer.safetensors(增强纹理细节)

💡 建议 :LoRA 可以叠加使用,权重通常设置在 0.2~0.8 之间。按功能建立子目录分类,如 loras/character/loras/style/loras/clothing/


3. vae/ ------ VAE 图像编解码器

英文全称:Variational Autoencoder(变分自编码器)

中文含义 :VAE 由两部分组成------编码器(Encoder)将像素图像压缩成 AI 内部的"潜空间(latent space)"数据;解码器(Decoder)负责将潜空间数据解码成我们能看到的像素图像。在图像生成中,我们最常用的是解码器部分。

为什么这么命名? "变分"指其数学优化方式(变分推断),"自编码器"指其编码-解码的对称结构。

作用 :直接影响生成图像的清晰度、色彩和细节表现。换一个更好的 VAE,图像质量会有肉眼可见的提升。好的 VAE 能消除图像中的"色块感",让色彩过渡更自然。

常见模型举例

模型名称 说明
vae-ft-mse-840000-ema-pruned.safetensors 最常用的高质量 VAE,SD1.5/SDXL 通用
flux-ae.safetensors Flux 模型专用
sdxl_vae.safetensors SDXL 优化版
sdxl_vae_fp16.safetensors SDXL 半精度版,省显存

💡 建议 :有些 Checkpoint 已经内置了 VAE,但如果单独加载 VAE 节点,会覆盖内置版本,通常能获得更好的效果。


4. diffusion_models/ ------ 新一代扩散模型

英文全称:Diffusion Models(扩散模型)

中文含义 :这是 ComfyUI 中较新的官方目录,用于存放骨干扩散模型,特别是那些按"模型家族"组织的模型(如 FLUX、WAN、QWEN、HiDream、LTX 等)。

为什么这样命名和组织? 随着模型生态日益丰富,FLUX、WAN 等新一代模型如果全放进 checkpoints/ 会非常杂乱。按模型家族分类存放,管理更清晰,也便于维护。

作用 :和 checkpoints/ 功能类似(都是基础生成模型),但更强调按模型家族分类。如果你使用的是 FLUX、WAN 等新模型,应该来这里找对应的子目录。

常见模型举例

子目录 包含模型
FLUX/ flux1-dev.safetensorsflux1-schnell.safetensors
WAN/ WAN 视频生成模型系列
QWEN/ Qwen 系列模型
LTX-2/LTXV/ LTX 视频生成模型
HiDream/ HiDream 图像生成模型
MiniMax/ MiniMax H3 系列

💡 建议:优先查看这个目录是否已有你需要的模型家族分类,按分类放入对应的子目录。


5. unet/ ------ UNet 模型

英文全称:U-Net(U 形网络)

中文含义 :UNet 是一种经典的卷积神经网络架构,因其网络结构呈"U"形而得名(先下采样编码,再上采样解码,中间有跳跃连接)。

为什么这样命名? UNet 最早用于医学图像分割,因其 U 形架构图而得名。在 Stable Diffusion 中,UNet 是扩散模型的核心组件,负责"去噪"过程------从随机噪声逐步生成图像。

作用 :在早期版本中,unet/ 用于存放单独的 UNet 模型文件。现在已逐步被 checkpoints/diffusion_models/ 取代,但仍被一些旧版插件或自定义节点使用

常见模型举例

  • 一些旧版 SD1.5 的 UNet 分离文件
  • 自定义训练的分割模型

💡 注意 :新用户建议优先使用 checkpoints/diffusion_models/,除非你明确知道自己在做什么。


6. configs/ ------ 配置文件

英文全称:Configurations(配置文件)

中文含义 :存放 YAML、JSON 等格式的模型配置文件,定义模型架构参数(如层数、通道数、注意力头数等)。

为什么这样命名? 简单的英文直译,表示"配置"文件。

作用:当模型文件本身不包含架构信息时,需要配套的配置文件来告诉 ComfyUI "这个模型长什么样"。

常见模型举例

文件名 对应模型
v1-inference.yaml SD1.5 配置
v1-inference-vae.yaml SD1.5+VAE 配置
sd_xl_base.yaml SDXL 配置

💡 建议 :一般情况下不需要手动修改,但如果你下载了单独的模型权重文件(非 safetensors 完整包),可能需要配合 .yaml 文件使用。


第二部分:文本与图像编码器

7. clip/ ------ CLIP 文本编码器

英文全称:Contrastive Language-Image Pre-training(对比语言-图像预训练)

中文含义 :CLIP 模型由 OpenAI 开发,包含文本编码器图像编码器 两个分支。这里的 clip/ 存放的是文本编码器 ,负责将你的文字提示词(Prompt)转换成 AI 能理解的向量表示

为什么这样命名? "CLIP"既是缩写,也形象地描述了其核心思想------通过对比学习将文本和图像"拉近"到同一个向量空间进行匹配。

作用:你的正向/负向提示词就是通过 CLIP 文本编码器处理后,才能传递给生成模型。CLIP 的质量直接影响模型对文字的理解能力。

常见模型举例

文件名 说明
clip_l.safetensors SD1.5 标配
clip_g.safetensors SDXL 使用的更大版本(有更多参数)
longclip-L.safetensors 支持更长文本输入(最多 248 个 token)

💡 ⚠️ 重要区分clip/text_encoders/ 是两个不同的目录!clip/ 仅存放 CLIP 系列的文本编码器 ,而 text_encoders/ 用于存放 T5、QWEN、GEMMA、LLAMA 等大语言模型编码器


8. clip_vision/ ------ CLIP 图像编码器

英文全称:CLIP Vision(CLIP 的视觉分支)

中文含义 :和 CLIP 文本编码器对应,CLIP Vision 是 CLIP 模型的图像编码分支 ,负责将图像转换成向量表示

为什么这样命名? 它是 CLIP 模型的一部分,专门处理视觉(Vision)输入,因此叫 clip_vision

作用 :用于图生图(img2img)、IP-Adapter(图像风格迁移)、Redux(图像重绘)、ControlNet 的图像引导等需要理解图像内容的场景。简单说,当你想让 AI "看懂"一张图时,就需要用到它。

常见模型举例

文件名 说明
clip_vision_h.safetensors 标准版本,最常用
sigclip_vision.safetensors 更强大的变体(SigLIP)
ViT-H-14-378-quickgelu.safetensors ViT 架构的大尺寸版本

9. text_encoders/ ------ 大语言模型编码器

英文全称:Text Encoders(文本编码器)

中文含义 :存放用于理解文本的大语言模型(LLM) 编码器。这些模型通常比 CLIP 更强大,能处理更复杂的语义、更长上下文和更细致的描述。

作用:新一代模型(如 Flux、MiniMax H3、LTX 视频模型)常常使用 T5、Gemma、Qwen 等强大的文本编码器来解析提示词,比传统 CLIP 理解更精准、更深入。

常见模型举例

文件名 对应模型 用途
t5xxl_fp16.safetensors T5-XXL Flux 系列常用
gemma-3-12b-it Gemma 3 LTX 2.3 视频模型使用
qwen3vl_32b_minimax_h3.safetensors Qwen3VL MiniMax H3 视频模型专用
t5-v1_1-xxl-encoder T5 v1.1 兼容多种模型

💡 ⚠️ 重要 :不要把 T5、Gemma 等模型放到 clip/ 目录,否则 ComfyUI 无法正确加载。它们走的是不同的代码路径!


第三部分:控制与引导模型

10. controlnet/ ------ ControlNet 精准控制

英文全称:ControlNet(控制网络)

中文含义 :ControlNet 是一种辅助控制模型,通过输入额外的引导信息(如线稿、深度图、姿态骨架、边缘图等)来精确控制生成图像的构图、姿态和布局。

为什么这样命名? 直译"控制网络",一语中的------它就是用来"控制"图像生成过程的额外网络。

作用 :让 AI 生成符合你指定姿态、构图的图像。比如,你可以先画一个简单的人体骨架(OpenPose),ControlNet 会强制生成的人物符合这个姿态。

常见模型举例

文件名 控制类型 用途
control_v11p_sd15_canny.safetensors Canny 边缘检测 保持线稿轮廓
control_v11p_sd15_openpose.safetensors OpenPose 姿态 人体姿态控制
control_v11p_sd15_depth.safetensors 深度图 三维构图控制
control_v11p_sd15_seg.safetensors 语义分割 区域颜色控制
xinsir-controlnet-union-sdxl.safetensors 多合一 一个模型支持多种控制类型
sai_xl_depth_256lora.safetensors SDXL 深度控制 SDXL 场景深度控制

11. gligen/ ------ GLIGEN 布局控制

英文全称:Grounded Language-Image Generation(基于语言的图像生成)

中文含义 :GLIGEN 是一种通过文字描述指定物体位置的控制模型。你可以说"在图片左侧有一只猫,右侧有一只狗",GLIGEN 就会精确控制物体出现在指定区域。

为什么这样命名? 缩写,完整名称描述了其核心思想:将语言"落地"到图像的具体空间位置。

作用 :比 ControlNet 更直观------直接用坐标和文字控制物体位置。适合需要精确布局的场景(如海报设计、产品展示)。

常见模型举例

  • gligen_sd15.safetensors:SD1.5 的 GLIGEN 模型
  • 相关配置文件(.yaml

💡 使用方式 :GLIGEN 需要配合 GLIGEN 节点,输入类似 (0.2, 0.3, 0.6, 0.8) 的坐标框和对应的物体描述文字。


12. photomaker/ ------ PhotoMaker 人像定制

英文全称:PhotoMaker(照片制作者)

中文含义 :PhotoMaker 是一种人像生成技术,输入几张不同角度的人脸照片,就能在生成图像中保持该人物的身份特征。

为什么这样命名? 直译"照片制作者"------用照片生成新的人物形象。

作用 :实现人像一致性生成,输入 3~5 张人脸照片,输出同一人物的不同场景/姿态图像。

常见模型举例

  • photomaker-v1.safetensors
  • photomaker_style.safetensors

第四部分:目标检测、分割与几何估计

13. ultralytics/ ------ Ultralytics 检测模型

英文全称:Ultralytics(公司名)

中文含义 :Ultralytics 是开发 YOLO(You Only Look Once)目标检测系列的公司。这个目录存放 Ultralytics 格式的目标检测模型文件。

为什么这样命名? 直接以开发公司名称命名,因为 Ultralytics 生态庞大,YOLO 系列在目标检测领域地位举足轻重。

作用:用于检测图像中的人脸、手势、人体姿态、物体等位置和类别。

常见模型举例

文件名 检测类型
yolov8n-face.pt 人脸检测
yolov8n-pose.pt 人体姿态关键点检测
yolov8x.pt 通用目标检测(80 类别)
yolov8m-seg.pt 目标分割(带掩膜)
yolov9c.pt YOLOv9 通用检测

14. yolo/ ------ YOLO 专用目录

英文全称:You Only Look Once(你只看一次)

中文含义 :YOLO 是一种经典的目标检测算法 ,特点是速度快------只需"看一眼"就能同时检测出图像中所有目标的位置和类别。

为什么这样命名? 这个名字有两层含义:一是算法本身采用单阶段检测(一次性完成所有目标的识别和定位,区别于两阶段方法);二是一种自豪的命名------"我只看一眼就能认出一切"。

作用yolo/ 是用于存放 YOLO 模型的另一个目录 。在部分 ComfyUI 版本或插件中,会直接读取这里而非 ultralytics/。两者功能重叠,需要看具体插件读取哪个目录。

常见模型举例

  • yolov8n-face.pt
  • yolov8n-pose.pt
  • yolov8x.pt

💡 注意ultralytics/yolo/ 功能重叠,具体使用哪个取决于插件。建议两边都保留一份常用的 YOLO 模型,确保兼容。


15. detection/ ------ 检测模型通用目录

英文全称:Detection(检测)

中文含义 :存放各类目标检测模型的通用目录,不限于 YOLO。

作用:作为检测模型的补充存放位置,容纳各种检测相关的模型文件。

常见模型举例

  • 其他开源检测模型(如 DETR、FCOS 等)
  • 专用检测器(如手部检测、人脸检测)

16. sams/ ------ SAM 图像分割

英文全称:Segment Anything Model(分割万物模型)

中文含义 :Meta(Facebook)推出的图像分割模型,可以精确分割图像中的任何对象,无需额外训练。用户可以通过点击/框选指定要分割的区域。

为什么这样命名? 直接沿用 Meta 的官方名称 "Segment Anything"(分割万物),体现了其强大的通用分割能力。

作用 :用于精准抠图、物体分离、背景移除等任务。是 ComfyUI 中图像编辑工作流的利器。

常见模型举例

文件名 说明
sam_vit_h_4b8939.pth SAM 基础版(ViT-H,最大版本)
sam_vit_l_0b3195.pth SAM 大版本(ViT-L)
sam_vit_b_01ec64.pth SAM 小版本(ViT-B,最快)
sam2_hiera_large.pt SAM2 最新版本
mobile_sam.pt 移动端轻量版 SAM

17. background_removal/ ------ 背景移除

英文全称:Background Removal(背景移除)

中文含义 :专门存放用于移除图像背景的模型。

作用:一键抠图,去除背景,保留前景主体。

常见模型举例

  • u2net.pth:最常用的背景移除模型
  • u2netp.pth:轻量版
  • birefnet 系列

💡 建议 :常用模型 u2net.pth 也可以放在这里,配合 RMBG、BRIA 等插件使用。


18. geometry_estimation/ ------ 几何估计

英文全称:Geometry Estimation(几何估计)

中文含义 :存放用于估计图像几何信息的模型,如深度图(Depth Map)、法线图(Normal Map)等。

作用:从 2D 图像中提取 3D 几何信息,用于 ControlNet 的 depth、normal 控制,或用于 3D 重建。

常见模型举例

文件名 估计类型
depth_anything_v2_vits.pth 深度估计
MiDaS 系列 多版本深度估计
normal_estimation 模型 法线估计

第五部分:视频与序列处理

19. frame_interpolation/ ------ 帧插值

英文全称:Frame Interpolation(帧插值)

中文含义 :用于在视频的两帧之间生成中间过渡帧,提升视频流畅度(如从 15fps 提升到 60fps)。

作用 :视频生成后的后处理,让生成的视频看起来更流畅、更自然。

常见模型举例

文件名 说明
film_net_fp16.pt FILM 模型,Google 出品
rife-v4.safetensors RIFE 模型,高质量补帧
gma-sintel.safetensors GMA 光流模型

20. optical_flow/ ------ 光流估计

英文全称:Optical Flow(光流)

中文含义 :光流是计算机视觉中的一个重要概念,指图像中像素的运动轨迹和速度场。通过分析连续两帧图像,计算每个像素点的运动方向和速度。

作用:用于视频生成、运动分析和帧插值等任务。光流信息可以帮助模型理解视频中的"运动规律"。

常见模型举例

文件名 说明
raft-things.pth RAFT 光流模型
gmflow 系列 GMFlow 光流模型
gma-sintel.pth GMA 光流模型

21. audio_encoders/ ------ 音频编码器

英文全称:Audio Encoders(音频编码器)

中文含义 :专门用于将音频信号转换为向量表示的编码器,使得 AI 模型能够"理解"音频内容。

作用 :用于视频生成模型中需要根据音频生成画面的场景(如 MiniMax H3、WAN 等视频模型可根据音频生成对口型视频)。

常见模型举例

文件名 对应模型
minimax_h3_audio_vae_fp32.safetensors MiniMax H3 专用音频 VAE
wav2vec 系列 通用音频特征提取

第六部分:图像增强与风格

22. upscale_models/ ------ 超分辨率放大

英文全称:Upscale Models(超分辨率模型)

中文含义 :用于将低分辨率图像放大到更高分辨率,同时尽可能保持清晰度和细节。

作用:提升图像分辨率,用于最终输出高清大图或修复模糊图像。

常见模型举例

文件名 说明
RealESRGAN_x4plus.pth 通用超分,效果优秀(4倍放大)
RealESRGAN_x4plus_anime.pth 动漫专用超分
4x-UltraSharp.pth 清晰度极高
Real_HAT_GAN_sharper.pth 更锐利的超分
ESRGAN_4x 系列 经典 ESRGAN 系列

💡 建议 :如果有多个放大倍数需求,可以用子目录分类,如 upscale_models/2x/upscale_models/4x/


23. latent_upscale_models/ ------ 潜空间放大

英文全称:Latent Upscale Models(潜空间放大模型)

中文含义:在 AI 的**潜空间(latent space)**内直接对图像进行放大,而不是在像素空间。这种方式速度更快,但对放大质量有一定要求。

作用 :用于图像生成的放大阶段,在图像完全"解码"之前就进行放大,效率更高。

常见模型举例

文件名 说明
x4-upsampler-ema.safetensors SD 潜空间放大模型

💡 区分latent_upscale_models/ 是在潜空间放大(更快,配合采样流程),upscale_models/ 是在像素空间放大(更精细,作为后处理)。两者定位不同。


24. style_models/ ------ 风格迁移模型

英文全称:Style Models(风格模型)

中文含义 :存放用于风格迁移的模型,可以将一种图像的风格"迁移"到另一张图像上。

作用:实现图像风格转换,比如将写实照片转换成梵高画风。

常见模型举例

  • 各种风格迁移模型(如 AdaIN、Fast Style Transfer 等)
  • ComfyUI 部分风格插件的专用模型

第七部分:微调与嵌入

25. embeddings/ ------ Textual Inversion 嵌入

英文全称:Embeddings(嵌入)

中文含义 :存放 Textual Inversion(文本反转) 的嵌入文件。这是一种通过 3~5 张图片"教会"模型特定概念或物体的技术,生成的文件通常只有几十 KB。

作用 :让模型"认识"某个特定物体、角色或概念。使用时在提示词中输入对应的触发词即可调用。

常见模型举例

文件名 对应触发词 用途
my-cat.pt my-cat 让模型认识"我的猫"
sks-style.pt sks-style 自定义风格
avatar.pt avatar 固定角色特征

💡 注意 :Textual Inversion(.pt)和 LoRA(.safetensors)是不同的技术,虽然都是微调方式,但文件大小和原理不同。


26. hypernetworks/ ------ 超网络

英文全称:Hypernetworks(超网络)

中文含义 :Hypernetwork 是另一种微调技术,通过一个较小的"超网络"来修改主模型的行为。在 Stable Diffusion 早期版本中较流行,目前已逐渐被 LoRA 取代。

作用:调整生成图像的风格、构图或特定特征。和 LoRA 功能类似,但实现方式不同。

常见模型举例

  • 各种风格 Hypernetwork(.pt 文件)

💡 建议:如果你有 LoRA 可用,优先用 LoRA。Hypernetwork 的支持已不如 LoRA 广泛。


27. model_patches/ ------ 模型补丁

英文全称:Model Patches(模型补丁)

中文含义 :存放用于修补或扩展模型功能的补丁文件,通常用于修复模型的特定问题或添加新功能。

作用:灵活扩展模型功能,无需重新训练完整模型。

常见模型举例

  • 特定模型的补丁文件
  • 功能扩展插件生成的补丁

第八部分:大语言模型

28. LLM/ ------ 大语言模型

英文全称:Large Language Model(大语言模型)

中文含义 :存放完整的大语言模型 。注意这里是包含完整权重和架构的 LLM,而非仅仅是编码器(与 text_encoders/ 区分)。

作用:用于高级提示词理解、图像描述生成(如 BLIP)、自动提示词优化等需要完整自然语言理解/生成能力的任务。

常见模型举例

模型 用途
Florence-2 图像描述生成、物体检测
Qwen 系列 中文/多语言理解
LLaMA 系列 通用语言模型

第九部分:格式与平台相关

29. diffusers/ ------ Diffusers 格式模型

英文全称:Diffusers(扩散器)

中文含义 :Hugging Face 的 diffusers 库定义了一种标准的模型组织格式 ,以完整文件夹(包含多个子文件)而非单个文件的形式存放模型。

为什么这样命名? 直接采用 Hugging Face diffusers 库的名称。该库已成为扩散模型社区的事实标准。

作用:以 Hugging Face 标准格式加载模型,支持从 Hugging Face Hub 直接下载和使用。

常见模型举例

  • runwayml/stable-diffusion-v1-5 的 diffusers 版
  • stabilityai/stable-diffusion-xl-base-1.0 的 diffusers 版

💡 区别checkpoints/.safetensors.ckpt 单文件,diffusers/ 放多个文件的文件夹。


30. onnx/ ------ ONNX 格式模型

英文全称:Open Neural Network Exchange(开放神经网络交换格式)

中文含义 :ONNX 是一种开放的模型格式标准,可以在不同的深度学习框架(PyTorch、TensorFlow 等)之间进行模型转换和部署。

为什么这样命名? 直接使用该格式标准的官方名称。

作用 :存放 ONNX 格式的模型,通常用于推理加速(配合 TensorRT、OpenVINO 等)或在资源受限的设备上部署。

常见模型举例

  • 转换后的 ControlNet ONNX 版本
  • 轻量化推理模型

💡 注意:ONNX 模型的加载路径在部分 ComfyUI 变体中可能是**硬编码(hardcoded)**的,不要随意移动此目录。


31. vae_approx/ ------ VAE 近似(轻量版)

英文全称:VAE Approximate(VAE 近似)

中文含义 :存放 VAE 的近似模型,通常是用更小、更快的网络来"近似"完整 VAE 的功能。

作用 :在低显存设备上,作为完整 VAE 的轻量替代方案。牺牲少量质量换取更快的速度和更低的内存占用。

常见模型举例

  • taesd_encoder.safetensors / taesd_decoder.safetensors:Tiny AutoEncoder(极度轻量)
  • taesdxl_encoder.safetensors / taesdxl_decoder.safetensors:SDXL 版的 tiny VAE

💡 建议 :如果你的显存充足(8GB+),直接使用 vae/ 中的完整模型。显存紧张的设备(4GB 以下),vae_approx/ 是不错的备选。


✅ 完整速查表(31个目录总览)

# 目录名 核心作用 关键提醒
1 audio_encoders/ 音频→向量 视频生成(MiniMax)专用
2 background_removal/ 背景移除 抠图用
3 checkpoints/ ⭐ 基础大模型 最常用,放 SD/XL 等
4 clip/ CLIP 文本→向量 别和 text_encoders 搞混
5 clip_vision/ CLIP 图像→向量 IP-Adapter 等需要
6 configs/ 模型配置文件 配合 .ckpt 使用
7 controlnet/ 精准姿态/构图控制 配线稿/深度图等
8 detection/ 目标检测 检测物体/人脸
9 diffusers/ Diffusers 格式 Hugging Face 标准
10 diffusion_models/ 新一代扩散模型 FLUX/WAN 等放这里
11 embeddings/ Textual Inversion 几十 KB 的 .pt 文件
12 frame_interpolation/ 视频补帧 提升视频流畅度
13 geometry_estimation/ 深度/法线估计 ControlNet 深度控制用
14 gligen/ 坐标布局控制 精确控制物体位置
15 hypernetworks/ 超网络微调 已逐渐被 LoRA 取代
16 latent_upscale_models/ 潜空间放大 采样流程内放大
17 LLM/ 大语言模型 完整 LLM(不只是编码器)
18 loras/ ⭐ LoRA 微调 最常用!放风格/角色 LoRA
19 model_patches/ 模型补丁 扩展功能用
20 onnx/ ONNX 格式 推理加速/跨框架
21 optical_flow/ 光流估计 视频运动分析
22 photomaker/ 人像定制 保持人物身份一致
23 sams/ SAM 图像分割 精准抠图神器
24 style_models/ 风格迁移 图像风格转换
25 text_encoders/ LLM 文本编码器 T5/Gemma/Qwen 放这里
26 ultralytics/ YOLO 检测 Ultralytics 官方格式
27 unet/ UNet 模型 旧版目录,部分插件仍用
28 upscale_models/ 超分辨率放大 最终高清输出
29 vae/ ⭐ VAE 编解码器 影响画质关键
30 vae_approx/ VAE 轻量近似 低显存用
31 yolo/ YOLO 专用 部分插件读取此目录

📌 最后的小贴士

  1. 文件格式 :优先使用 .safetensors 格式,比 .ckpt.pt 更安全、加载更快。
  2. 子目录分类 :在 loras/checkpoints/ 等目录中建立子目录进行分类管理。
  3. 命名规范:避免中文字符、空格及特殊符号,防止编码错误。
  4. 硬编码警告onnx/tensorrt/ 等目录路径是硬编码的,不要随意移动。
  5. 双目录注意ultralytics/yolo/ 功能重叠,具体看插件读取哪个;clip/text_encoders/ 也完全不同。

掌握了这 31 个文件夹的用途,你就能在 ComfyUI 的模型海洋中游刃有余了!🎉

相关推荐
yuezhilangniao14 小时前
MiniMax-H3视频生成模型使用坑点与记录(持续更新)
aigc·comfyui
云樱梦海3 天前
ComfyUI启动卡死排查-回环连接被安全软件拦截
comfyui
Eric.467 天前
秋叶ComfyUI-AKI最新整合包|完整部署教程+核心指令手册
云计算·百度云·comfyui·ai漫剧
Eric.467 天前
2026最新|ComfyUI AI漫剧全自动教程:统一人设、智能分镜、插帧动效、批量成片保姆级指南
人工智能·ai绘画·comfyui·本地部署·ai漫剧
梦想的颜色7 天前
ComfyUI 深度硬核科普:节点式 AI 生成框架完整实战(安装、原理、使用场景、避坑)
人工智能·机器学习·计算机视觉·aigc·comfyui·ai视频·图生视频
刘广睿9 天前
AI 生图从玄学到工程:Stable Diffusion、ComfyUI 与 Midjourney 的原理与 Prompt 方法论
aigc·stablediffusion·comfyui·ai生图
ICollection11 天前
4060笔记本用Docker部署ComfyUI绘图
docker·comfyui
进击切图仔15 天前
ComfyUI 安装新模型
comfyui
进击切图仔16 天前
ComfyUI 安装复现教程
comfyui