by 雪隐_上班了 from juejin.cn/user/143341...
欢迎分享与聚合,全文转载就不必了,尊重版权,圈子就这么大,若急用可联系授权。
一张 16G 的卡,一颗想当制作人的心,和一首 60 秒的歌。
专栏主旨 :用我那台 RTX 5060 Ti 16G + 64GB 内存 的"丐帮战车",做点不枉费电费的新奇事情。
前几章我们让显卡"画画"、"拍视频"、"开会",这一章来点不一样的------让显卡作曲。 对,就是那种带人声、带旋律、带氛围感的完整曲子,不是那种"叮叮当当电子音效"的 AI 音乐。
写在前面
前几天 MiniMax 放出了 Music-3,Comfy-Org 同步打包了 ComfyUI 版本。
我一看:音乐生成,本地可跑,ComfyUI 原生支持。这不就是为我准备的?
但心里还是有点打鼓:这玩意儿多大?我的 5060 Ti 16G 扛得住吗?会不会一运行就把显存顶满,然后风扇起飞、温度破 80、电脑原地升天?
实际跑下来------挺从容的。 显存没炸,温度没飙,歌还真的出来了。这篇就把整套流程写下来,顺带记一下踩到的坑。
硬件环境
- GPU:NVIDIA GeForce RTX 5060 Ti 16GB(实际 15.9 GB,老黄的传统艺能)
- CUDA:PyTorch 2.7.0 + cu128
- 系统:Windows 11 + PowerShell
- ComfyUI:秋叶整合包,版本 v0.31.1
第一坑:必须升到最新 ComfyUI
官方 workflow 用了几个比较新的节点:MiniMaxMusic3TextEncode、EmptyMiniMaxMusic3LatentAudio、VAEDecodeAudioTiled------都是 comfy-core 0.31.0 才加进来的。
旧版 ComfyUI 加载会直接红一片,报 "Unknown node type"。那场面就像你买了一盘新出的游戏卡带,插进老款游戏机,屏幕显示"此卡带不兼容"------机器比你更早认输。
解决方案:去 ComfyUI Manager 里点一下 Update,升到最新。别偷懒,这步不做,后面的所有操作都是白忙。
下载模型:61.8 GB 的 repo,我只拿了 3 个文件
下载走的是国内镜像 modelscope,直接拉 HF 上的 Comfy-Org/MiniMax-Music-3 整个 repo:
python
from modelscope import snapshot_download
snapshot_download('Comfy-Org/MiniMax-Music-3', cache_dir='F:/baidudownload')
整个 repo 61.8 GB ,10 个文件。注意 modelscope 用的是 Comfy-Org--MiniMax-Music-3(双横线)而不是 HF 的斜杠,填错了它会一脸茫然地告诉你"找不到这个仓库"。
下完默认放在 cache_dir/Comfy-Org--MiniMax-Music-3/snapshots/master/。你要找的是三个特定文件,其他 7 个可以忽略------不是它们不好,是 16G 显存不配。 跑 fp32/bf16 是 4090/5090 玩家的特权,咱们认清自己的卡位。
但 61.8 GB 全下是真的没必要,我只挑了 3 个 int8 量化版:
| 文件 | 大小 | 用途 |
|---|---|---|
diffusion_models/minimax_music3_dit_int8_convrot.safetensors |
2.3 GB | DiT int8 量化版 |
text_encoders/minimax_music3_text_encoder_pruned_int8_convrot.safetensors |
8.6 GB | 文本编码器 int8 |
vae/minimax_music3_dav.safetensors |
0.2 GB | 音频 VAE |
合计 11.1 GB,留 4.8 GB 给激活和缓存,跑 60s 单曲无压力。
同 repo 里还有 fp32 / fp16 版 DiT 和非 pruned 的 bf16 文本编码器(分别 9.2 / 4.6 / 17.2 GB),那是给 20/30/40 系显存大户准备的。咱们 16G 选手,选 int8 是理智,选 fp16 是冒险,选 fp32 是自杀。
装到 ComfyUI:三个文件,三个目录,一分钟
ComfyUI 约定的模型目录是这三个:
bash
ComfyUI/models/
├── diffusion_models/ ← DiT 放这里
├── text_encoders/ ← 文本编码器放这里
└── vae/ ← VAE 放这里
把上面 3 个文件复制到对应目录就行。也可以用 symlink,但 Windows 软链接要管理员权限,不如直接 copy 省事------反正 11G 复制也就几秒钟。
说个题外话:我一开始偷懒想用硬链接,结果权限报错、路径报错、符号链接报错,折腾了 20 分钟后老老实实按 Ctrl+C、Ctrl+V。有些坑,非要自己踩一遍才知道"直接 copy"有多香。
装 Workflow:改两个地方,少走两小时弯路
官方 workflow JSON 在 Comfy-Org/workflow_templates 仓库的 templates 目录,文件叫 audio_minimax_music_3.json。
拉到本地后必须改两处,否则 16G 卡跑不动:
- 把
minimax_music3_dit_fp16换成minimax_music3_dit_int8_convrot------ 4.6 GB → 2.3 GB,显存立刻宽裕 2.3 GB - 把
tiled_decode开关拨到 ON ------ VAE 解码用分块,长歌不爆显存
这两步不做,你会在"生成到一半"的时候收到一个 CUDA OOM 报错,然后看着进度条卡在 80% 的位置,欲哭无泪。2.3 GB 的差距,就是"跑完"和"跑炸"的区别。
改完的 JSON 扔到 ComfyUI/user/default/workflows/ 下,ComfyUI 启动后会自动出现在 Workflow 面板里。
第一次出歌:Prompt 比我想象中讲究
Prompt 用的是 workflow 文档里给的 lo-fi chillhop 模板。caption 分三段:Global Metadata → Vocal Details → Arrangement,写得越具体越好。
歌词里的 [intro] [verse] [chorus] [bridge] [outro] 这些 tag,是模型真正会执行的"结构性指令" ,不是装饰品。歌词本身的文本更多是传递 mood,不会逐字被唱出来------这跟 Suno 那种"你写什么它唱什么"的逻辑完全不同。Music-3 更像一个懂乐理的作曲家,你给意象和结构,它自己组织旋律和表达。
max_duration 设为 60,模型实际输出 59s(模型在 latent chunk 边界自动收尾找自然结束,不会卡死在 60s)。要更长就调大:2 分钟设 130-150、3 分钟设 200,上限 300s(5 分钟)。
主观听感(非专业,纯个人):
lo-fi 的温暖底噪、vinyl crackle(黑胶爆豆声)、tape hiss(磁带底噪)都有,氛围感拉满。人声是 soft androgynous 半念半唱,和 beat 融合得很自然------不是早期 MusicGen / AudioLDM 那种"AI 音乐"的塑料感。
早期 AI 音乐给我的感觉是:你知道它是一首歌,旋律也对、和声也对,但就是听着不对劲。像吃了一口长得像肉的豆腐------形状对了,口感不对。
Music-3 这次给我的感觉是:它真的像"一首歌"了。 有氛围、有呼吸、有余韵。
MP3 输出 4-5 MB,正常大小。
想配视频卡点的话,Music-3 这类生成式模型不太行,只能在目标时长上下浮动几秒。要硬卡时长只能后期 trim + 淡出------做视频的朋友们,请保留 Audition 或剪映的最后一道工序。
协议:对个人开发者非常友好
最后说一下 License,因为音乐生成最容易踩版权坑:
- 模型权重 (
minimax_music3_*):Apache-2.0 - Comfy-Org 官方 workflow:Apache-2.0
- 生成音频 :
- ✅ 可商用、可再创作、可闭源
- ❌ 不能用于训练其他 AI 模型(无额外授权)
- ❌ 不能用于假冒真人/真人作品
- ❌ 不能用于违法违规用途
- 下游衍生作品:商用友好,无 copyleft 传染
总结一句:跑出来的东西基本可以放心用,但别拿去训练别人的模型,也别冒充真人歌手发片。 你要发歌,老老实实标"AI 生成"。
总结:16G 甜品卡也能当音乐制作人
5060Ti 16G 跑 Music-3 没想象中那么吃显存,关键就是选对 int8_convrot 系列 + 开 tiled_decode。
全程 checklist:
- ✅ 升 ComfyUI 到 v0.31.1+
- ✅ 用 modelscope 拉 HF 模型(国内网速友好)
- ✅ 选 3 个 int8 文件,共 11.1 GB
- ✅ 复制到 ComfyUI/models/ 三个子目录
- ✅ 改 workflow 的 unet_name + tiled_decode
- ✅ Queue Prompt,等 1-2 分钟一首
如果你也想试试,照着这个清单走,大概率一遍过。如果卡住了......那就再看一遍,大概率是你漏了某一步------我写这篇的时候自己就漏了两次。
番外:一个意外的发现
跑完第一首歌后,我看了眼 GPU 温度------72°C。
要知道前几章跑 H3 视频的时候,温度是 78-80°C。Music-3 比 H3 整整低了 6-8°C,风扇转速也安静了不少。
同样 16G 显存,音乐生成的负载比视频生成温柔多了。 可能是 DiT 的注意力计算量比视频扩散模型小,也可能是 int8 量化带来的功耗红利。
无论如何,对 5060 Ti 来说,跑歌比跑视频更养生。 视频是短跑冲刺,音乐是匀速慢跑------都能跑完,但一个喘得像狗,一个还能哼着小调。
如果你成功跑出了第一首 AI 生成的歌,或者这篇帮你避开了某个坑,点赞、评论、转发都行。
谢谢大家 🙏 祝你们的 prompt 精准,编曲在线,歌词不尬,显存永远够用。