个人电脑玩AI-16让5060 Ti给你打工——5060Ti 16G 跑 MiniMax-Music-3:从下载到 60s 出歌的全流程

by 雪隐_上班了 from juejin.cn/user/143341...

欢迎分享与聚合,全文转载就不必了,尊重版权,圈子就这么大,若急用可联系授权。
一张 16G 的卡,一颗想当制作人的心,和一首 60 秒的歌。

专栏主旨 :用我那台 RTX 5060 Ti 16G + 64GB 内存 的"丐帮战车",做点不枉费电费的新奇事情。

前几章我们让显卡"画画"、"拍视频"、"开会",这一章来点不一样的------让显卡作曲。 对,就是那种带人声、带旋律、带氛围感的完整曲子,不是那种"叮叮当当电子音效"的 AI 音乐。

写在前面

前几天 MiniMax 放出了 Music-3,Comfy-Org 同步打包了 ComfyUI 版本。

我一看:音乐生成,本地可跑,ComfyUI 原生支持。这不就是为我准备的?

但心里还是有点打鼓:这玩意儿多大?我的 5060 Ti 16G 扛得住吗?会不会一运行就把显存顶满,然后风扇起飞、温度破 80、电脑原地升天?

实际跑下来------挺从容的。 显存没炸,温度没飙,歌还真的出来了。这篇就把整套流程写下来,顺带记一下踩到的坑。

硬件环境

  • GPU:NVIDIA GeForce RTX 5060 Ti 16GB(实际 15.9 GB,老黄的传统艺能)
  • CUDA:PyTorch 2.7.0 + cu128
  • 系统:Windows 11 + PowerShell
  • ComfyUI:秋叶整合包,版本 v0.31.1

第一坑:必须升到最新 ComfyUI

官方 workflow 用了几个比较新的节点:MiniMaxMusic3TextEncodeEmptyMiniMaxMusic3LatentAudioVAEDecodeAudioTiled------都是 comfy-core 0.31.0 才加进来的。

旧版 ComfyUI 加载会直接红一片,报 "Unknown node type"。那场面就像你买了一盘新出的游戏卡带,插进老款游戏机,屏幕显示"此卡带不兼容"------机器比你更早认输。

解决方案:去 ComfyUI Manager 里点一下 Update,升到最新。别偷懒,这步不做,后面的所有操作都是白忙。

下载模型:61.8 GB 的 repo,我只拿了 3 个文件

下载走的是国内镜像 modelscope,直接拉 HF 上的 Comfy-Org/MiniMax-Music-3 整个 repo:

python 复制代码
from modelscope import snapshot_download
snapshot_download('Comfy-Org/MiniMax-Music-3', cache_dir='F:/baidudownload')

整个 repo 61.8 GB ,10 个文件。注意 modelscope 用的是 Comfy-Org--MiniMax-Music-3双横线)而不是 HF 的斜杠,填错了它会一脸茫然地告诉你"找不到这个仓库"。

下完默认放在 cache_dir/Comfy-Org--MiniMax-Music-3/snapshots/master/。你要找的是三个特定文件,其他 7 个可以忽略------不是它们不好,是 16G 显存不配。 跑 fp32/bf16 是 4090/5090 玩家的特权,咱们认清自己的卡位。

但 61.8 GB 全下是真的没必要,我只挑了 3 个 int8 量化版:

文件 大小 用途
diffusion_models/minimax_music3_dit_int8_convrot.safetensors 2.3 GB DiT int8 量化版
text_encoders/minimax_music3_text_encoder_pruned_int8_convrot.safetensors 8.6 GB 文本编码器 int8
vae/minimax_music3_dav.safetensors 0.2 GB 音频 VAE

合计 11.1 GB,留 4.8 GB 给激活和缓存,跑 60s 单曲无压力。

同 repo 里还有 fp32 / fp16 版 DiT 和非 pruned 的 bf16 文本编码器(分别 9.2 / 4.6 / 17.2 GB),那是给 20/30/40 系显存大户准备的。咱们 16G 选手,选 int8 是理智,选 fp16 是冒险,选 fp32 是自杀。

装到 ComfyUI:三个文件,三个目录,一分钟

ComfyUI 约定的模型目录是这三个:

bash 复制代码
ComfyUI/models/
├── diffusion_models/    ← DiT 放这里
├── text_encoders/       ← 文本编码器放这里
└── vae/                 ← VAE 放这里

把上面 3 个文件复制到对应目录就行。也可以用 symlink,但 Windows 软链接要管理员权限,不如直接 copy 省事------反正 11G 复制也就几秒钟。

说个题外话:我一开始偷懒想用硬链接,结果权限报错、路径报错、符号链接报错,折腾了 20 分钟后老老实实按 Ctrl+C、Ctrl+V。有些坑,非要自己踩一遍才知道"直接 copy"有多香。

装 Workflow:改两个地方,少走两小时弯路

官方 workflow JSON 在 Comfy-Org/workflow_templates 仓库的 templates 目录,文件叫 audio_minimax_music_3.json

拉到本地后必须改两处,否则 16G 卡跑不动:

  1. minimax_music3_dit_fp16 换成 minimax_music3_dit_int8_convrot ------ 4.6 GB → 2.3 GB,显存立刻宽裕 2.3 GB
  2. tiled_decode 开关拨到 ON ------ VAE 解码用分块,长歌不爆显存

这两步不做,你会在"生成到一半"的时候收到一个 CUDA OOM 报错,然后看着进度条卡在 80% 的位置,欲哭无泪。2.3 GB 的差距,就是"跑完"和"跑炸"的区别。

改完的 JSON 扔到 ComfyUI/user/default/workflows/ 下,ComfyUI 启动后会自动出现在 Workflow 面板里。

第一次出歌:Prompt 比我想象中讲究

Prompt 用的是 workflow 文档里给的 lo-fi chillhop 模板。caption 分三段:Global Metadata → Vocal Details → Arrangement,写得越具体越好。

歌词里的 [intro] [verse] [chorus] [bridge] [outro] 这些 tag,是模型真正会执行的"结构性指令" ,不是装饰品。歌词本身的文本更多是传递 mood,不会逐字被唱出来------这跟 Suno 那种"你写什么它唱什么"的逻辑完全不同。Music-3 更像一个懂乐理的作曲家,你给意象和结构,它自己组织旋律和表达。

max_duration 设为 60,模型实际输出 59s(模型在 latent chunk 边界自动收尾找自然结束,不会卡死在 60s)。要更长就调大:2 分钟设 130-150、3 分钟设 200,上限 300s(5 分钟)。

主观听感(非专业,纯个人):

lo-fi 的温暖底噪、vinyl crackle(黑胶爆豆声)、tape hiss(磁带底噪)都有,氛围感拉满。人声是 soft androgynous 半念半唱,和 beat 融合得很自然------不是早期 MusicGen / AudioLDM 那种"AI 音乐"的塑料感。

早期 AI 音乐给我的感觉是:你知道它是一首歌,旋律也对、和声也对,但就是听着不对劲。像吃了一口长得像肉的豆腐------形状对了,口感不对。

Music-3 这次给我的感觉是:它真的像"一首歌"了。 有氛围、有呼吸、有余韵。

MP3 输出 4-5 MB,正常大小。

想配视频卡点的话,Music-3 这类生成式模型不太行,只能在目标时长上下浮动几秒。要硬卡时长只能后期 trim + 淡出------做视频的朋友们,请保留 Audition 或剪映的最后一道工序。

协议:对个人开发者非常友好

最后说一下 License,因为音乐生成最容易踩版权坑:

  • 模型权重minimax_music3_*):Apache-2.0
  • Comfy-Org 官方 workflow:Apache-2.0
  • 生成音频
    • ✅ 可商用、可再创作、可闭源
    • ❌ 不能用于训练其他 AI 模型(无额外授权)
    • ❌ 不能用于假冒真人/真人作品
    • ❌ 不能用于违法违规用途
  • 下游衍生作品:商用友好,无 copyleft 传染

总结一句:跑出来的东西基本可以放心用,但别拿去训练别人的模型,也别冒充真人歌手发片。 你要发歌,老老实实标"AI 生成"。

总结:16G 甜品卡也能当音乐制作人

5060Ti 16G 跑 Music-3 没想象中那么吃显存,关键就是选对 int8_convrot 系列 + 开 tiled_decode。

全程 checklist:

  1. ✅ 升 ComfyUI 到 v0.31.1+
  2. ✅ 用 modelscope 拉 HF 模型(国内网速友好)
  3. ✅ 选 3 个 int8 文件,共 11.1 GB
  4. ✅ 复制到 ComfyUI/models/ 三个子目录
  5. ✅ 改 workflow 的 unet_name + tiled_decode
  6. ✅ Queue Prompt,等 1-2 分钟一首

如果你也想试试,照着这个清单走,大概率一遍过。如果卡住了......那就再看一遍,大概率是你漏了某一步------我写这篇的时候自己就漏了两次。

番外:一个意外的发现

跑完第一首歌后,我看了眼 GPU 温度------72°C。

要知道前几章跑 H3 视频的时候,温度是 78-80°C。Music-3 比 H3 整整低了 6-8°C,风扇转速也安静了不少。

同样 16G 显存,音乐生成的负载比视频生成温柔多了。 可能是 DiT 的注意力计算量比视频扩散模型小,也可能是 int8 量化带来的功耗红利。

无论如何,对 5060 Ti 来说,跑歌比跑视频更养生。 视频是短跑冲刺,音乐是匀速慢跑------都能跑完,但一个喘得像狗,一个还能哼着小调。


如果你成功跑出了第一首 AI 生成的歌,或者这篇帮你避开了某个坑,点赞、评论、转发都行。

谢谢大家 🙏 祝你们的 prompt 精准,编曲在线,歌词不尬,显存永远够用。

相关推荐
watersink1 小时前
机器学习PCA
人工智能·机器学习
海兰1 小时前
【agent应用】DeepSeek Harness (dsh)介绍及安装部署(Ubuntu24.04)使用指南
人工智能·agent
逻辑君1 小时前
科技逆向外语|20260808
人工智能·科技·机器学习
Dawson Zhu1 小时前
面向AI自动化分析的数据仓库建模实践
人工智能·语言模型·架构·制造
民乐团扒谱机1 小时前
【微实验】谐波乘积谱(HPS)算法深度解析:原理、数学与代码实现
开发语言·人工智能·python·算法·语音识别·音乐
tech讯息1 小时前
Agentic BI 云方案选型:哪些平台可支持业务人员自然语言查数并分析原因?
人工智能
黄焖鸡能干四碗1 小时前
信息安全保障方案(Word文件)
大数据·网络·人工智能·架构·区块链
致Great1 小时前
Anthropic 终于把 Claude Code 怎么省 Token 讲明白了。
人工智能
报错小能手1 小时前
Go 语言结构 基础语法
开发语言·后端·golang