AuK:多任务语音生成编辑,支持克隆、改词、换情绪与分离,内容编辑与增强全覆盖

AuK 是腾讯混元团队开源的 1.5B 参数基础语音模型,专门用于语音生成和语音编辑。

它用统一的自然语言指令(像聊天一样告诉它你想干什么),就能完成多种语音任务,不用换不同工具。训练数据规模很大(数百万小时多样音频),支持零样本和指令控制。

AuK 就像"语音版的全能编辑器",用一句话就能生成、修改、优化语音,开源后让开发者和创作者都能方便使用。

主要特点

统一接口:所有任务都通过自然语言指令 + 可选参考音频完成,简单好用。

两个版本:

AuK:高质量基础版。

AuK-Flash:蒸馏加速版,只需 4 步推理,速度快约 4.5 倍,适合实时场景。

多任务一体:生成、编辑、增强、分离等能力都在一个模型里。

支持的主要任务(按类别)

语音生成

零样本 TTS(用参考音频克隆音色说指定文字)

指令 TTS(只用文字描述声音,无需参考音频)

内容编辑

改说什么(替换、插入、删除文字)

改歌词(保留旋律和原声)

声学编辑

调音高、语速、音量

副语言编辑

换情绪、换音色、去口音、处理呼吸/笑声等非语言声音、正常语音↔耳语转换

增强与分离

降噪、去混响、语音增强

说话人分离、音乐中提取人声、目标说话人提取

应用领域

内容创作:短视频配音、有声书、播客、游戏角色语音、广告配音。

语音处理工具:快速修录音错误、改情绪风格、去口音、清理噪音。

多模态应用:配合视频/动画生成更自然的语音。

研究与开发:语音 AI 研究、定制化微调、工业级语音流水线。

个人/企业工具:快速语音克隆、内容本地化、无障碍辅助等。

使用教程: (建议N卡,显存8G起,支持50系显卡)

整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。

WebUI模式:

双击启动进入WebUI,上传参考音频,选择编辑类型,运行生成即可。

ComfyUI模式:

双击启动ComfyUI,进入WebUI后,点击左侧的 工作流程,选择对应的工作流。

上传参考音频,选择编辑类型,运行即可。

++编辑类型切换后,会有对应的文字说明,部分功能不太稳定,大家自行测试++

稳定功能包含但不限于:

声音克隆、提高音量 / 降低音量、语音增强、歌声提取、说话人分离、仅降噪、音质修复

欠稳定功能包含但不限于:

保留所有人声、更换情感、目标说话人提取、调整语速、升调 / 降调、更换音色、删除语音、添加 / 删除非语言声音、去除口音、在前面 / 后面插入语音、替换语音、改写歌词、耳语转换(双向)

软件目录结构:

📂 ComfyUI/

├── 📂 models/

│ ├── 📂 diffusion_models/

│ │ └── auk_base_int8.safetensors

│ │ └── auk_flash_int8.safetensors

│ ├── 📂 text_encoders/

│ │ └── qwen_omni_int8.safetensors

│ ├── 📂 vae/

│ │ └── auk_vae.safetensors

│ ├── 📂 whisper/

📂 deepface/

......

下载地址:点此下载

相关推荐
知几蜗牛3 小时前
4万星的Agent技能提醒我们:答案太全也可能不可用
人工智能
智购科技无人售货机工厂3 小时前
2026自动售货机AI智能体架构:从47个小模型到33.7亿Token的工程实践~YH
android·人工智能·驱动开发·单片机·pandas
Geek-Chow3 小时前
09. LLM 接缝:把“厂商协议“关进一个可替换的盒子
人工智能
麻瓜code3 小时前
【Agent】从 0 手写智能体框架:ReAct + ToolCall 分层设计
人工智能·spring
来了就不要走3 小时前
亿数平台怎么样:亿象生态与数实融合路径观察
大数据·人工智能·区块链
知几蜗牛3 小时前
流式JSON为什么总报错?理解结构化输出就能接稳AI接口
人工智能
Zentceh3 小时前
AI-ISP vs 传统ISP全面对比
人工智能·深度学习·计算机视觉·车载系统·transformer·无人机·智能硬件
知几蜗牛3 小时前
AI代码评审开始跑测试,真正该升级的是团队证据链
人工智能
魔镜er3 小时前
11-循环神经网络
人工智能·pytorch·python·深度学习·神经网络