语音大模型

春波petal19 天前
人工智能·自然语言处理·chatgpt·大模型·多模态·语音大模型
大模型底层逻辑:优势局限与天生短板👨‍💻 了解博主:波仔椿 📖 人生箴言:技术落地,方为 AI 正道。 🧰 我的专栏:普通人可落地的 AI 提效实战
weixin_421607554 个月前
ai配音·语音大模型·短剧出海·零样本tts·非自回归语音合成·掩码生成模型·跨语种声音克隆
从自回归到掩码生成:拆解零样本 TTS 在长视频配音场景下的技术路径做过短剧出海或者影视译配的工程师大概都遇到过这样一个场景:拿一段十分钟的中文剧情,翻译成英文之后用一个看起来效果不错的 TTS 模型合成配音,前两分钟听起来非常自然,到第五分钟某个角色的音色开始出现轻微的漂移,到第八分钟某句台词干脆出现了重复词或者吞字。
攻城狮7号10 个月前
人工智能·开源模型·语音大模型·llaso·逻辑智能
全球首个全开源端到端语音大模型框架:逻辑智能LLaSO目录前言:语音大模型为何陷入发展瓶颈?一、“规矩制定者”登场:LLaSO框架是什么?二、LLaSO的“三板斧”:一套开源的“数据+考场+范本”组合拳
未来之窗软件服务1 年前
数字人·语音大模型
F5-TTS文本语音生成模型-CPU版本安装-数字人之语音驱动9G大小修改系统缓存目录由于解压到了C盘不够,安装后没有自己删除,手动删除一下C:\Users\当前用户名\AppData\Roaming\F5-TTS-CPU\installer
DogDaoDao2 年前
人工智能·深度学习·大模型·音视频·音频·音频处理·语音大模型
开源音频处理项目推荐【持续更新】
我是有底线的