语音大模型

东姬AI19 天前
ai·数字人·多模态·视频生成·语音大模型
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步过去24小时,AI行业上演了一场少见的"实时竞赛"。9月15日凌晨,谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,官方称这是其迄今最先进的对话式AI,能够在对话不中断的情况下调用工具、处理视觉信息、执行复杂任务;同一天,国内的阶跃星辰一口气放出StepAudio 3系列五款语音模型,其中Realtime版本在Artificial Analysis对话动态榜单以98.9%的综合得分排名全球第一;还是同一天,生数科技发布实时视频模型
春波petal3 个月前
人工智能·自然语言处理·chatgpt·大模型·多模态·语音大模型
大模型底层逻辑:优势局限与天生短板👨‍💻 了解博主:波仔椿 📖 人生箴言:技术落地,方为 AI 正道。 🧰 我的专栏:普通人可落地的 AI 提效实战
weixin_421607556 个月前
ai配音·语音大模型·短剧出海·零样本tts·非自回归语音合成·掩码生成模型·跨语种声音克隆
从自回归到掩码生成:拆解零样本 TTS 在长视频配音场景下的技术路径做过短剧出海或者影视译配的工程师大概都遇到过这样一个场景:拿一段十分钟的中文剧情,翻译成英文之后用一个看起来效果不错的 TTS 模型合成配音,前两分钟听起来非常自然,到第五分钟某个角色的音色开始出现轻微的漂移,到第八分钟某句台词干脆出现了重复词或者吞字。
攻城狮7号1 年前
人工智能·开源模型·语音大模型·llaso·逻辑智能
全球首个全开源端到端语音大模型框架:逻辑智能LLaSO目录前言:语音大模型为何陷入发展瓶颈?一、“规矩制定者”登场:LLaSO框架是什么?二、LLaSO的“三板斧”:一套开源的“数据+考场+范本”组合拳
未来之窗软件服务2 年前
数字人·语音大模型
F5-TTS文本语音生成模型-CPU版本安装-数字人之语音驱动9G大小修改系统缓存目录由于解压到了C盘不够,安装后没有自己删除,手动删除一下C:\Users\当前用户名\AppData\Roaming\F5-TTS-CPU\installer
DogDaoDao2 年前
人工智能·深度学习·大模型·音视频·音频·音频处理·语音大模型
开源音频处理项目推荐【持续更新】
我是有底线的