对标 GPT-4o 的开源实时语音多模态模型:Moshi

是由法国的 AI 实验室 Kyutai 推出的实时语音多模态模型,支持听、说、看,最关键的是你现在就可以在浏览器中使用,如果这个链接延迟高,可以试试这个, 无需输入邮箱,点击 Join queue 即可。

简单体验了下,比较笨笨的,延迟很低,可以随时打断,如果你一直不说话还会主动找你,很接近 GPT-4o 了!非常期待后续的开源。

相关推荐
百度Geek说3 分钟前
什么样的业务经验值得做成 Agent:从个人工具到组织资产
人工智能
欣欣之王来了12 分钟前
面试指南:执行式AI岗位真题解析
人工智能
墨天梦13 分钟前
25-评估指标与基准设计
人工智能·自然语言处理
烈风逍遥14 分钟前
第七篇:提示词模板管理与 Agent 提示词编排
前端·人工智能·后端
橘和柠21 分钟前
AI-Infra-Guard 部署与技能扫描实战:Docker 一键起,附我的一次“漏报”复盘
人工智能
茵Cindy22 分钟前
从RPA到Agent:HR流程自动化的架构演进与选型建议
人工智能·ai+hr·hr智能体
m4Rk_26 分钟前
【论文阅读】Agent 记忆机制(77):TSM——让记忆回到事件真正发生的时间
论文阅读·人工智能·学习·开源·github
陈天伟教授29 分钟前
技能人才评价考评员(高级考评员)备考要点-模块一技能人才评价制度体系与政策法规
人工智能·具身智能
ksueh30 分钟前
2026网文有声化新规落地:AI配音的边界划在了哪里
人工智能·ai写作·ai工具·ai写小说
旺仔小馒头wang38 分钟前
AI 智能手机发布会:赋予人类的五种新能力
人工智能·学习·音视频