哔哩哔哩开源 IndexTTS-2.0:新一代零样本语音合成模型

Qwen3-ASR-Flash:高精度多语言语音识别模型

Qwen3-ASR-Flash1 是基于 Qwen3 推出的高精度多语言语音识别模型,支持 11 种语言及其多种口音,具备自动语种检测与非人声过滤功能。

目前该模型暂未开源(有点小遗憾),但已上线阿里云百炼平台 API,佬们也可以在 Hugging Face Space 上在线体验2

哔哩哔哩开源 IndexTTS-2.0:新一代零样本语音合成模型

IndexTTS-2.03 是哔哩哔哩语音团队开源的新一代零样本语音合成模型,基于 55K 小时中英双语语音和 135 小时情感数据训练,实现了对语音时长和情感的精准控制。

目前 SDK 和模型都已开放,有需要的佬可以试试看!

即梦 AI 推出 Seedream 4.0 图像生成模型

即梦 AI 平台官网4的新一代图像生成模型 Seedream 4.0 已逐步向所有用户推送,中国版 Nano Banana 来了。

不过官方尚未发文正式发布,但登录后即可直接体验,一次生成消耗 1 积分。

MCP Registry 发布:开源标准化 MCP 服务器分发与发现

Model Context Protocol(MCP)Registry 预览版5正式发布,这个项目可以理解为 Node.js 的 npm 或者 Python 的 PyPI 的 MCP 版本。

它旨在标准化 MCP 服务器的分发与发现流程,完全开源并支持下游构建公共或私有的子注册表。目前只能通过接口和命令行工具来发布和获取,感觉可以开始抢占几个好名字了!

Vercel 开源 Vibe Coding 平台:集成 AI SDK 的完整开发生态

Vibe Coding Platform6 是 Vercel 发布并开源的基于其公司生态系统(包含 AI SDK、Gateway 和 Sandbox )的编码平台。

有做类似业务的佬们可以好好研究下源码7,学习学习设计思路啥的。

相关推荐
DM今天肝到几点?9 小时前
AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元
网络·人工智能·深度学习·安全·语言模型·开源·知识图谱
冬奇Lab9 小时前
一天一个开源项目(第207篇):AirLLM - 单卡 4GB 跑 70B 大模型
人工智能·开源
行百里er10 小时前
Gateway 上别硬塞 MVC:DeferredImportSelector 看菜下锅
spring boot·后端·开源
十六年开源服务商11 小时前
2026年WordPress页面构建器终极选型指南
开源
dong_junshuai12 小时前
每天一个开源项目#87 fmt:24.5K Stars 的 C++ 格式化核心
c++·开源·github
ovO13 小时前
DeepSeek Harness 源码解读(九):它适合什么场景,应该从哪里扩展
开源·agent
ovO13 小时前
DeepSeek Harness 源码解读(七):会话日志为何是唯一真相源
开源·agent
ovO13 小时前
DeepSeek Harness 源码解读(十):六条设计纪律如何约束可替换运行时
开源·agent
阿里云大数据AI技术13 小时前
PAI支持一键部署Qwen3.8-Flash-Next、GLM-5.3等最新开源模型
人工智能·开源·llm