阿里开源 OmniAvatar:音频驱动数字人模型

阿里开源 OmniAvatar:音频驱动数字人模型

OmniAvatar1 是阿里开源的一款基于 Wan 2.1 的音频驱动数字人模型。用户只需上传图片、音频和脚本,即可生成嘴型精准匹配、带有自然动作和表情的口播视频。

不过要注意的是,这个模型至少需要 36G 显存才能运行。

官方推荐单次生成 30 秒左右的视频片段,这样能达到最佳效果。从目前已有的开源数字人模型来看,OmniAvatar 的表现算是相当出色了。

开源对话式图像编辑器 EasyEdit

EasyEdit2 是一款基于 Flux KContext 模型的开源图像编辑器,通过自然对话即可智能修改图片。

佬们可以直接在网页端免登录使用 Flux KContext Dev 基础模型,而 Pro 高级模型则需要提供 APIKey 能用。

NVIDIA 发布 DAM 模型:为图像局部生成详细描述

NVIDIA 推出的 Describe Anything Model (DAM)3 是一款多模态大语言模型,它能够为图像或视频中的特定区域生成详细描述,支持通过点击、框选、涂鸦或遮罩等多种交互方式指定目标区域。

目前官方提供了在线体验 demo4(虽然有点卡卡的),实际效果还可以。

相关推荐
奈斯先生Vector32 分钟前
OpenScience 安装失败怎么办?Windows 环境、API 配置与本地服务排错指南
人工智能·windows·架构·开源·aigc·midjourney
吃旺旺雪饼的小男孩1 小时前
自动驾驶图像分割开源数据集指南(2026)
人工智能·开源·自动驾驶
deepseek231 小时前
商汤开源SenseNova U1.5 Lite拆解:8B装下原生统一多模态,NEO-Unify架构与4K图像生成的三笔工程账
开源·多模态大模型·ai agent
zzzzzz3103 小时前
react-bits:酷炫组件之外,React 页面表现力真正该怎么借力?
react.js·开源·动效
Fnetlink114 小时前
开源安全年度报告:2026上半年20大最具破坏性破坏事件深度复盘
安全·开源
xyz_CDragon14 小时前
从 RTL 到 GDSII:人与 AI 协作,用开源 EDA 工具链完成 SHA-256 芯片的 SoC 集成与签核全流程(附完整流程+代码)
人工智能·开源·芯片设计·开源 eda·caravel
CRMEB定制开发17 小时前
2026年最值得推荐的10大开源商城系统盘点
开发语言·人工智能·开源·商城系统·小程序商城
qq_2529599718 小时前
开源免费的MiniMax H3 本地部署与使用教程
开源
拼搏奋斗,无悔于青春19 小时前
私有化部署最新大模型有多难?阿里开源刚一周,我在八年前的旧显卡上跑通,还拔了网线
开源