数字人

uncle_ll3 天前
图像处理·数字人·语音合成
数字人JoyVASA 实战记录最近在看数字人相关内容,找到这个项目,JoyVASA 是京东健康(JD Health International Inc.)与浙江大学联合开源的扩散模型驱动的音频→肖像动画框架,论文:
豌豆学姐6 天前
人工智能·aigc·api·数字人·异步任务
likeadmin-api 数字人任务查询实战:image_human/query 如何处理排队、完成和失败数字人接口接入后,很多项目会卡在“请求已经返回了,视频在哪里”这一步。LikeAdmin API 的全驱动数字人接口采用异步任务模型,提交接口返回任务 ID,生成结果需要通过查询接口获取。本文只讨论任务状态处理,不重复介绍素材生成效果,重点放在可重试、可追踪和不重复扣费的工程实现上。
豌豆学姐8 天前
人工智能·aigc·api·数字人·全驱动数字人
likeadmin-api 全驱动数字人参数避坑:file_url、ref_file_url 和 mode 怎么传最近在做一条数字人口播链路时,我遇到的第一个问题不是模型效果,而是请求参数没有对齐:图片 URL 和音频 URL 的字段名容易写反,mode 又同时影响生成模式和计费档位,任务提交成功后还要把返回的任务 ID 保存下来。为了让这类接入更容易落地,本文用 LikeAdmin API 的 image_human/submit 接口拆一遍完整请求。
雨田哥8 天前
3d·数字人·3d数字人·陪伴·数伴·成长养成·3d数伴
3D 数字人的成长养成记晚晴很多数字人项目的第一句话是:“你好,我可以为你提供帮助。”但真正让人愿意留下来的,往往不是这句标准答案,而是另一种感觉:
白拾9 天前
数字人·音频驱动·视频生成·arxiv 2025·wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基
世优科技虚拟人16 天前
人工智能·数字人·ai数字人·数字人一体机·数字主持人·数字人导游·数字人讲解员
从博物馆到景区,AI数字人讲解导览正成为城市文旅IP新代言在博物馆的展柜前,一位游客对着屏幕里的虚拟讲解员提问:“这件文物当年是做什么用的?”数字人微笑着回答,背后的知识库精准调出了文物档案。在景区入口,一个穿着民族服饰的虚拟形象正在招呼来往游客,推荐当天的游览路线。在科技馆的互动区,孩子们围着一个全息投影的科普讲解员,叽叽喳喳问个不停。
世优科技虚拟人17 天前
vr·数字人·数字文旅·vr大空间·文旅ip
从西游记到山海经,VR大空间定制重塑经典文化IP文旅景区体验从《西游记》里的腾云驾雾,到《山海经》中的奇珍异兽,再到吴哥窟千年石壁上的微笑——这些曾经只存在于书本、荧幕或旅途中的文化符号,如今正被一股新的技术浪潮重新激活。VR大空间,或者更准确地说,LBE大空间(Location-Based Entertainment),正在成为连接经典文化IP与文旅景区的一座桥梁,让人们不再只是“看”,而是真正“走进去”。
MoSTChillax18 天前
人工智能·数字人
数字人竞品分析(上):行业背景和产品定位“此前在线教育公司实习中,我注意到学生答疑存在响应不及时、内容分散等问题。为了寻找更合适的解决方案,我开始关注数字人,并由此展开了这次竞品分析。”
lipku21 天前
python·开源·数字人·数字人直播
数字人直播开源项目LiveStream数字人直播通过 TTS(文字转语音)驱动虚拟形象说话,配合预先准备好的话术循环播放,加上 AI 自动回复弹幕,实现无人值守的 7×24 小时直播。
平头哥~1 个月前
ai·数字人
工伤认定赔偿纠纷实测 测评职场法务数字人工伤维权全流程讲解小陈是某工厂的流水线工人,去年6月在操作冲压机时左手食指被压伤。车间主任让他去了附近的诊所包扎,说"小伤,报工伤麻烦,你先休息两天,工资照发"。
武汉唯众智创1 个月前
人工智能·数字人·ai心理健康·校园心理健康解决方案·ai无感监测·具身智能计算技术·智能体通信技术
基于大语言模型的心理咨询数字人:从0到1构建一个能“共情“的AI心理陪伴助手困境具体表现AI介入价值专业资源稀缺全国持证心理咨询师约10万人,未成年人群体缺口巨大7×24h无限量服务,不受时间地点限制
西安老张(AIGC&ComfyUI)1 个月前
aigc·音视频·数字人·comfyui
第027章:ComfyUI视频制作LTX-2.3模型(文生视频)通过前面的文章,我们已经可以通过Z-Image去生成模特图片、通过Qwen3-TTS和Index-TTS2去设计模特音色并生成相应的音频。
wei_shuo1 个月前
数字人·具身交互智能
从零搭建枕月・MBTI人格分析师:魔珐星云具身交互智能数字人机身交互智能开发实战摘要:具身交互智能是当下AI应用的重要方向,本文详细介绍如何基于魔珐星云XmovAvatar SDK的参数流架构,使用Qoder AI编程工具从零搭建一个面向MBTI性格分析场景的具身交互智能数字人应用——枕月・MBTI人格类型分析师。文章涵盖环境搭建、SDK配置、LLM大模型对接、ASR语音识别集成等完整开发流程,并深入解析流式对话、首句即播报、实时打断、字幕跟随等核心交互机制的实现原理。通过本文,读者可以快速掌握企业级数字人应用的开发技巧,打造出一个响应延迟 < 500ms、支持双模交互(文字+语音)
西安老张(AIGC&ComfyUI)2 个月前
aigc·音视频·数字人·comfyui
第021章:ComfyUI文生音频Qwen3-TTS模型数字人音色设计(一)在第019章里我们生成了一个数字人模特“小一”,本来想着先通过给“小一”换装、换背景,来个大家讲一下图像编辑模型的使用。
RTC实战笔记2 个月前
音视频·数字人·rtc·数字人接入
实时互动数字人怎么做,才不是一个只会说话的视频?过去大家说数字人,更多是在问口播、短视频、直播间素材、品牌宣传片。现在越来越多需求变成了:用户能不能直接问问题?数字人能不能实时回答?能不能接知识库?能不能在展厅、App、网页、客服入口里直接互动?这两类需求看起来都叫“数字人”,技术实现却不是一回事。如果只是口播视频,本质是内容生成链路;如果要实时问答,本质是实时互动系统。后者不只需要一个形象,还需要语音、网络、知识库、大模型、音视频流、业务流程和异常兜底一起工作。
兜里只有三分钱~2 个月前
数学建模·数字人·数字
快递索赔场景评测|魔珐星云职场法务数字人线下落地实测本次测试落地于社区便民服务站、快递驿站,聚焦快递丢损、理赔纠纷高频民生问题,完成魔珐星云法务数字人实地测试,记录真实落地数据与使用效果。
wei_shuo2 个月前
数字人
基于魔珐星云打造的心理咨询师数字人:情绪疏导、压力管理、语音随时交互心理健康问题正在成为现代人的隐形杀手。工作压力、人际冲突、情感困扰,很多人独自承受却无处倾诉。找心理咨询师?费用高昂、预约困难、还要担心隐私问题。心理咨询师数字人的出现,正是要打破这些障碍,让心理支持触手可及。
lipku2 个月前
python·开源·数字人·vllm·实时数字人
LiveTalking 更新:集成 vLLM-Omni TTS服务LiveTalking 最近完成了一次重要的基础设施升级——引入 vLLM-Omni 作为 TTS 推理引擎,并在单张 RTX 3090 上实现了 130ms 首包延迟、13GB 显存占用的流式语音合成。本文从技术角度梳理这次更新的设计思路与实现细节。
wei_shuo2 个月前
数字人
基于魔珐星云打造的金融理财顾问数字人:投资理财、财务规划、语音随时交互理财是一门学问,但专业理财顾问的门槛让很多人望而却步——高昂的咨询费、复杂的金融术语、难以判断的建议可靠性。金融理财顾问数字人的出现,正是要打破这些壁垒,让每个人都能获得客观专业的理财指导。
武子康3 个月前
人工智能·python·深度学习·ai·数字人
调查研究-155 Open-LLM-VTuber 本地部署与互动实战指南在本地搭建一个能听、能说、有形象的 AI 数字人,曾经是只有大型实验室才能玩转的黑科技。但随着开源社区的爆发式增长,现在只要有一台配置尚可的个人电脑,普通开发者也能在几个小时内让虚拟角色“活”起来。很多同学在尝试过程中,往往卡在环境依赖的迷宫里,或者模型加载后迟迟无法开口,甚至因为显存溢出导致程序直接崩溃。这些痛点不仅消磨热情,更让人误以为本地部署高不可攀。