数字人

东姬AI2 天前
ai·数字人·多模态·视频生成·语音大模型
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步过去24小时,AI行业上演了一场少见的"实时竞赛"。9月15日凌晨,谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,官方称这是其迄今最先进的对话式AI,能够在对话不中断的情况下调用工具、处理视觉信息、执行复杂任务;同一天,国内的阶跃星辰一口气放出StepAudio 3系列五款语音模型,其中Realtime版本在Artificial Analysis对话动态榜单以98.9%的综合得分排名全球第一;还是同一天,生数科技发布实时视频模型
东姬AI3 天前
数字人·语音交互·ai视频·gemini 3.8·实时视频生成
Gemini 3.8 Live凌晨登场、Vidu S2全量开放:语音与视频同周跨入实时时代,两条管线何时并成一条?9月15日深夜,生数科技发布Vidu S2双模型并在当天全量开放在线体验与API;几个小时后,也就是9月16日凌晨,谷歌发布Gemini 3.8实时对话模型,推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款型号;同一时间,阶跃星辰的StepAudio 3系列语音模型在Artificial Analysis对话动态榜上以98.9%的得分登顶全球第一。再加上智象未来9月15日发布的原生全模态视频生成模型,短短48小时内,语音和视频两条赛道几乎同时跨过了
Rocky Ding*6 天前
论文阅读·人工智能·深度学习·机器学习·aigc·数字人·ai-native
一文读懂Hallo数字人核心基础知识欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
人工智能研究所19 天前
人工智能·科技·ai·数字人
手机随手拍一段视频,AI 能还原出一个可以 360° 旋转视角的“数字人“你有没有想过,有一天,你拿手机随手拍下一段跳舞的视频,上传给AI,几分钟后,屏幕里出现的不再是那个固定角度的画面——而是一个可以任意旋转、从正面看、从背后看、从侧面看,都无比清晰的"数字人"?
VIP_CQCRE21 天前
api·数字人·ai视频·acedatacloud
用一张图和一段音频生成数字人口播视频:Ace Data Cloud Dreamina API 接入指南AI 视频正在从“好看的演示”走向“可集成的生产工具”。对很多团队来说,真正有价值的不是偶尔生成一条视频,而是把视频能力接入到自己的业务系统里:自动生成产品讲解、课程口播、营销素材、客服引导、知识库视频化内容,甚至批量生产多语言数字人短视频。
星辰徐哥23 天前
人工智能·microsoft·交互·数字人·诗词大会
诗词大会AI:基于具身交互数字人技术的国风沉浸式古诗词智能赏析平台摘要:本文分享了基于具身交互智能数字人技术,打造**古诗词沉浸式赏析平台"诗词大会AI"**的完整实战经验。从魔珐星云控制台配置古风数字人形象、诗词朗诵音色、亭台楼阁虚拟场景,到编写SSML诗词脚本生成数字人讲解视频,再到搭建Flask展示网站嵌入视频,全流程手把手教学。网站采用古风国潮主题,宣纸色渐变背景搭配朱红鎏金主色调,融合数据统计、核心能力卡片、工作流程引导等丰富页面元素,最终实现一个极具传统美学意境的具身交互智能数字人诗词赏析页面。
星辰徐哥25 天前
运维·python·自动化·交互·react·数字人
打破社媒营销信息差:具身交互智能打造全自动化KOL情报体系一位站在数据大屏旁边的情报分析助手,能看、能说、有肢体表达——这正是具身交互智能的核心。本文从魔珐星云控制台配置到 Python FastAPI + React 全栈工程源码,拆解情报平台如何以参数流 SDK 为中枢,让数字人嵌入数据采集→KOL 评分→大屏洞察→竞品监测的情报全链路。
承渊政道1 个月前
云原生·数字人·魔珐星云·glm-5.2·蓝耕元生代·播报
给云原生排障助手装上“大脑“和“身体“:蓝耘元生代MaaS×魔珐星云数字人实战当监控群里只剩一句"订单接口502",传统处理方式通常是SRE打开终端、逐条核对 Pod、Service、Endpoints,再把结论翻译成业务同学听得懂的话.问题不只是"找到根因",还包括两段很费人的转换:把散乱日志变成可审计的证据链,再把技术结论变成清晰、克制的口播.这次我做了一个"云原生故障排障数字人"小项目:蓝耘元生代 MaaS 负责模型接入和诊断推理,本地程序负责输入脱敏、结构化输出和命令安全校验,魔珐星云负责让 3D 数字人实时播报结果.最终链路不是简单改一个API地址,而是跑通了"故障证据
世优科技虚拟人1 个月前
vr·数字人·ai数字人·vr大空间·世优科技
VR大空间定制开发商业化观察,经典IP沉浸式展演撑起文旅新业态什么是VR大空间?为什么值得关注?VR大空间是基于虚拟现实、空间计算等技术打造的沉浸式体验项目,观众佩戴VR设备后可在一定面积的场地内自由行走,与虚拟世界实时交互。2026年,VR大空间不再停留在概念阶段:商圈里的沉浸式体验馆、景区里的数字化展演、博物馆里的虚拟展项,都在用真实客流检验这门生意。行业当下最关心的问题是:一个VR大空间项目如何持续产生客流、如何形成可复制的商业模式、如何在文化价值与商业回报之间找到平衡。
uncle_ll1 个月前
图像处理·数字人·语音合成
数字人JoyVASA 实战记录最近在看数字人相关内容,找到这个项目,JoyVASA 是京东健康(JD Health International Inc.)与浙江大学联合开源的扩散模型驱动的音频→肖像动画框架,论文:
豌豆学姐1 个月前
人工智能·aigc·api·数字人·异步任务
likeadmin-api 数字人任务查询实战:image_human/query 如何处理排队、完成和失败数字人接口接入后,很多项目会卡在“请求已经返回了,视频在哪里”这一步。LikeAdmin API 的全驱动数字人接口采用异步任务模型,提交接口返回任务 ID,生成结果需要通过查询接口获取。本文只讨论任务状态处理,不重复介绍素材生成效果,重点放在可重试、可追踪和不重复扣费的工程实现上。
豌豆学姐1 个月前
人工智能·aigc·api·数字人·全驱动数字人
likeadmin-api 全驱动数字人参数避坑:file_url、ref_file_url 和 mode 怎么传最近在做一条数字人口播链路时,我遇到的第一个问题不是模型效果,而是请求参数没有对齐:图片 URL 和音频 URL 的字段名容易写反,mode 又同时影响生成模式和计费档位,任务提交成功后还要把返回的任务 ID 保存下来。为了让这类接入更容易落地,本文用 LikeAdmin API 的 image_human/submit 接口拆一遍完整请求。
雨田哥1 个月前
3d·数字人·3d数字人·陪伴·数伴·成长养成·3d数伴
3D 数字人的成长养成记晚晴很多数字人项目的第一句话是:“你好,我可以为你提供帮助。”但真正让人愿意留下来的,往往不是这句标准答案,而是另一种感觉:
白拾1 个月前
数字人·音频驱动·视频生成·arxiv 2025·wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基
世优科技虚拟人1 个月前
人工智能·数字人·ai数字人·数字人一体机·数字主持人·数字人导游·数字人讲解员
从博物馆到景区,AI数字人讲解导览正成为城市文旅IP新代言在博物馆的展柜前,一位游客对着屏幕里的虚拟讲解员提问:“这件文物当年是做什么用的?”数字人微笑着回答,背后的知识库精准调出了文物档案。在景区入口,一个穿着民族服饰的虚拟形象正在招呼来往游客,推荐当天的游览路线。在科技馆的互动区,孩子们围着一个全息投影的科普讲解员,叽叽喳喳问个不停。
世优科技虚拟人2 个月前
vr·数字人·数字文旅·vr大空间·文旅ip
从西游记到山海经,VR大空间定制重塑经典文化IP文旅景区体验从《西游记》里的腾云驾雾,到《山海经》中的奇珍异兽,再到吴哥窟千年石壁上的微笑——这些曾经只存在于书本、荧幕或旅途中的文化符号,如今正被一股新的技术浪潮重新激活。VR大空间,或者更准确地说,LBE大空间(Location-Based Entertainment),正在成为连接经典文化IP与文旅景区的一座桥梁,让人们不再只是“看”,而是真正“走进去”。
MoSTChillax2 个月前
人工智能·数字人
数字人竞品分析(上):行业背景和产品定位“此前在线教育公司实习中,我注意到学生答疑存在响应不及时、内容分散等问题。为了寻找更合适的解决方案,我开始关注数字人,并由此展开了这次竞品分析。”
lipku2 个月前
python·开源·数字人·数字人直播
数字人直播开源项目LiveStream数字人直播通过 TTS(文字转语音)驱动虚拟形象说话,配合预先准备好的话术循环播放,加上 AI 自动回复弹幕,实现无人值守的 7×24 小时直播。
平头哥~2 个月前
ai·数字人
工伤认定赔偿纠纷实测 测评职场法务数字人工伤维权全流程讲解小陈是某工厂的流水线工人,去年6月在操作冲压机时左手食指被压伤。车间主任让他去了附近的诊所包扎,说"小伤,报工伤麻烦,你先休息两天,工资照发"。
武汉唯众智创2 个月前
人工智能·数字人·ai心理健康·校园心理健康解决方案·ai无感监测·具身智能计算技术·智能体通信技术
基于大语言模型的心理咨询数字人:从0到1构建一个能“共情“的AI心理陪伴助手困境具体表现AI介入价值专业资源稀缺全国持证心理咨询师约10万人,未成年人群体缺口巨大7×24h无限量服务,不受时间地点限制