音视频

杀生丸学AI1 小时前
深度学习·3d·音视频·transformer·三维重建·空间智能
【稀疏重建】StructSplat:基于非校准稀疏视图的可泛化3DGS图1:基于非校准稀疏视图的新视角合成的定性对比结果。我们的方法能够减少伪影、模糊现象及位移。标题:StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views 哈尔滨工业大学(深圳);大湾大学;广州云蝶科技有限公司 链接:https://structsplat.github.io
小柯南敲键盘1 小时前
人工智能·python·音视频
跨境电商图片翻译工具推荐:批量AI翻译+视频字幕+智能抠图对于很多刚起步或正在快速拓展市场的跨境卖家来说,每天处理多语言商品信息是一件相当耗时的工作。特别是做亚马逊、速卖通、Shopee等平台的卖家,上架一个新品往往需要面对以下具体难题:
martindelophy6 小时前
音视频
DeepSeek Harness 插件开发实战:用自然语言检查、修改并渲染 Timeline Studio 视频工程大模型已经可以理解复杂的视频剪辑需求,但“知道应该怎么剪”和“真正安全地修改视频工程”是两件不同的事情。
H0311169851 天前
人工智能·音视频
行测备考网课视频自动记笔记工具介绍考公考编的考生常会遇到一种情况:行测网课内容较多且分布较散,课程数量多、单节时长较长。一边听课一边手写笔记,容易出现跟不上讲解进度的情况;若只听课不做记录,课后又容易遗忘。目前市面上已有一些工具支持“看视频自动生成笔记”的功能。本文对三款相关工具进行客观介绍,供大家参考。
hhzz6 小时前
人工智能·python·深度学习·aigc·音视频
Tiger AI 平台「手势识别」功能全解析:从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开;双手比划,机器秒懂从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开。大家好,我是 Tiger。
DogDaoDao4 小时前
音视频·实时音视频·视频编解码·流媒体·h266·vvc·视频编解码标准
【H266/VVC提案解读】ITU-T H.274 (V4) 规范深度解读 — 视频编码 SEI 消息的全面演进规范编号: ITU-T H.274 (01/2026) | 对应标准: ISO/IEC 23002-7 | 来源文档: JVET-AR0041-v2
平原20187 小时前
音视频
LTX-2.5 22B 本地部署:ModelScope 下载、8 步推理与图生视频命令LTX-2.5 是 Lightricks 开放权重的 22B 音画生成模型,可根据文本、图片和视频条件生成同步音画。本文把模型变化、AutoDL 环境安装、ModelScope 权重下载、Distilled 文生视频、首帧图生视频和平台接入边界整理到一篇可执行的记录中。
淡淡的香烟7 小时前
android·物联网·音视频
Android视频直播播放器简单封装基于 libVLC 的 Android 视频播放器封装,专用于 IoT场景下的 RTSP/RTMP/HTTPS 视频直播流播放。
程序员老陆5 天前
ffmpeg·音视频
FFmpeg中根据枚举获取名称的相关函数总结,例如av_get_sample_fmt_name和avcodec_get_name等目录一、音频类二、视频 / 像素格式类三、Codec / Media 类型(avcodec)四、错误码 / 状态(调试必用)
show43318 小时前
小程序·ocr·音视频
2026视频处理小程序技术选型指南:链接解析+OCR+ASR+AI配音多引擎对比视频处理类工具的成熟形态,已从单一转写功能演进为链接解析、OCR、ASR、AI配音多引擎的组合体。四类引擎各司其职:链接解析负责媒体流获取,OCR 处理画面内文字,ASR 处理音轨转写,AI 配音完成文本到语音的合成。选型的核心问题,不是单点能力孰优孰劣,而是多引擎在统一调度下能否协同工作。
点云-激光雷达-Slam-三维牙齿1 天前
音视频
批量音频转文本 ASR 目前中文识别效果最好的qwen3 模型把这个音频转成文字的软件更新了一个版本,用上了目前中文语音识别效果最好的qwen3 模型作为一个业余的软件开发爱好者,我又捣鼓了一个有意思的小东西 ,使用完全免费哈
昨日之日200619 小时前
人工智能·音视频
LTX-2.5:更清晰、更可控、同步音画、多镜头连贯的AI视频神器LTX-2.5 是 Lightricks(LTX)发布的开源“世界模型”(open world model)。 它主要用来生成高质量、带同步音频的视频,输入可以是文字、图片、视频或音频。简单说,就是一个能同时产出画面和声音的 AI 视频生成工具,而且支持本地部署,不依赖云端 API 计费。 主要特点 原生多镜头生成:一次就能生成多个连贯镜头(比如远景→中景→特写),人物、环境、光线、声音风格都能保持一致,不用再手动拼接。 画面更清晰、细节更好:新的扩散视频解码器让人脸、纹理、屏幕文字更锐利,运动更自然,伪
小柯南敲键盘1 天前
人工智能·python·音视频
跨马翻译:跨境电商批量图片翻译与视频字幕一站式工具作为一名亚马逊或Shopify卖家,你是否经常面临这样的困扰:店铺准备上架新品时,产品图需要翻译成英语、德语、日语等多种语言,几十甚至上百张图片如果全部交给人工处理,不仅费用高昂,而且耗时漫长。一张商品图的人工翻译加修图成本通常在10-30元,200张图就是数千元的支出,还要等上一周时间。
cdprinter1 天前
自动化·音视频
信刻——留置谈话音视频数据集中自动刻录归档解决方案随着信息技术迅猛发展,借助现代科技手段赋能,能够有效助推办案质效提升。纪委谈话、讯问、留置等业务场景产生的音视频数据需要刻录光盘安全存储、并及时归档,以备后期溯源备查。但基于纪检监察机关的特殊性,应对视频刻录打印光盘进行严格安全管控,应保障非案管人员不接触已刻录打印光盘,既防范光盘封面及内容信息的泄漏,也杜绝光盘被替换、错取、漏取的事件发生,实现办案或留置过程的全程安全管控、全程可审计。现已成为当前亟待解决的重要问题。 专业一体化厂商 信刻聚焦纪委行业留置室24小时多介质备份归档、谈话光盘集中刻录备份、跨
weixin_446260851 天前
学习·音视频
AVA-Encoder:面向智能体原生视频表征学习框架arXiv:2608.12313v1当前创意智能体难以从成熟人类影视作品中学习创作逻辑,核心瓶颈是缺少一套智能体原生结构化视频表征:该表征需要同时完整留存影片细节、适配大模型推理、支持灵活编辑。本文提出AVA-Encoder(智能体原生视频自编码框架),将原始视频转换为知识图谱(K(\mathcal{G}))表征并实现完整视频重建。 该图谱以分层文本节点为核心,配套多媒体素材存储层;通过分类边记录剧情、人物、镜头、音视频之间的关联关系,天然支持智能体查询、修改、复用。基于重建误差设计双循环文本梯度优化机制
美狐美颜sdk1 天前
大数据·人工智能·音视频·美颜sdk·美颜api
直播APP开发技术架构解析:从音视频流到第三方美颜SDK接入的完整方案随着移动互联网、短视频以及直播电商行业的持续发展,直播APP已经成为企业连接用户、打造私域流量以及实现商业变现的重要工具。从娱乐直播到知识分享,从品牌营销到直播带货,一个成熟的直播平台背后,都离不开稳定、高效、安全的技术架构支撑。
阿童木写作1 天前
python·音视频
跨境电商图片翻译工具推荐:跨马翻译批量处理视频字幕与抠图在全球电商蓬勃发展的今天,越来越多的卖家开始将目光投向海外市场。然而,当您精心准备了数百款产品,准备在亚马逊、Shopee或Lazada等平台大展拳脚时,一个现实问题摆在眼前:如何将商品图片中的中文文案、包装说明快速翻译成目标市场的语言?同时,产品视频里的字幕该怎么办?产品图的背景杂乱又该如何处理?这些看似琐碎的环节,却常常让运营团队焦头烂额。
奈斯先生Vector1 天前
人工智能·重构·架构·prompt·aigc·音视频
AI 视频不是会动的图片:用 Shot Contract、时间码与音画质检构建可交付流水线一次 45 秒的产品短片项目里,团队生成了 18 个看起来都不错的镜头。单独暂停检查,每个画面都能用:产品材质清楚、人物五官完整、光线也符合品牌调性。真正放进剪辑时间线后,问题同时暴露出来:主角在相邻镜头里换了耳饰,产品旋钮从左侧跳到右侧,24 fps 的素材被当作 25 fps 解释,台词比口型早了四帧,环境声在每个切点重新起奏。画面质量并不差,但它不是一条能够交付的视频。
ai产品老杨1 天前
人工智能·音视频
AI视频分析并发优化参数配置说明在 AI 视频分析平台(如智慧园区、AI安全生产、明厨亮灶、智慧工地等)部署落地过程中,并发路数上限不足与画面/告警延迟偏高是交付阶段最常遇见的性能瓶颈。
怪奇云呼军1 天前
java·人工智能·python·算法·云计算·音视频
G.711、Opus 和重采样会拖慢识别吗?闪电智能VoiceAgent 的音频入口怎么选电话接入后,很多 Voice Agent 的日志会出现一个很整齐的时间:RTP 首包到了,几十毫秒后 ASR 才收到首帧。于是团队开始争论,问题是不是 G.711 太旧、Opus 更快,还是把 8 kHz 升到 16 kHz 本身拖慢了识别。