音视频

不爱记笔记9 小时前
学习·ai·音视频·知识库·知识管理
上下班路上怎么消化技术视频?我把B站内容转成播客,通勤时间也能系统学习每天通勤来回将近两小时,在地铁上刷手机,B站收藏夹里一堆技术分享和行业访谈,每次打开看一眼时长就劝退了。一个 40 分钟的视频,在地铁上断断续续看,看完也记不住啥。后来我换了个思路:不看视频,改成听。😉
byte轻骑兵6 小时前
人工智能·音视频·avrcp·蓝牙耳机·蓝牙车机
【AVDTP】规范精讲[6]: 打通全流程,蓝牙音频连接背后的12步信令博弈做蓝牙音频开发这么多年,我见过最多的问题都出在信令阶段。手机连不上耳机、连上了没声音、只有单声道、切歌卡顿、暂停后无法恢复……90%的兼容性问题,本质上都是信令流程没有严格按照规范执行导致的。
qq3621967057 小时前
音视频
# 视频转文字准确率如何提升?影响识别质量的 6 个关键因素与优化技巧分析音源质量、说话人特征、专业词汇、语言模型、内容特征和后处理流程对转写准确率的影响,提供 7 个可落地的优化技巧和分层校对方法。
不爱记笔记7 小时前
人工智能·笔记·ai·音视频·飞书·obsidian
音视频转笔记工具横评2026,通义听悟、Ai好记、NotebookLM 实测对比音视频内容越来越多,但消化效率一直没跟上。市面上做音视频转笔记的工具不少,但各有侧重。通义听悟主打会议场景,NotebookLM偏研究型AI笔记,Ai好记则定位在学习场景。同样是「把音视频变成文字」,实际用下来差别不小。我拿同一个B站技术访谈视频测了三款,下面聊聊实际体验。
中微极客7 小时前
音视频
Seedance 2.5深度解析:字节跳动30秒4K视频生成模型架构与API实战# Seedance 2.5深度解析:字节跳动30秒4K视频生成模型架构与API实战## 一、背景:AI视频生成的三大瓶颈
SimpleLearingAI8 小时前
音视频·多模态大模型
生成图像/视频质量评估评估生成图像和视频的质量是生成模型(GAN、VAE、DDPM、Stable Diffusion 等)研发中的关键环节。评估指标分为主观评估和客观评估两大类。
hz567898 小时前
网络·云计算·音视频·实时音视频·信息与通信
音视频技术SDK选型指南:企业实时互动场景的关键能力解析在企业实时互动场景中,web音视频sdk 的选型涉及浏览器兼容、弱网体验、并发能力、安全合规、国产化适配、业务系统集成和长期运维成本。对于政务协同、远程评标、在线培训、远程会诊、企业客服、应急指挥等场景,音视频能力往往需要嵌入 OA、IM、业务审批、排队叫号、档案留存、监管平台等系统,因此选型应从“技术能力 + 场景适配 + 合规可控”三个维度综合评估。
paokuflying8 小时前
ffmpeg·音视频
ffmpeg提取视频中的音频听见一首好听的歌,但网上找不到资源,听不成,于是用手机录屏,再发送到电脑提取音频,再发回手机就可以听了。
zandy101111 小时前
音视频
Seedance 2.0第三方创作工具怎么选?商用视频工作流评估指南选择Seedance 2.0第三方创作工具,不能只看“能不能生成视频”,还要看它是否适合你的创作角色与交付流程。FusionAI(融艺 AI),属于面向电商、品牌与内容团队的第三方AI视觉生产工作台,可用于连接商品素材、关键画面、视频镜头和广告版本,但并非Seedance官方网站。
AI创界者1 天前
人工智能·aigc·音视频
【AI视频重塑】MoCha-GGUF 视频人物/主体替换整合包:8G显存轻量化部署与ComfyUI批量工作流详解随着 AI 视频生成与编辑技术的快速演进,视频中的“主体替换”(Subject Replacement)成为了高频需求。然而,原生模型对显存(VRAM)的要求往往让许多使用 8GB 或 12GB 消费级显卡的用户望而却步。 MoCha作为新一代视频主体替换方案,展现出了极高的时序一致性与边缘细节处理能力。为了让低显卡配置的开发者与创作者也能体验这一技术,社区将其进行了 **GGUF 格式量化**,并结合 **ComfyUI** 搭建了自动化批量处理工作流。 本文将详细介绍 MoCha-GGUF 视频主体替
小猴子爱上树1 天前
人工智能·python·音视频
一站式解决图片视频翻译难题的高效AI工具在跨境电商领域,卖家们常常面临许多痛点。首先,商品图的多语言处理是一个巨大的挑战。例如,亚马逊卖家在上架新品时,需要将商品图翻译成多种语言,以吸引不同国家和地区的消费者。传统方法不仅耗时耗力,而且容易出错。其次,制作多语言字幕视频也是一个复杂的过程,涉及到语音识别、文字翻译和时间轴对齐等多个步骤。最后,产品图片的背景处理也是一大难题,特别是对于需要批量处理的情况。这些问题严重影响了卖家的工作效率和市场竞争力。因此,一个能够高效解决这些难题的工具变得尤为重要。
Legendary_0081 天前
c语言·开发语言·音视频
LDR6500 设计指南:Type-C 音频快充二合一配件 PD 取电与插拔时序控制方案手机、平板全面取消 3.5mm 耳机孔后,Type-C 音频 + 快充二合一转接配件成为刚需,实现听歌、充电同步进行,但中小厂商开发阶段普遍遭遇三类难以解决的工程故障,造成反复改板、兼容性测试通过率低:
EasyGBS1 天前
服务器·php·音视频
ONVIF设备接入国标GB28181视频平台EasyGBS:不用国标也能一键拉流!国标GB28181是安防平台接入摄像头的标准方式,但不是所有设备都支持——大量存量摄像头NVR走的还是ONVIF协议。好消息是,EasyGBS支持ONVIF设备直接接入,而且流程比你想象的简单得多。
石臻臻的杂货铺1 天前
人工智能·音视频·blender
做 AI 视频,先让 Blender 把镜头演一遍⭐ 设为星标 · 第一时间收到推送石臻说AI 编辑:石臻导读: AI 视频现在最难的,往往不是生成一张漂亮画面,而是让人物在多个镜头里站对位置、按时做动作,镜头还得按照设计好的路线走。只靠提示词和参考图,这些关系很容易漂。
音视频牛哥1 天前
音视频·rtmp推流录像·rtmp播放端录像·rtsp播放端录像·rtsp流录制·rtmp流录制·rtsp服务器录像
SmartMediaKit 推拉流MP4录像实践:实时传输与本地留存一体化在实时音视频项目中,推流和拉流解决的是“实时传输与观看”,录像解决的则是“内容留存与事后追溯”。随着实时音视频逐渐应用于智慧安防、移动执法、工业巡检、无人机、机器人、在线教育、远程协作等场景,客户往往不再满足于单纯的“能推、能播”,而是希望在实时传输的同时,将音视频内容保存为本地文件,用于后续回放、归档、取证或业务分析。
ALINX技术博客1 天前
fpga开发·音视频
【黑金云课堂】FPGA技术教程Vitis开发:SD卡WAV文件读取音频播放实验本实验基于 FPGA 纯硬件逻辑实现无操作系统的简易音乐播放器,通过 SPI 接口读取 SD 卡数据,以裸扇区搜索方式定位 WAV 音频文件,最终驱动 WM8731 音频编解码芯片完成实时播放。方案具备纯硬件实现、低资源消耗、高实时响应的核心特点。
沐禾安信2 天前
音视频·电脑录屏
AVI 视频打不开?2026 四款转 MP4 工具封神节假日闲来无事翻出来之前用的老DV拍的旅行视频,想回忆下童年,结果却显示无法无法播放此文件,其实这不是视频坏了,是出在AVI这个格式上,今天这篇文章就用大白话告诉你:AVI 为什么这么“难搞”、为什么转成 MP4 就能搞定、以及 2026 年哪四款工具最好用。
兵叔物联2 天前
ffmpeg·音视频
基于FFmpeg的短视频自动剪辑工具前几天在快手平台发现了他的星火计划。大概就是根据官方给的短剧素材,进行二次剪辑创作,然后在该平台发布获取短视频付费/流量分红。大概看了下,做的好的账户分红还挺诱人的。
AORUO奥偌2 天前
音视频·公共广播系统·音视频系统·多媒体会议与ip广播系统·多媒体会议系统
从“拼凑”到“集成”:音视频系统如何重塑弱电智能化建设逻辑在政企办公、校园教学、产业园区、文旅景区等各类场景的弱电智能化建设中,多媒体会议系统与公共广播系统已成为两大核心配套板块。如何为不同项目匹配稳定可靠、功能完备的音视频整体方案,是工程商和采购方持续关注的重点。奥偌长期专注于音视频设备研发与生产,构建了多媒体会议系统与数字IP公共广播系统的双产品线体系,以源头厂家直供的模式,为各类工程项目提供从产品选型、方案设计到安装调试的全流程服务。
禹亮科技2 天前
音视频·视频会议系统集成·上海禹亮科技·讯飞听见多语言会议系统·poly g7500
大型国企会议室音视频集成实战:3间120㎡空间Poly G7500+LED大屏+讯飞多语言会议系统落地方案在政企智慧办公改造项目中,100㎡+大空间会议室普遍存在声场覆盖不均、远程会议兼容性差、多品牌设备联调复杂、跨国会议语言壁垒等行业痛点。相比于小型会议室一体化设备方案,大型政企会议室对系统模块化、稳定性、多场景适配性、跨平台联动能力要求极高。