字幕视频合成

目标

音频 + 背景图 + 字幕合成硬/软字幕 MP4 视频。

实现

基于 Eclipse RCP 技术框架开发,企业级应用的技术。
核心组件

  • 前端框架:Eclipse SWT(Standard Widget Toolkit)
  • 推理后端:ONNX Runtime
  • 语音识别模型:Paraformer 等 ONNX 编码器-解码器
  • 语音活动检测:VAD 模型(Silero VAD)
  • 标点恢复模型:基于 BART 的中文标点预测模型(punctuation-zh-bart)
  • 字幕视频合成:ffmpeg

字幕视频


应用下载

相关推荐
熊猫钓鱼>_>5 天前
AI 3D 虚拟盲盒工坊:用腾讯云混元3D + TTS Skills 打造会说话的三维收藏品
人工智能·大模型·llm·agent·tts·混元3d·多skill协同
iwgh7 天前
OddASR v2.5.5 版本更新:支持指定最大说话人分离数量、优化时延
语音识别·asr·语音转写·stt·oddasr
没刮胡子21 天前
AI完全离线的ASR语音识别+TTS语音合成+大模型对话
人工智能·ai·语音识别·tts·asr
iwgh22 天前
小奥录音更新速递:v0.1.6 发布,音字对齐、转录体验大升级!
asr·语音转写·oddasr·oddminutes·小奥录音
johnny23323 天前
ONNX生态简介与实战:ONNX Runtime
onnx
大鹏的NLP博客1 个月前
深度学习模型PyTorch与ONNX数值一致性校验通用技术报告
人工智能·pytorch·深度学习·onnx
阿钱真强道1 个月前
13 YOLOv8的ONNX输出结构——9个张量如何变成检测框
目标检测·onnx·yolov8·nms·dfl
zhuweisky2 个月前
视频会议是如何实现AI会议纪要功能的?
asr·视频会议·语音转文字·会议纪要
刺猬的温驯2 个月前
Flow Matching 训练的输入分布问题:从 VAE Latent 统计性质到归一化工程实践——以 VoxFlash-TTS 为例
人工智能·语音合成·tts
weiwei228442 个月前
神经网络模型导出及开放标准格式ONNX
pytorch·onnx