SenseVoice 音频转文字&情绪识别 - python 实现

具体代码实现如下:

python 复制代码
from funasr import AutoModel
from funasr.utils.postprocess_utils import rich_transcription_postprocess

path_audio = "emo/happy.mp3"# 音频文件
# 加载模型
model_dir = "iic/SenseVoiceSmall"
model = AutoModel(
    model=model_dir,
    trust_remote_code=True,
    remote_code="./model.py",
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
    device="cuda:0",
    cache_dir = "./ckpt"
)
# 模型预测识别
res = model.generate(
    input=path_audio,
    cache={},
    language="auto",  # "zn", "en", "yue", "ja", "ko", "nospeech"
    use_itn=True,
    batch_size_s=60,
    merge_vad=True,  #
    merge_length_s=15,
)
# text = rich_transcription_postprocess(res[0]["text"])
print("音频文件:{}".format(path_audio))
print("识别预测结果:{}".format(res[0]["text"]))

脚本运行log如下:

python 复制代码
音频文件:emo/happy.mp3
识别预测结果:<|zh|><|HAPPY|><|Speech|><|withitn|>你好,见到你很高兴。

​​​

助力快速掌握数据集的信息和使用方式。

数据可以如此美好!

相关推荐
ValhallaCoder1 天前
hot100-栈
数据结构·python·算法·
MediaTea1 天前
Python:生成器表达式详解
开发语言·python
jz_ddk1 天前
[数学基础] 浅尝向量与张量
人工智能·机器学习·向量·张量
-To be number.wan1 天前
Python数据分析:SciPy科学计算
python·学习·数据分析
Dxy12393102161 天前
DataFrame数据修改:从基础操作到高效实践的完整指南
python·dataframe
孔明兴汉1 天前
大模型 ai coding 比较
人工智能
overmind1 天前
oeasy Python 115 列表弹栈用pop删除指定索引
开发语言·python
IT研究所1 天前
IT 资产管理 (ITAM) 与 ITSM 协同实践:构建从资产到服务的闭环管理体系
大数据·运维·人工智能·科技·安全·低代码·自动化
暴力求解1 天前
Linux---进程(五)进程调度
linux·运维·服务器
沐曦股份MetaX1 天前
基于内生复杂性的类脑脉冲大模型“瞬悉1.0”问世
人工智能·开源