SenseVoice 音频转文字&情绪识别 - python 实现

具体代码实现如下:

python 复制代码
from funasr import AutoModel
from funasr.utils.postprocess_utils import rich_transcription_postprocess

path_audio = "emo/happy.mp3"# 音频文件
# 加载模型
model_dir = "iic/SenseVoiceSmall"
model = AutoModel(
    model=model_dir,
    trust_remote_code=True,
    remote_code="./model.py",
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
    device="cuda:0",
    cache_dir = "./ckpt"
)
# 模型预测识别
res = model.generate(
    input=path_audio,
    cache={},
    language="auto",  # "zn", "en", "yue", "ja", "ko", "nospeech"
    use_itn=True,
    batch_size_s=60,
    merge_vad=True,  #
    merge_length_s=15,
)
# text = rich_transcription_postprocess(res[0]["text"])
print("音频文件:{}".format(path_audio))
print("识别预测结果:{}".format(res[0]["text"]))

脚本运行log如下:

python 复制代码
音频文件:emo/happy.mp3
识别预测结果:<|zh|><|HAPPY|><|Speech|><|withitn|>你好,见到你很高兴。

​​​

助力快速掌握数据集的信息和使用方式。

数据可以如此美好!

相关推荐
大猪宝宝学AI13 小时前
【AI Infra】BF-PP:广度优先流水线并行
人工智能·性能优化·大模型·模型训练
Jerryhut13 小时前
Opencv总结7——全景图像拼接
人工智能·opencv·计算机视觉
5:0014 小时前
Python进阶语法
开发语言·python
Captaincc14 小时前
AI 原生下的新的社区形态会是什么
人工智能
小康小小涵14 小时前
睿抗机器人大赛魔力元宝
python·ubuntu·gitee·github
勇往直前plus14 小时前
Python 类与实例对象的内存存储
java·开发语言·python
禾叙_15 小时前
【canal】canal同步msyql到redis
android·redis·python
一直跑15 小时前
查看显卡驱动版本,查看哪个用户使用显卡(GPU)进程
linux·服务器
先做个垃圾出来………15 小时前
Python位运算及操作
java·前端·python
人工小情绪15 小时前
python报错:AttributeError: module ‘numpy‘ has no attribute ‘object‘.
python·numpy·neo4j