NLP之文本纠错开源大模型:兼看语音大模型总结

今天我们来看开源相关进展,看两个问题。

一个是大模型用于文本纠错开源工具,有一些模型跟数据,可以做个记录。

另外,在语音方面,也有一些语音转写或者对话的大模型,也做个技术汇总,看看有哪些模型,哪些数据,哪些tokenizer。

一、大模型用于文本纠错开源工具

先看NLP进展,中文拼写和语法纠错大模型,https://github.com/TW-NLP/ChineseErrorCorrector,支持中文拼写和语法错误纠正,并开源拼写和语法错误的增强工具。

具体功能上,支持缺字漏字、错别字错误、缺少标点、错用标点、主语不明、谓语残缺、宾语残缺、其他成分残缺、虚词多余、其他成分多余、主语多余、语序不当、动宾搭配不当、其他搭配不当共 14种错误。

开放模型上,大模型训练代码,给出了多个模型,有4B、7B和1.5j几个版本,如https://huggingface.co/twnlp/ChineseErrorCorrector3-4B,具体如下:

训练数据上,使用200万纠错数据进行全量训练,适用于语法纠错和拼写纠错,也开源了数据集,数据集如下:

二、语音大模型的技术总结

语音大模型进展,Awesome-SpeechLM-Survey,涵盖了50多种语音语言模型,提供丰富的模型资源,《Recent Advances in Speech Language Models: A Survey》: https://github.com/dreamtheater123/Awesome-SpeechLM-Survey

其中重点的,可以看:

1、目前有哪些训练数据集:

2、目前对于语音的tokenizer:

3、目前主流的语音大模型:

相关推荐
威联通安全存储1 分钟前
TS-h1677AXU-RP在工程机械机器人弧焊中的部署
大数据·人工智能·python·机器人
IT_陈寒2 分钟前
Java线程池踩了个坑,任务居然默默消失了
前端·人工智能·后端
科技之门5 分钟前
存量破局・价值新生 高格办公探寻办公资产全新增长曲线
大数据·人工智能
数据皮皮侠AI7 分钟前
退市监督数据(2000-2024)
大数据·人工智能·笔记·机器学习·回归
rain_sxr7 分钟前
渲染隔离的红利与陷阱:CSS contain 与 content-visibility 实战
人工智能·content-visibility
DLYSB_9 分钟前
边缘计算时代:基于轻量级 API 与多协议抽象的“软硬协同”智能告警终端架构实践
人工智能·架构·边缘计算·报警灯
cd_9492172114 分钟前
中国机器人AI数据采集公司推荐:觅蜂科技以一站式数采方案强势出圈
人工智能·科技·机器人
m0_5474866618 分钟前
《人工智能通识》全套PPT课件2026版
人工智能·人工智能导论
XMAIPC_Robot19 分钟前
RK3588+FPGA半导体设备量产踩坑大全|发热、时序漂移、推理抖动、成像干扰、EMC干扰方案
人工智能·嵌入式硬件·fpga开发·arm+fpga