语音识别

smartpi_ai2 小时前
单片机·嵌入式硬件·语音识别
CI-73T 的三个串口怎么分?下载口固定的引脚账本、词条 150 条的“词数“口径与硬 PWM 控舵机的性能边界智能公元大群 5 群的一位工程师(CI-73T 消费品项目)在串口分配与词条容量上的连续追问,把 73 系列的"多串口账本"和 SU-03T 的"词条容量口径"问了个透。本篇按问题演进整理这两组答案(73T 三串口分配此前已有专文,本篇补充引脚级口径与词条长度边界)。
Niuguangshuo11 小时前
算法·语音识别
论文解读:CTC,端到端序列识别的开山之作论文:Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks(Graves et al., ICML 2006)· PDF:cs.toronto.edu/~graves/icml_2006.pdf
课件帮1 天前
人工智能·语音识别
讲题视频怎么做?课件帮AI讲题功能,自动生成板书+语音微课李老师半夜发消息说“这题我讲了三遍,学生还是没懂”上周凌晨一点,我在读者群里看到一位初中数学老师抱怨:“函数题画图讲了三遍,有学生课后来问还是说听不懂。录了个屏幕讲解视频发群里,结果画质糊、步骤跳、没重点,家长都不好意思提。”
VUILabs1 天前
人工智能·语音识别
企业审批流程接入语音 Agent,哪些边界要先定清楚企业内部审批有一个很典型的矛盾。流程设计得越规范,员工填写起来越麻烦。流程设计得太简单,财务、人事、行政、法务和业务负责人又很难判断该不该批、批到哪一步、谁来负责后续处理。
开开心心就好1 天前
前端·javascript·网络·安全·scala·erlang·语音识别
低年级识字练笔顺工具,电脑和安卓端都能用软件介绍跟我学汉字,光看名字就知道它是干嘛的——一款帮孩子学汉字的工具。它同时支持 Windows 和安卓两个平台,电脑上能用,手机上也能用。整体来说,这工具对低年级的小学生更友好一些,认字、识字、认笔画这些最基础的需求,基本都能覆盖到。
Niuguangshuo1 天前
算法·语音识别
论文解读:RNN-Transducer,端到端流式 ASR 的骨架论文:Sequence Transduction with Recurrent Neural Networks · arxiv:1211.3711
hey you~2 天前
人工智能·机器人·语音识别·智能客服·呼叫中心·转人工策略
语音机器人如何配合人工完成复杂进线服务?三种协同模式与落地要点摘要:复杂进线服务的核心矛盾在于——简单问题占用大量人力,复杂问题又需要人工的专业判断与情绪安抚。本文从路由策略、上下文传递协议、兜底机制三个维度,拆解语音机器人与人工协同的三种模式,给出可直接复用的路由判定伪代码、上下文 JSON 结构、降级兜底方案与指标口径,并附协同前后 30 天实测对比数据。全文约 4500 字,面向智能客服架构师、呼叫中心技术负责人与 AI 产品经理。
七爷数码AI2 天前
人工智能·语音识别
通知播报与作业配音:4款文字转语音工具怎么选?针对需要完成学习作业朗读、制作临时通知广播或进行短视频口播解说的场景,以下四款文字转语音工具各有侧重。它们均支持免费使用及商用(需遵守相应规约),您可以根据具体需求选择最适合的一款。
tiger8652 天前
人工智能·gpt·rnn·神经网络·自然语言处理·transformer·语音识别
深入理解状态空间模型 (SSM):RNN 与 Transformer 的优雅融合在深度学习的序列建模领域,我们长期面临一个核心问题:Transformer 的长序列建模能力很强,但计算复杂度随序列长度呈二次方增长。
angushine2 天前
人工智能·音视频·语音识别
文本转视频2由于之前的音频速度较慢,因此这里调整到1.3倍速文本转视频demo
刘广睿2 天前
人工智能·aigc·音视频·语音识别·效率工具
给素材库加语音转写:Whisper 本地部署与批量字幕生成实践凌晨两点,采访录音、口播素材、客户电话一共 37 个音频文件堆在桌面,明天早上要交带字幕的成片。你盯着文件夹发呆——一条条听、一句句敲,天亮也干不完。这时候你需要的不是更努力,而是让素材库替你把声音变成文字。
蜗牛互联网3 天前
java·人工智能·后端·语音识别
语音AI开始边听边说,改变的不只是响应速度很多语音助手并不是“听懂后回答”,而是在排队:先把语音转文字,再让大模型思考,最后把文字合成语音。你一插话,它可能还在播放上轮答案。GPT-Live-1进入API后,真正值得关注的是全双工——系统可以同时听和说,开始处理人类对话里最难写成按钮的事情:停顿、抢话、犹豫和改变主意。
shxjnpl4 天前
人工智能·语音识别·智能硬件
Qwen3-ForcedAligner-0.6B 私有化部署实战:从模型离线、Docker封装到会议原声精准回听做会议语音识别时,一个很容易被忽略的问题是:ASR识别出了文字,不等于文字已经和原始录音精确对齐。比如一场一个小时的会议,ASR输出:
AI情绪识别开源4 天前
人工智能·语音识别
检信ALLEMOTION 认知矫正能力语音识别模型拼音准确性测试报告测试日期: 2026-09-09 报告版本: V1.0一、测试概述1.1 被测模型• 模型: sherpa-onnx-zipformer-ctc-zh-int8-2025-07-03(Zipformer CTC 架构,int8 量化,仅支持中文,模型文件 367MB)
蓝速科技4 天前
运维·人工智能·科技·语言模型·自然语言处理·语音识别
涉外酒店前台双屏翻译机落地应用指南在涉外酒店的前台,每天上演的是一场场跨越语言的“微外交”。当一位拖着行李箱的外宾站在柜台前,前台员工手忙脚乱地掏出手持翻译机,对着麦克风说一句,再递过去等对方回答,这种“乒乓球式”的沟通不仅拉长了办理入住的时间,更让原本应该温馨专业的接待场景显得局促且缺乏科技感。对于追求服务品质的高端酒店而言,沟通效率的低下往往直接转化为客人体验的折扣,甚至在嘈杂的大堂环境中,因听不清、译不准而引发的误解更是屡见不鲜。而蓝速科技(larxu)推出的双屏翻译设备,正是针对这一系列痛点设计的专业解决方案。
声讯电子4 天前
语音识别·ai降噪·语音模块·回音消除·aec消回音
AU-60 全功能AI语音处理模组功能特性说明AU-60 是一款集合 USB、AI ENC、AEC、BF 等全功能于一体的语音处理模组。它可接入模拟音频设备、数字音频设备以及仅具备 USB 端口的设备,适用于全双工通话、会议、门禁、翻译、录音、监控等场景。模组采用邮票半孔封装,体积小巧,长 37.5mm、宽 16mm,支持 SMT 嵌入主板,便于快速集成。
小蒋观天下5 天前
大数据·人工智能·安全·计算机视觉·语音识别·ai大模型
社区AI智能摄像头完整选型指南住宅小区、老旧小区、安置房小区、高端洋房社区的监控环境,覆盖出入口、单元楼道、小区道路、停车场、绿化带、围墙周界、高空俯瞰全场景,聚焦社区安防核心痛点:高空抛物、电动车进梯、陌生人徘徊、消防通道占用、周界翻越、人车乱象。我们观芯从统一规范AI算法、硬件参数、夜视防护、供电传输、设备选型标准,选适配物业改造、智慧社区招投标、老旧小区智能化升级、全新小区的安防建设落地使用。
憨波个5 天前
人工智能·深度学习·语言模型·whisper·语音识别
【ASR】Whisper:Robust Speech Recognition via Large-Scale Weak Supervision相比 wav2vec 2.0 、HuBERT 和 WavLM 等自监督模型。Whisper(Radford et al.,OpenAI,2022)的想法是,互联网已经有大量音频、字幕对,能不能接受标签不够精确,以更大的规模和更多样的来源,直接训练一个能转写、能翻译的模型?
憨波个5 天前
人工智能·深度学习·语音识别
【SSL】WavLMwav2vec 2.0 和 HuBERT 作为大规模自监督预训练模型,利用少量标注微调后,可以在 ASR 任务上得到很好的效果。
smartpi_ai5 天前
人工智能·ci/cd·语音识别
空调内机做语音控制选哪颗?CI-03T 的红外码库优势、“5V 供电≠3.3V 串口“的电平误区与声学结构规范一位空调内机升级项目的硬件负责人(年量 1-3 万套)的完整选型对话,从"推荐个模块"到引脚/电平/供电细节,把空调场景的选型闭环走了一遍。厂商的两句关键答复值得单独拎出来:CI-03T"带了空调红外码库,比较方便";供电 5V 但"串口电平 3.3"。本篇以这次选型为主线,整理空调语音方案的决策要点与电平匹配的易错点。