语音识别

心运软件2 天前
人工智能·语音识别
Heard 语音转文字高效应用场景指南在处理跨国项目会议录音时,最让人头疼的往往不是听不懂,而是听完后面对长达数小时的音频文件无从下手。想象一下,一场涉及中、英、日三种语言的线上研讨会结束后,你手里只有一段混杂着不同口音、背景噪音以及即兴插话的原始录音。传统的人工整理方式不仅耗时巨大,而且极易遗漏关键决策点或技术细节。对于需要频繁处理播客素材的内容创作者,或是需要归档大量学术讲座的研究人员来说,这种低效的信息流转方式已经成为制约生产力提升的瓶颈。
没刮胡子2 天前
人工智能·ai·语音识别·tts·asr
AI完全离线的ASR语音识别+TTS语音合成+大模型对话完全离线的 语音识别 + 语音合成 + 大模型对话 一体化桌面应用。 说话 🎙️ → 识别成文字 → 大模型回答 → 语音朗读 🔊,全流程本地运行,隐私安全。
怪奇云呼军2 天前
开发语言·人工智能·网络协议·算法·语音识别·web app
闪电智能 Voice Agent 怎样根据语速、停顿和追问方式切换话术?策略引擎拆解一段电话刚结束,系统拿到一组看似很有用的事件:用户在 12 秒内连续追问两次、说话速度偏快、上一轮回答被打断。最容易写出的规则是:fast_speech -> 简短回答。
smartpi_ai2 天前
人工智能·语音识别·xcode
离线语音识别的“数字变量“限制:为什么不能识别“20.5度“?版本:v1.0 | 发布日期:2026-02-28 难度等级:初级 适用问题:离线语音模组无法识别动态数值 素材来源:技术交流群真实案例(2026-02-27)
sramdram3 天前
人工智能·语音识别·语音识别芯片·离线语音识别芯片
离线语音识别芯片_低功耗智能语音识别IC解决方案在智能家居、智能穿戴、无线遥控等轻量化智能设备场景中,无需联网、低功耗、高稳定的本地语音交互需求持续攀升。AT68xx系列作为高性能离线语音识别芯片,是专为终端设备打造的智能语音芯片与离线语音识别芯片解决方案核心硬件,依托成熟的嵌入式架构与自研神经网络算法,摆脱云端依赖,可本地完成语音采集、降噪、识别与指令响应,适配各类小型智能硬件的语音升级需求。
声讯电子3 天前
语音识别·spi·ai降噪·usb接口·回音消除·波束定向
把喇叭贴在麦克风边上,还能全双工通话?——AU-60把“不可能”变成了“常规操作”——硬件工程师与音频算法工程师的“减负”利器在嵌入式音频产品的研发中,我们常常陷入这样的困境:麦克风拾音距离不够、喇叭音量一大就啸叫、环境噪声比人声还突出、结构受限导致麦克风和喇叭无法物理隔离……这些问题往往不是靠换一颗Codec或调一版EQ就能解决的,它们涉及的是前端信号处理(AFE)与算法融合的系统级难题。
大鱼>4 天前
gpt·whisper·语音识别
Whisper+GPT-SoVITS:语音识别到音色克隆的全链路实战语音 AI 正在经历爆发式增长。OpenAI 开源的 Whisper 实现了接近人类的语音识别能力,而 GPT-SoVITS 等音色克隆技术让"复制一个人的声音"成为现实。
2601_958352904 天前
人工智能·语音识别·dsp模组
语音模组选型:模拟、数字、USB、I²S接口如何取舍?AU-60 同时支持四种接口的硬件方案解析做语音通话产品时,接口选型往往比芯片选型更让人头疼——模拟音频怕干扰、I²S 要配时序、USB 免驱但灵活性受限、数字麦克风 PDM 格式还得配专用 codec。四种接口各有各的坑,能不能用一个模组把这些问题一次性解决?本文从接口特性对比出发,结合 AU-60 全功能AI语音处理模组的十种工作模式,给出一份实用的选型与设计指南。
国服第二切图仔4 天前
人工智能·语音识别·gpass x 百宝箱·蚂蚁
LabGuide (Pip) 的 【GPASS x 百宝箱】参赛获奖之路前言 7 月 18 日,蚂蚁在上海举办的【GPASS x 百宝箱】AI 眼镜智能体开发者大赛线下路演,我们团队的LabGuide(Pip)——基础医学实验 AI 眼镜智能助手,斩获银奖。
kingcjh974 天前
人工智能·语音识别
手搓语音识别异步处理H5农户表单自动录入系统 · 移动端 H5 应用 版本:T2(2026-07-20) 适用场景:巡检员移动端表单录入
OpenApi.cc4 天前
人工智能·深度学习·目标检测·自然语言处理·语音识别
Mocode 开发文档平台Mocode Docs Platform探索 Mocode 编程语言,从基础语法到高级特性
pla888888884 天前
人工智能·语音识别
热词驱动,智辨声纹——从ASR热词到说话人日志的尝试:海光DCU环境部署FunASR热词语音识别系统(说话人日志已集成,含完整代码)一、引言语音识别技术正在经历从“语音转文字”到“语音理解”的深刻演进。在实际业务场景中,仅仅把音频转成文字往往是不够的——会议记录需要区分“谁在何时说了什么”,智能客服需要精准识别专业术语和人名地名,影视剧分析需要对话角色标注。这些需求催生了两个关键技术方向:热词定制(Hotword Boosting) 和说话人日志(Speaker Diarization) 。
空中湖5 天前
人工智能·spring·语音识别
Spring AI 多模态实战:让 AI 看图、听声音、生成图片本文是《Spring AI 实战》系列第 13 章。前面 12 章我们一直在和文字打交道:文字输入、文字输出、文字检索、文字生成。但现实世界远不止文字——用户拍一张产品图发过来问"这个颜色有其他款吗?"、客服接到一段语音投诉、运营需要一张宣传海报。这些场景都需要 AI 具备多模态能力:能看图、能听声、能生成图片。本章详解 Spring AI 对多模态的四大能力支持,并通过一个"多模态智能助手"把所有能力串起来。
怪奇云呼军6 天前
人工智能·科技·ai·语音识别
闪电智能Voice Agent:ASR 首字延迟和最终识别延迟怎么测?t0-t3 埋点实战适用范围:中文电话客服、AI 语音客服、Voice Agent 中的流式 ASR 链路。 运行环境:Python 3.11;核心示例仅依赖标准库,单元测试使用 pytest。 本文提供一套可复制的埋点口径、日志结构和统计脚本;不提供未经真实业务链路验证的“平均延迟”数据。
声讯电子8 天前
人工智能·语音识别
车载对讲语音方案升级:AI降噪如何让车队通信从吼变成说在车队通信、工程车辆调度、物流配送等场景中,对讲语音质量直接关系到调度效率和行车安全。传统车载对讲设备在高噪环境下(发动机轰鸣、风噪、胎噪)往往只能靠吼——驾驶员扯着嗓子喊,对方依然听不清。
ai_coder_ai7 天前
人工智能·自动化·语音识别
在自动化脚本中如何实现播音?当需要播放特定的音频文件(如提示音、背景音乐、录音回放等)时,应使用 audio 对象。该对象提供了播放与停止两个核心方法。
BOTTLE_平7 天前
人工智能·机器学习·分类·语音识别
AI认知篇:AI是什么 与 核心分类体系很多人一提到AI,脑子里蹦出来的还是那个能陪你聊天、写诗作画的“聊天机器人”。但在2026年的今天,这种认知已经严重滞后了。现在的AI,早已从“被动回答问题的工具”进化成了“主动帮你办事的数字员工”。
声讯电子7 天前
人工智能·语音识别
录音笔AI降噪方案:从录得到到听得清的听觉革命录音笔这个品类存在了几十年,但录音质量和实际听感之间的鸿沟从未被真正填平——会议录音回放时,翻纸声、空调声、远处的人声混杂在一起,关键发言淹没在噪声中;采访录音在户外录制,风声和车流声盖过了受访人话音。传统录音笔的 录得到和用户的听得清之间,差的是一个 AI 降噪语音模组。## 一、录音笔的音频痛点1. 环境噪声污染:会议场景的空调噪声(40-50 dB)、翻纸声、椅子拖动声,户外采访的风声、交通噪声,这些噪声对后期回放体验影响巨大2. 远场拾音衰减:录音笔通常放在桌面或手持,距离发言人1-3米,语音信号
土星云SaturnCloud8 天前
服务器·人工智能·ai·边缘计算·语音识别
MP_SENet轻量语音降噪模型在土星云边缘设备的部署实战边缘语音交互、工业音频监测等场景对端侧降噪的需求持续增长,云端方案存在延迟高、隐私风险等问题。MP_SENet以仅2M参数量实现了顶尖降噪效果,天然适配边缘部署。本文基于土星云BM1684X架构设备,完整讲解模型原理、环境搭建、Python推理部署与性能实测。
hey you~8 天前
人工智能·机器人·语音识别
2026出海语音机器人全栈选型:从ASR引擎评测到GDPR合规落地随着中国企业出海浪潮的加速,语音机器人在海外客服、营销外呼、多语种通知等场景的需求呈现爆发式增长。然而,出海语音机器人并非简单的“国内方案+翻译接口”,而是面临着多语种ASR准确率、跨文化对话逻辑、国际通信合规三大核心技术挑战。