SayIt语音输入+AI 润色 Typeless 替代品 GitHub开源语音输入法,可本地部署LLM亦可接入deepseek 或者其他大模型。

简介说明

SayIt 语音输入法说明:说话变文字,再由 AI 自动润色成可用文稿

打字慢、灵感断、和 AI 对话时输入跟不上思路,这是很多人每天都会遇到的问题。SayIt 想解决的就是这个痛点:用说话代替打字,再让 AI 把口语整理成可以直接使用的书面表达。

使用方式很简单:按下快捷键开始说话,再按一次结束。SayIt 会自动完成语音识别,并调用 AI 对内容进行润色,最后把整理好的文字直接输入到当前光标位置。无论是在聊天软件、文档、浏览器输入框,还是代码编辑器里,都可以像普通输入法一样使用。

SayIt 的核心体验可以概括为一句话:随口说,出色写。

它不是单纯把语音转成文字,而是会进一步帮你处理口语化表达。例如去掉"嗯、啊、那个"这类口头禅,修正常见识别错误,把零散表达整理成更自然的书面内容,甚至可以通过 Prompt 自定义实现翻译、分段、总结或特定写作风格。

SayIt 支持三种使用模式

本地模式

语音识别在本机运行,数据不离开设备,更适合对隐私要求较高的用户。

云 API 模式

不需要本地 GPU,可以直接对接云端 ASR 和 AI 服务,适合普通电脑快速上手。

服务器模式

支持 Docker 一键部署,可以使用 GPU 加速推理,更适合团队、公司或内网环境使用。

SayIt 的主要特点

按住说话,松开或再次触发后自动输入到任何应用。

AI 自动去除口头禅,把口语整理成更清晰的书面表达。

支持 Prompt 自定义,可以控制润色风格、输出格式、翻译方式和分段规则。

支持本地部署,也支持接入 DeepSeek、通义千问、豆包等云端模型。

Rust 构建,整体更轻量。

开源、自托管、隐私优先,适合个人和团队长期使用。

支持 AGPL-3.0 开源协议,数据流向更透明。

为什么需要 SayIt?

在 AI 时代,模型输出越来越快,但人的输入速度还是被键盘限制住了。尤其是和 AI 对话、写需求、整理想法、记录灵感时,说话往往比打字更自然,也更接近真实思考过程。

Typeless 这类工具已经让很多人感受到 AI 语音输入的效率提升,但它也有一些明显限制:价格不低,AI 润色 Prompt 不够自由,输出风格有时过于固定,部分场景下整理得太"重",不一定符合每个人的使用习惯。

SayIt 的定位更灵活一些。它既可以作为个人语音输入工具,也可以部署到团队或企业内部使用。Prompt 可以完全自定义,部署方式可以选择本地、云端或服务器,数据流向也更加透明。

SayIt 的两个核心能力

SayIt 的技术核心主要分为两部分:

语音识别,也就是 ASR。

AI 文本润色,也就是把识别出来的口语内容整理成更可用的文字。

ASR 负责把你说的话转成文本,AI 润色负责把这些文本变得更像"能直接发出去、写进文档、提交给 AI"的内容。

AI 润色能做什么?

SayIt 的 AI 润色功能不只是简单修错字,它可以通过 Prompt 自定义实现多种效果:

去除口癖词,比如"嗯、啊、那个、然后"等。

修正语音识别中的错别字和断句问题。

把口语改成自然书面语。

自动分段排版。

翻译成其他语言。

按指定风格输出,比如更正式、更简洁、更适合写邮件或更适合发给 AI。

SayIt 已经对接了国内常用 AI 服务商,包括通义千问、DeepSeek、豆包等。同时它也支持 OpenAI 兼容格式,所以也可以接入其他供应商或第三方中转服务。

语音识别模型选择

根据作者实际测试,中文语音识别效果大致可以这样排序:

豆包 > Typeless ≈ Qwen3-ASR > FunASR-Nano2512 >= FireRedASR2 > Whisper

豆包在中文语音识别上表现非常强,尤其是小声说话、轻声输入这类场景,实际体验很好。很多办公场景下并不适合大声和 AI 对话,所以"悄悄话识别"能力非常关键。

SayIt 后端部署使用的是 Qwen3-ASR。它的效果仅次于豆包,在开源模型里是比较值得选择的方案。如果部署在公司内部,配合 vLLM 做推理优化,也能获得更好的识别速度。

AI 润色模型推荐

如果你想获得比较均衡的体验,推荐使用 DeepSeek 的 deepseek-v4-flash。它的优势是质量不错、价格低、速度也能接受。

如果你对延迟非常敏感,比如希望 500ms 内返回,可以考虑通义千问 qwen3.6-flash。它速度更快,但准确度和润色质量可能略弱一些。

模型对比:

供应商 模型 短文本 长文本(约200字) 输入价格 输出价格
DeepSeek deepseek-v4-flash 803ms 2089ms 1 元/百万 Token 2 元/百万 Token
通义千问 qwen3.6-flash 393ms 1308ms 1.8 元/百万 Token 10.8 元/百万 Token

配置建议

AI 供应商建议优先使用官方 API。第三方中转站虽然方便,但延迟通常更高,稳定性也更依赖中转服务本身。

DeepSeek 推荐配置:

API 地址:https://api.deepseek.com

模型:deepseek-v4-flash

API Key 获取地址:platform.deepseek.com

适合哪些人使用?

SayIt 比较适合以下几类用户:

经常和 AI 对话,希望减少打字成本的人。

需要快速记录想法、灵感、会议要点的人。

想把口语自动整理成书面表达的内容创作者。

希望替代 Typeless,但又想要更自由 Prompt 控制的人。

对数据隐私有要求,希望自托管或本地部署的团队。

想在企业内部部署 AI 语音输入工具的开发者或管理员。

图片预览

特别注意

1.安装配置界面的时候左上角会出现请求麦克风权限提示,一旦你拒绝了该权限,那么就会用不了。

解决办法:卸载后,重新安装授权即可。

2.默认是使用服务器语音识别的模式,换本地需要在 语音引擎--工作模式 选择本地模式 然后下载对应的模型即可。

然后AI供应商也可以选择本地Ollama来整理文本。

下载地址

https://github.com/crosswk/SayIt

百度网盘 请输入提取码 提取码: 3h4g

夸克网盘分享

相关推荐
人工智能研究所1 小时前
ResearchStudio-Reel: 学术论文到海报、视频、博客的“最后一公里“
人工智能·microsoft·音视频·博客·ppt·学术论文·ai创作
小e说服饰1 小时前
2026年AI自动生成PPT工具推荐
人工智能·powerpoint
Freak嵌入式1 小时前
RP2040 内核电源调节器:软件可调电压 + 三种模式,低功耗设计的利器
人工智能·单片机·嵌入式硬件·机器人·开源
事变天下1 小时前
冲刺港三所,如何选则香港申请机构?香港留学机构对比及避坑指南
大数据·人工智能
十六年开源服务商1 小时前
WordPress邮件日志记录定制开发指南2026
运维·开源
2601_956456341 小时前
哪个品牌的学习机比较好?2026 市场调整期,步步高凭全场景 AI 实力成家庭优选
人工智能
王同学的AI学习日记1 小时前
编程用哪个AI大模型好?实测Qwen3.8和Kimi K3
人工智能·ai
FriendshipT1 小时前
Ultralytics:简要解读YOLOv8 → YOLO11 → YOLO26网络架构
人工智能·pytorch·python·深度学习·yolo·目标检测
ACP广源盛139246256732 小时前
YLB3118 存储桥接芯片完整机会点@ACP#联动曙光 8000
大数据·人工智能·分布式·单片机·嵌入式硬件