简介说明SayIt 语音输入法说明说话变文字再由 AI 自动润色成可用文稿打字慢、灵感断、和 AI 对话时输入跟不上思路这是很多人每天都会遇到的问题。SayIt 想解决的就是这个痛点用说话代替打字再让 AI 把口语整理成可以直接使用的书面表达。使用方式很简单按下快捷键开始说话再按一次结束。SayIt 会自动完成语音识别并调用 AI 对内容进行润色最后把整理好的文字直接输入到当前光标位置。无论是在聊天软件、文档、浏览器输入框还是代码编辑器里都可以像普通输入法一样使用。SayIt 的核心体验可以概括为一句话随口说出色写。它不是单纯把语音转成文字而是会进一步帮你处理口语化表达。例如去掉“嗯、啊、那个”这类口头禅修正常见识别错误把零散表达整理成更自然的书面内容甚至可以通过 Prompt 自定义实现翻译、分段、总结或特定写作风格。SayIt 支持三种使用模式本地模式语音识别在本机运行数据不离开设备更适合对隐私要求较高的用户。云 API 模式不需要本地 GPU可以直接对接云端 ASR 和 AI 服务适合普通电脑快速上手。服务器模式支持 Docker 一键部署可以使用 GPU 加速推理更适合团队、公司或内网环境使用。SayIt 的主要特点按住说话松开或再次触发后自动输入到任何应用。AI 自动去除口头禅把口语整理成更清晰的书面表达。支持 Prompt 自定义可以控制润色风格、输出格式、翻译方式和分段规则。支持本地部署也支持接入 DeepSeek、通义千问、豆包等云端模型。Rust 构建整体更轻量。开源、自托管、隐私优先适合个人和团队长期使用。支持 AGPL-3.0 开源协议数据流向更透明。为什么需要 SayIt在 AI 时代模型输出越来越快但人的输入速度还是被键盘限制住了。尤其是和 AI 对话、写需求、整理想法、记录灵感时说话往往比打字更自然也更接近真实思考过程。Typeless 这类工具已经让很多人感受到 AI 语音输入的效率提升但它也有一些明显限制价格不低AI 润色 Prompt 不够自由输出风格有时过于固定部分场景下整理得太“重”不一定符合每个人的使用习惯。SayIt 的定位更灵活一些。它既可以作为个人语音输入工具也可以部署到团队或企业内部使用。Prompt 可以完全自定义部署方式可以选择本地、云端或服务器数据流向也更加透明。SayIt 的两个核心能力SayIt 的技术核心主要分为两部分语音识别也就是 ASR。AI 文本润色也就是把识别出来的口语内容整理成更可用的文字。ASR 负责把你说的话转成文本AI 润色负责把这些文本变得更像“能直接发出去、写进文档、提交给 AI”的内容。AI 润色能做什么SayIt 的 AI 润色功能不只是简单修错字它可以通过 Prompt 自定义实现多种效果去除口癖词比如“嗯、啊、那个、然后”等。修正语音识别中的错别字和断句问题。把口语改成自然书面语。自动分段排版。翻译成其他语言。按指定风格输出比如更正式、更简洁、更适合写邮件或更适合发给 AI。SayIt 已经对接了国内常用 AI 服务商包括通义千问、DeepSeek、豆包等。同时它也支持 OpenAI 兼容格式所以也可以接入其他供应商或第三方中转服务。语音识别模型选择根据作者实际测试中文语音识别效果大致可以这样排序豆包 Typeless ≈ Qwen3-ASR FunASR-Nano2512 FireRedASR2 Whisper豆包在中文语音识别上表现非常强尤其是小声说话、轻声输入这类场景实际体验很好。很多办公场景下并不适合大声和 AI 对话所以“悄悄话识别”能力非常关键。SayIt 后端部署使用的是 Qwen3-ASR。它的效果仅次于豆包在开源模型里是比较值得选择的方案。如果部署在公司内部配合 vLLM 做推理优化也能获得更好的识别速度。AI 润色模型推荐如果你想获得比较均衡的体验推荐使用 DeepSeek 的 deepseek-v4-flash。它的优势是质量不错、价格低、速度也能接受。如果你对延迟非常敏感比如希望 500ms 内返回可以考虑通义千问 qwen3.6-flash。它速度更快但准确度和润色质量可能略弱一些。模型对比供应商模型短文本长文本约200字输入价格输出价格DeepSeekdeepseek-v4-flash803ms2089ms1 元/百万 Token2 元/百万 Token通义千问qwen3.6-flash393ms1308ms1.8 元/百万 Token10.8 元/百万 Token配置建议AI 供应商建议优先使用官方 API。第三方中转站虽然方便但延迟通常更高稳定性也更依赖中转服务本身。DeepSeek 推荐配置API 地址https://api.deepseek.com模型deepseek-v4-flashAPI Key 获取地址platform.deepseek.com适合哪些人使用SayIt 比较适合以下几类用户经常和 AI 对话希望减少打字成本的人。需要快速记录想法、灵感、会议要点的人。想把口语自动整理成书面表达的内容创作者。希望替代 Typeless但又想要更自由 Prompt 控制的人。对数据隐私有要求希望自托管或本地部署的团队。想在企业内部部署 AI 语音输入工具的开发者或管理员。图片预览特别注意1.安装配置界面的时候左上角会出现请求麦克风权限提示一旦你拒绝了该权限那么就会用不了。解决办法:卸载后重新安装授权即可。2.默认是使用服务器语音识别的模式换本地需要在 语音引擎--工作模式 选择本地模式 然后下载对应的模型即可。然后AI供应商也可以选择本地Ollama来整理文本。下载地址https://github.com/crosswk/SayIt百度网盘 请输入提取码 提取码: 3h4g夸克网盘分享
SayIt语音输入+AI 润色 Typeless 替代品 GitHub开源语音输入法,可本地部署LLM亦可接入deepseek 或者其他大模型。
简介说明SayIt 语音输入法说明说话变文字再由 AI 自动润色成可用文稿打字慢、灵感断、和 AI 对话时输入跟不上思路这是很多人每天都会遇到的问题。SayIt 想解决的就是这个痛点用说话代替打字再让 AI 把口语整理成可以直接使用的书面表达。使用方式很简单按下快捷键开始说话再按一次结束。SayIt 会自动完成语音识别并调用 AI 对内容进行润色最后把整理好的文字直接输入到当前光标位置。无论是在聊天软件、文档、浏览器输入框还是代码编辑器里都可以像普通输入法一样使用。SayIt 的核心体验可以概括为一句话随口说出色写。它不是单纯把语音转成文字而是会进一步帮你处理口语化表达。例如去掉“嗯、啊、那个”这类口头禅修正常见识别错误把零散表达整理成更自然的书面内容甚至可以通过 Prompt 自定义实现翻译、分段、总结或特定写作风格。SayIt 支持三种使用模式本地模式语音识别在本机运行数据不离开设备更适合对隐私要求较高的用户。云 API 模式不需要本地 GPU可以直接对接云端 ASR 和 AI 服务适合普通电脑快速上手。服务器模式支持 Docker 一键部署可以使用 GPU 加速推理更适合团队、公司或内网环境使用。SayIt 的主要特点按住说话松开或再次触发后自动输入到任何应用。AI 自动去除口头禅把口语整理成更清晰的书面表达。支持 Prompt 自定义可以控制润色风格、输出格式、翻译方式和分段规则。支持本地部署也支持接入 DeepSeek、通义千问、豆包等云端模型。Rust 构建整体更轻量。开源、自托管、隐私优先适合个人和团队长期使用。支持 AGPL-3.0 开源协议数据流向更透明。为什么需要 SayIt在 AI 时代模型输出越来越快但人的输入速度还是被键盘限制住了。尤其是和 AI 对话、写需求、整理想法、记录灵感时说话往往比打字更自然也更接近真实思考过程。Typeless 这类工具已经让很多人感受到 AI 语音输入的效率提升但它也有一些明显限制价格不低AI 润色 Prompt 不够自由输出风格有时过于固定部分场景下整理得太“重”不一定符合每个人的使用习惯。SayIt 的定位更灵活一些。它既可以作为个人语音输入工具也可以部署到团队或企业内部使用。Prompt 可以完全自定义部署方式可以选择本地、云端或服务器数据流向也更加透明。SayIt 的两个核心能力SayIt 的技术核心主要分为两部分语音识别也就是 ASR。AI 文本润色也就是把识别出来的口语内容整理成更可用的文字。ASR 负责把你说的话转成文本AI 润色负责把这些文本变得更像“能直接发出去、写进文档、提交给 AI”的内容。AI 润色能做什么SayIt 的 AI 润色功能不只是简单修错字它可以通过 Prompt 自定义实现多种效果去除口癖词比如“嗯、啊、那个、然后”等。修正语音识别中的错别字和断句问题。把口语改成自然书面语。自动分段排版。翻译成其他语言。按指定风格输出比如更正式、更简洁、更适合写邮件或更适合发给 AI。SayIt 已经对接了国内常用 AI 服务商包括通义千问、DeepSeek、豆包等。同时它也支持 OpenAI 兼容格式所以也可以接入其他供应商或第三方中转服务。语音识别模型选择根据作者实际测试中文语音识别效果大致可以这样排序豆包 Typeless ≈ Qwen3-ASR FunASR-Nano2512 FireRedASR2 Whisper豆包在中文语音识别上表现非常强尤其是小声说话、轻声输入这类场景实际体验很好。很多办公场景下并不适合大声和 AI 对话所以“悄悄话识别”能力非常关键。SayIt 后端部署使用的是 Qwen3-ASR。它的效果仅次于豆包在开源模型里是比较值得选择的方案。如果部署在公司内部配合 vLLM 做推理优化也能获得更好的识别速度。AI 润色模型推荐如果你想获得比较均衡的体验推荐使用 DeepSeek 的 deepseek-v4-flash。它的优势是质量不错、价格低、速度也能接受。如果你对延迟非常敏感比如希望 500ms 内返回可以考虑通义千问 qwen3.6-flash。它速度更快但准确度和润色质量可能略弱一些。模型对比供应商模型短文本长文本约200字输入价格输出价格DeepSeekdeepseek-v4-flash803ms2089ms1 元/百万 Token2 元/百万 Token通义千问qwen3.6-flash393ms1308ms1.8 元/百万 Token10.8 元/百万 Token配置建议AI 供应商建议优先使用官方 API。第三方中转站虽然方便但延迟通常更高稳定性也更依赖中转服务本身。DeepSeek 推荐配置API 地址https://api.deepseek.com模型deepseek-v4-flashAPI Key 获取地址platform.deepseek.com适合哪些人使用SayIt 比较适合以下几类用户经常和 AI 对话希望减少打字成本的人。需要快速记录想法、灵感、会议要点的人。想把口语自动整理成书面表达的内容创作者。希望替代 Typeless但又想要更自由 Prompt 控制的人。对数据隐私有要求希望自托管或本地部署的团队。想在企业内部部署 AI 语音输入工具的开发者或管理员。图片预览特别注意1.安装配置界面的时候左上角会出现请求麦克风权限提示一旦你拒绝了该权限那么就会用不了。解决办法:卸载后重新安装授权即可。2.默认是使用服务器语音识别的模式换本地需要在 语音引擎--工作模式 选择本地模式 然后下载对应的模型即可。然后AI供应商也可以选择本地Ollama来整理文本。下载地址https://github.com/crosswk/SayIt百度网盘 请输入提取码 提取码: 3h4g夸克网盘分享