Skip to Content
文档⚡ 核心功能🎙️ 语音输入

语音输入

语音输入是签名循环的第三类输入通道——前两类是键盘和粘贴。按住一个热键说话,松手后有三种落点:把这段话听写上屏、让它命中的片段原地展开、或者作为指令送进 AI。全程不抢前台焦点。

CodeExpander Pro 语音输入


开始之前

语音的总开关默认关闭,且必须先配好一台识别服务,按下热键才会有反应。三步:

  1. 打开总开关:设置 → 语音输入 → 启用语音输入。
  2. 设置热键:点输入框后按下要录制的键,允许单独使用 Control 这类修饰键。留空表示不占用键位。
  3. 配置识别渠道(关键):在「语音识别」里添加一个 OpenAI 兼容的听写服务,填端点、API Key 与模型名;模型要填语音识别模型(如 whisper、gpt-4o-transcribe),填对话模型会失败。也可以下载本机模型走离线识别,见下文。

麦克风权限只会询问一次;未授权时按热键不会录音。

跳过第 3 步就按热键,胶囊会提示「尚未配置识别服务」。这是设计如此:CodeExpander 没有自建识别后端,音频只发往你自己填的端点。

说完之后的三种落点

模式结果
展开片段按缩写、标题或语音别名匹配片段并原地展开。没命中时可选「改为听写上屏」或「仅提示,不上屏」
听写把识别文字插入光标处。若整句恰好是某条缩写,仍会展开片段
语音 → AI单独配一个热键,说完直接送进搜索窗的 AI 对话

「按住说话」与「点按开始/再按停止」两种方式都支持;点按模式下静音超过 10 秒会自动取消。

语音别名:说中文也能命中

片段编辑器里的语音别名字段(逗号分隔)让同一个片段有多个口语叫法。例如给 /cs 这条片段加上别名「客服话术」,之后嘴上说「客服话术」就能展开它,而不用念出缩写。

长句听写未命中片段时,可以开关一个后处理:静默整理标点后再上屏,不打开搜索窗。默认关闭。

本机识别(离线)

不想把音频发到云端时,可以下载本机模型,音频不出电脑:

平台本机识别
macOS(Apple Silicon)支持。下载 Qwen3-ASR 0.6B 模型(约 1.2 GB)后离线识别
macOS(Intel)暂不支持,可用云识别
Windows本机引擎暂未提供,可用云识别

本机模型首次加载需要 30–90 秒,之后会保持一段时间常驻;长期不用会自动释放。

隐私

  • 音频只驻内存,不落盘、不留历史。
  • 音频只发往你自己配置的识别端点;CodeExpander 没有自建识别后端。
  • 语音不占 Pro 名额,也不限次数。
  • 系统密码框等安全输入场景会被拦截,此时文本会放进剪贴板,需要你手动粘贴。

相关链接

  • 快速展开 —— 语音展开复用的是同一套片段匹配
  • FillIn —— 含变量的片段会在展开前弹出表单
  • 搜索窗 —— 语音 → AI 送进的就是这个窗口
最后更新于