语音输入
语音输入是签名循环的第三类输入通道——前两类是键盘和粘贴。按住一个热键说话,松手后有三种落点:把这段话听写上屏、让它命中的片段原地展开、或者作为指令送进 AI。全程不抢前台焦点。

开始之前
语音的总开关默认关闭,且必须先配好一台识别服务,按下热键才会有反应。三步:
- 打开总开关:设置 → 语音输入 → 启用语音输入。
- 设置热键:点输入框后按下要录制的键,允许单独使用 Control 这类修饰键。留空表示不占用键位。
- 配置识别渠道(关键):在「语音识别」里添加一个 OpenAI 兼容的听写服务,填端点、API Key 与模型名;模型要填语音识别模型(如 whisper、gpt-4o-transcribe),填对话模型会失败。也可以下载本机模型走离线识别,见下文。
麦克风权限只会询问一次;未授权时按热键不会录音。
跳过第 3 步就按热键,胶囊会提示「尚未配置识别服务」。这是设计如此:CodeExpander 没有自建识别后端,音频只发往你自己填的端点。
说完之后的三种落点
| 模式 | 结果 |
|---|---|
| 展开片段 | 按缩写、标题或语音别名匹配片段并原地展开。没命中时可选「改为听写上屏」或「仅提示,不上屏」 |
| 听写 | 把识别文字插入光标处。若整句恰好是某条缩写,仍会展开片段 |
| 语音 → AI | 单独配一个热键,说完直接送进搜索窗的 AI 对话 |
「按住说话」与「点按开始/再按停止」两种方式都支持;点按模式下静音超过 10 秒会自动取消。
语音别名:说中文也能命中
片段编辑器里的语音别名字段(逗号分隔)让同一个片段有多个口语叫法。例如给 /cs 这条片段加上别名「客服话术」,之后嘴上说「客服话术」就能展开它,而不用念出缩写。
长句听写未命中片段时,可以开关一个后处理:静默整理标点后再上屏,不打开搜索窗。默认关闭。
本机识别(离线)
不想把音频发到云端时,可以下载本机模型,音频不出电脑:
| 平台 | 本机识别 |
|---|---|
| macOS(Apple Silicon) | 支持。下载 Qwen3-ASR 0.6B 模型(约 1.2 GB)后离线识别 |
| macOS(Intel) | 暂不支持,可用云识别 |
| Windows | 本机引擎暂未提供,可用云识别 |
本机模型首次加载需要 30–90 秒,之后会保持一段时间常驻;长期不用会自动释放。
隐私
- 音频只驻内存,不落盘、不留历史。
- 音频只发往你自己配置的识别端点;CodeExpander 没有自建识别后端。
- 语音不占 Pro 名额,也不限次数。
- 系统密码框等安全输入场景会被拦截,此时文本会放进剪贴板,需要你手动粘贴。
相关链接
最后更新于