文本提取与语音听写
本文译自 The Omarchy Manual — Text Extraction & Dictation,同步自 basecamp/omarchy@ed7bae4。术语以 TERMS.md 为准。标注「译者本地化」的小节为译者实测补充,非原文内容。
文本提取
按 Super + Ctrl + PrtScr 圈选屏幕区域提取文字。tesseract 开源 OCR 模型会迅速把选区转成文字放进剪贴板。然后你只需 Super + V 粘贴。
从图片页脚里抓地址、从网站标题图里抠电话号码,这招都特别好使。

语音听写
Omarchy 通过 Voxtype 提供 AI 听写。在 Omarchy 菜单经 Install > AI > Dictation 安装。默认会加载一个 150MB 的基础英语模型。想换模型,在终端运行 voxtype setup model;所有设置都在 ~/.config/voxtype/config.toml 里调。
装好之后,按住 F9 或用 Super + Ctrl + X 开关即可听写,说出的文字会出现在当前聚焦的输入区。
译者本地化:中文听写配置
以下内容为译者实测补充,不属于原手册。默认的
base.en是纯英语模型,只能输出英文——即使把language改成"zh"也无法中文听写。想用中文请按下面步骤换成多语言模型。
- 下载多语言模型(以 small 为例,约 466MB;更大可选 medium):
cd ~/.local/share/voxtype/models
curl -sL -O https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-small.bin
voxtype setup model的交互菜单需要 TTY 且无直接下载命令,手动放置模型文件最省事。
- 修改配置
~/.config/voxtype/config.toml:
model = "small" # 多语言模型;带 .en 后缀的都是纯英语
language = "zh"
- 重启守护进程:
systemctl --user restart voxtype
systemctl --user is-active voxtype # 应显示 active
- 使用:按住
F9说中文,松开后文字直接输入到光标处(输出失败会自动回退为复制到剪贴板);或用Super + Ctrl + X切换连续听写模式。
识别不满意时可升级 medium 模型(约 1.5GB),更准但更慢。模型文件不随 dotfiles 同步,新机器需重新下载。
译者本地化:Voxtype Enhance——顶栏麦克风与图形化设置
以下内容为译者实测补充,不属于原手册。上面的中文听写配置要手动下载模型、手改
config.toml;如果想要图形化管理,译者写了一个配套插件:omarchy-voxtype-enhance。
先按本章开头的方式装好 Voxtype,然后:
omarchy plugin add https://github.com/iamcheyan/omarchy-voxtype-enhance.git --enable
顶栏会出现一个麦克风图标,点开即是设置面板:
- 模型管理:面板直接列出 SenseVoice Small(int8 / 全精度)与 Paraformer Large 三款离线模型,选中即自动下载、SHA-256 校验并切换引擎——不需要手动下
.bin文件,也不需要理解 engine 概念。其中 SenseVoice Small · int8 仅 229MB,中文识别效果好、速度快; - 识别语言:中 / 英 / 日 / 韩 / 自动;
- 输出方式:
- Omarchy 万能粘贴(默认):转写结果先写入剪贴板,再按焦点窗口类型自动注入
Shift+Insert(终端)或Ctrl+V(图形应用),避开部分终端程序把Ctrl+V解释成图片粘贴的问题; - Type:Voxtype 原生模拟键入;中英文混排时会与 Fcitx5/Rime 逐字符交互,建议仅在纯英文场景使用;
- 录音快捷键不变,仍按本章开头的方式触发;面板改动会写回
~/.config/voxtype/config.toml并自动重启voxtype.service; - 面板底部的 Clear plugin data 只清理插件管理的三个模型并恢复默认设置,不动 Whisper 模型、录音和快捷键。