跳转至

文本提取与语音听写

本文译自 The Omarchy Manual — Text Extraction & Dictation,同步自 basecamp/omarchy@ed7bae4。术语以 TERMS.md 为准。标注「译者本地化」的小节为译者实测补充,非原文内容。

文本提取

Super + Ctrl + PrtScr 圈选屏幕区域提取文字。tesseract 开源 OCR 模型会迅速把选区转成文字放进剪贴板。然后你只需 Super + V 粘贴。

从图片页脚里抓地址、从网站标题图里抠电话号码,这招都特别好使。

text-extraction

语音听写

Omarchy 通过 Voxtype 提供 AI 听写。在 Omarchy 菜单经 Install > AI > Dictation 安装。默认会加载一个 150MB 的基础英语模型。想换模型,在终端运行 voxtype setup model;所有设置都在 ~/.config/voxtype/config.toml 里调。

装好之后,按住 F9 或用 Super + Ctrl + X 开关即可听写,说出的文字会出现在当前聚焦的输入区。

译者本地化:中文听写配置

以下内容为译者实测补充,不属于原手册。默认的 base.en 是纯英语模型,只能输出英文——即使把 language 改成 "zh" 也无法中文听写。想用中文请按下面步骤换成多语言模型。

  1. 下载多语言模型(以 small 为例,约 466MB;更大可选 medium):
cd ~/.local/share/voxtype/models
curl -sL -O https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-small.bin

voxtype setup model 的交互菜单需要 TTY 且无直接下载命令,手动放置模型文件最省事。

  1. 修改配置 ~/.config/voxtype/config.toml
model = "small"    # 多语言模型;带 .en 后缀的都是纯英语
language = "zh"
  1. 重启守护进程
systemctl --user restart voxtype
systemctl --user is-active voxtype   # 应显示 active
  1. 使用:按住 F9 说中文,松开后文字直接输入到光标处(输出失败会自动回退为复制到剪贴板);或用 Super + Ctrl + X 切换连续听写模式。

识别不满意时可升级 medium 模型(约 1.5GB),更准但更慢。模型文件不随 dotfiles 同步,新机器需重新下载。

译者本地化:Voxtype Enhance——顶栏麦克风与图形化设置

以下内容为译者实测补充,不属于原手册。上面的中文听写配置要手动下载模型、手改 config.toml;如果想要图形化管理,译者写了一个配套插件:omarchy-voxtype-enhance

先按本章开头的方式装好 Voxtype,然后:

omarchy plugin add https://github.com/iamcheyan/omarchy-voxtype-enhance.git --enable

顶栏会出现一个麦克风图标,点开即是设置面板:

  • 模型管理:面板直接列出 SenseVoice Small(int8 / 全精度)与 Paraformer Large 三款离线模型,选中即自动下载、SHA-256 校验并切换引擎——不需要手动下 .bin 文件,也不需要理解 engine 概念。其中 SenseVoice Small · int8 仅 229MB,中文识别效果好、速度快;
  • 识别语言:中 / 英 / 日 / 韩 / 自动;
  • 输出方式
  • Omarchy 万能粘贴(默认):转写结果先写入剪贴板,再按焦点窗口类型自动注入 Shift+Insert(终端)或 Ctrl+V(图形应用),避开部分终端程序把 Ctrl+V 解释成图片粘贴的问题;
  • Type:Voxtype 原生模拟键入;中英文混排时会与 Fcitx5/Rime 逐字符交互,建议仅在纯英文场景使用;
  • 录音快捷键不变,仍按本章开头的方式触发;面板改动会写回 ~/.config/voxtype/config.toml 并自动重启 voxtype.service
  • 面板底部的 Clear plugin data 只清理插件管理的三个模型并恢复默认设置,不动 Whisper 模型、录音和快捷键。