
工位上可以直接讲 prompt
不用对着整间办公室说话。把手机拿到嘴边,小声讲清需求、报错和修改方向就行。
给在办公室写代码的人
把 iPhone 拿到嘴边,按住说话。你只需要很小声地讲,iPhone 负责近距离收音,Mac 在本机完成识别,然后把文字写进 Codex、Claude Code、Xcode、Terminal 或当前输入框。

01 / 它解决什么
用 MacBook 麦克风轻声说时,你的声音会和键盘声、空调声、同事说话一起进入麦克风。把 iPhone 拿到嘴边,距离从几十厘米缩短到几厘米,识别器先拿到更强的直达声。你不必为了让电脑听清而提高音量。
IPHONE → MAC / 实际工作方式
手机只负责贴近收音。音频加密传到已配对的 Mac,在本机识别,然后直接写进当前光标。
ScenicRouteRanker.swift

不用对着整间办公室说话。把手机拿到嘴边,小声讲清需求、报错和修改方向就行。

近讲不是把办公室变安静,而是让你的声音在进入识别模型之前,比周围声音更突出。
焦点留在 Codex、Claude Code、Xcode、Terminal 或浏览器输入框。识别结果直接写到当前光标。
02 / 与使用有关的数字
这里只列和工位体验直接相关、而且能解释清楚口径的数字:说话可以多小声、录音会不会离开设备,以及识别后还要不要切窗口。
手机可以拿到嘴边;MacBook 通常还在桌面上,离嘴约 50–80 cm。
按 5–10 cm 对 50–80 cm 的距离衰减换算。房间、持机方向和两台设备的麦克风差异会影响实际结果。
语音识别在你的 Mac 上完成。模型准备好后,本地使用不依赖公网。
音频只在内存里处理,用完即释放,不会在 iPhone 或 Mac 上留下录音文件。
识别结果直接写进当前输入框。你不必打开另一个 App、复制,再切回开发工具。
转写历史默认只保留 1 小时,也可以完全关闭。记录不会同步到 undervoice 服务器。
03 / 模型与语言
undervoice 不用一套通用模型硬扛所有语言。中文、日语、德语、法语、西班牙语和韩语分别有对应语言包;说这些语言时,可以直接说出英文变量名、库名和技术术语。另外提供纯英语模式。
流式预览使用 Streaming Paraformer Bilingual;最终文本默认使用低延迟 Paraformer,也可以切换到更重的 FireRedASR2 CTC 准确度优先档。中文标点由本机 CT-Transformer 补全。
使用 NVIDIA Parakeet TDT 0.6B v3。上游模型支持 25 种欧洲语言;undervoice 当前开放英语、德语、法语和西班牙语四个经过产品配置的语言包。
使用 Kotoba Whisper Bilingual v1.0。这个模型同时针对日语、英语和两者之间的语音转文字任务训练,不需要把英文术语交给另一套云端模型。
使用 Whisper Large v3 Turbo。它负责韩语主句与其中的英文名称、命令和缩写;Turbo 版本用于控制本机最终转写的等待时间。
WER 和 CER 都是越低越好。6.34% 与 9.3–16.8% 来自上游完整模型的公开测试集,不是 undervoice 在 iPhone 近讲、量化模型和混合英语场景下测出的总准确率。不同语言、数据集和量化方式不能直接排成一张“谁更准”的榜单。
每个下载文件都有固定 SHA-256;校验不一致就删除,不载入识别进程。
Curve25519 完成密钥协商,HKDF-SHA256 为配对与连接派生密钥。
ChaCha20-Poly1305 同时隐藏内容并检查篡改;每次连接使用新的会话密钥。
身份材料保存在 Keychain;录音只进内存,不写成音频文件。
04 / 和 MacBook 自带麦克风相比
两种方式都可以在 Mac 上使用同一套本机识别模型。iPhone 方案把收音位置从桌面拉到嘴边,因此你不用先提高音量,再让软件处理一个更差的输入。
| 办公场景 | iPhone 放到嘴边 | MacBook 自带麦克风 |
|---|---|---|
| 口部到麦克风 | 5–10 cm | 50–80 cm |
| 达到相同入声强度 | 发声音量可低约 14–24 dB只按距离衰减换算 | 作为桌面距离基准 |
| 小声说话时 | 人声更靠前近讲声先进入麦克风 | 人声与键盘、空调和旁人说话一起进入麦克风 |
| 办公室背景声占比 | 更低近讲声先变强 | 更容易同时收到键盘、空调和旁人说话 |
| 为了让设备听清 | 可以继续小声说 | 远距离时通常需要说得更响 |
| 旁人听见完整内容 | 更难不需要对着房间说话 | 提高音量后更容易被附近的人听见 |
| 识别位置 | Mac 本机 | Mac 本机 |
| 适合的办公情况 | 开放办公室、共享工位 | 独立房间或不介意别人听见时 |
距离换算使用自由场声压关系 20 × log10(r₂/r₁):5–10 cm 对 50–80 cm。房间反射、手机摆放和说话方向会影响最终结果。
公开资料对比 · 2026-07-30
Wispr Flow 和 Willow 已经公开支持耳语输入,Superwhisper 与 VoiceInk 则提供成熟的本地识别方案。undervoice 的差异不是“别人不能小声识别”,而是直接把现有 iPhone 做成 Mac 的近讲入口,并在 Mac 本机完成识别。
01 / 识别、模型、语言与数据保护
准确度数字沿用各厂商或上游模型的公开口径。WER、CER、zero-edit rate 与相对准确度不是同一种指标,因此表格同时写出数字代表什么,而不是只展示一个百分比。
表格可横向滚动 →
| 识别能力 | undervoice | Apple Dictation | Superwhisper | Wispr Flow | Willow | VoiceInk |
|---|---|---|---|---|---|---|
| 公开的准确度口径 | 不混用指标给出总百分比上游 Parakeet v3 平均 WER 6.34%;Kotoba 日语 CER 9.3–16.8% | 没有为所有语言与设备公布统一百分比 | Parakeet V2 英语 WER 6.05%引用公开 ASR 榜单 | 90% zero-edit rate厂商基准,包含识别、纠错和格式整理 | “比系统听写准确 3 倍”官网未同时披露测试集与评分公式 | “99% accuracy”项目 README 未同时披露测试集与评分公式 |
| 底层模型是否公开 | 公开Paraformer、FireRedASR2 CTC、Parakeet TDT、Kotoba Whisper、Whisper Turbo | 系统管理,不公开完整模型清单 | 公开多种 Whisper、Parakeet 与云端模型 | 公开为云端专有识别与上下文处理,不提供用户可选 ASR 清单 | 公开云端与离线模式,未公开完整模型清单 | 公开 Whisper、Parakeet 等本地模型及可选云端提供商 |
| 模型怎么选 | 按语言固定优选中文还能在低延迟 Paraformer 与准确度优先 FireRedASR2 CTC 间切换 | 由系统自动决定 | 用户选择模型大小、本地/云端以及后处理模型 | 服务端自动选择,用户主要配置语言、词典和上下文 | 服务自动选择;可切换离线模式 | 用户自行选择本地模型、云端提供商与模式 |
| 识别计算位置 | Mac 本机 | 依语言和系统设置在设备端或 Apple 服务处理 | 本地或云端,由用户选择 | 始终在云端 | 默认云端;可切换离线模式 | 本地优先;云端由用户配置 |
| 本机模型优化 | INT8 ONNX/Q5_0sherpa-onnx 与 whisper.cpp,针对 Apple Silicon | 由 Apple 管理,不对用户开放 | 按设备提供多个本地模型尺寸 | 识别始终在云端,本机不运行 ASR 模型 | 提供离线模式;具体模型优化未在官网展开 | 本地模型可选,具体优化取决于用户配置 |
| 产品开放的语种 | 7 种主要语言中文、英语、日语、德语、法语、西班牙语、韩语 | 多种语言;依系统版本、语言和地区而异 | 100+ 语言,具体覆盖依所选模型 | 多语言;官方建议同时配置 2–3 种语言 | 100+ 语言 | 依用户选择的本地或云端模型而异 |
| 英语技术术语识别 | 逐语言包明确支持使用中/日/德/法/西/韩时,可以直接说出英语术语;另有纯英语模式 | 多语言可切换;跨语言效果依系统语言支持 | 依所选模型的自动检测与多语言能力 | 支持多语言和 code-switching 处理,但没有逐语言包承诺 | 支持语言切换;官网没有逐语言说明英语术语效果 | 依所选模型和模式而异 |
| 低声与背景噪声 | iPhone 近讲是产品主流程5–10 cm;识别在 Mac 本机 | 没有专门的低声模式 | 可选择和调节麦克风;官网未披露专用低声方案 | Discreet Dictation近嘴麦克风+云端识别,必须联网 | Whisper mode厂商称可处理耳语、背景噪声和快速说话 | 官网未披露专用低声方案 |
| 公开的数据保护方法 | 模型与会话分别保护模型 SHA-256;Curve25519 + HKDF-SHA256;ChaCha20-Poly1305;Keychain;录音不落盘 | 可显示是否设备端处理;用户控制是否分享录音及删除听写历史 | 可完全本地;云端请求经代理;官方称 SOC 2 Type II、HIPAA | 始终云端处理;Privacy Mode 控制训练,Cloud Sync 控制留存,可组合为 ZDR | 官网称端到端加密、SOC 2 Type II、HIPAA、ZDR;默认 Private Mode | 本地模式不离开 Mac;云端提供商由用户配置 |
这一张表才是识别能力对比。准确度数字不能直接排行:WER/CER 越低越好,zero-edit rate 越高越好,而“3 倍”“99%”还取决于厂商没有完全公开的测试口径。
02 / 输入链路与使用方式
表格可横向滚动 →
| 产品边界 | undervoice | Apple Dictation | Superwhisper | Wispr Flow | Willow | VoiceInk |
|---|---|---|---|---|---|---|
| 主要解决什么 | 开放办公室里的低声输入面向 coder | 系统自带的通用听写 | 跨 App AI 听写、格式整理和文件转写 | 跨平台云端听写、上下文格式化与低声输入 | 跨平台 AI 听写、风格匹配、个人词典与 Whisper mode | macOS 本地优先、可高度配置的听写 |
| iPhone 如何参与 Mac 输入 | 专用近讲入口拿到嘴边,按住说,文字进 Mac | 可把 Continuity iPhone 麦克风选为系统输入;Apple 要求设备固定、稳定放置 | iOS App 独立听写;官网未披露 iPhone 作为 Mac 按住说入口 | iPhone 通过 Flow 键盘独立听写;桌面端建议选择贴近嘴的内置、有线或外接麦克风 | 同一账号覆盖 iPhone 与桌面端;各设备独立听写,官网未披露专用跨设备近讲入口 | 以 Mac 麦克风为主;官网未披露跨设备近讲入口 |
| 口麦距离设计 | 5–10 cm产品主流程 | 取决于用户选择的麦克风;Continuity 官方流程偏固定放置 | 可以选择输入设备和自动调节音量;未给出办公室近讲距离指标 | 官方建议麦克风距嘴几英寸;MacBook 内置麦克风需要俯身靠近 | 宣传 Whisper mode,但未给出口麦距离指标 | 未把办公室近讲距离作为产品指标 |
| 没有公网时 | 同一局域网可用模型准备完成后 | 设备端处理可用时不依赖公网 | 本地模式可用 | 不能完成转写 | 切换到离线模式可用 | 本地模式可用 |
| 录音是否发给厂商 | 不发送没有 undervoice 语音中转 | 设备端处理时不发 Siri 服务器;其他情况取决于系统提示与隐私设置 | 本地模式不发送;云端模式会发给所选服务 | 会上传完成云端转写;隐私模式控制训练,云同步控制服务端留存 | 云端模式会处理录音;官方称默认隐私模式不在服务器保存音频 | 本地模式不发送;可选云端模式会发给用户选择的提供商 |
| 本机录音文件 | 0只在内存中处理 | 功能页未给出统一的本机保留期限 | 取决于模式与历史设置;官网确认本地模式不上传 | 失败重试会保留录音:桌面端最长 14 天,iOS 直到手动或自动删除 | 录音可保存在设备上用于重新转写;服务器不保存 | 提供本机历史;官网未给出统一的录音保留期限 |
| 文字怎么进入目标 App | 直接写入当前光标焦点变化即暂停;安全输入框不写入 | 写入当前文本字段 | 系统范围输入,支持任意 App | 自动插入;失败时可能回退到剪贴板 | 在当前 App 直接生成格式化文字 | 写入当前光标;部分场景使用剪贴板粘贴 |
| 针对编程工作 | 核心场景Codex、Claude Code、Xcode、Terminal、任意文本框 | 没有专门的 coder 工作流 | 提供开发者用例及 Claude Code、OpenCode 集成 | 通用上下文格式化与个人词典 | 支持技术工具、自动学习词典和上下文格式化 | 支持按 App/网站切换模式、个人词典和本地增强 |
“官网未披露”只表示在本次核对的官方资料中没有找到对应承诺,不等于技术上无法做到。竞品功能会变化,本表按 2026 年 7 月 30 日的公开资料整理。
05 / 安全与网络
undervoice 没有语音中转服务器。同一局域网内,iPhone 直接连接 Mac;跨网络时可以走你自己的 Tailscale。无论走哪条路,undervoice 都会再做一层应用级身份认证和加密。
查看安装与权限说明 →Mac 不会因为处在同一个 Wi-Fi 就接受任意手机。更换 iPhone 时,需要在 Mac 上明确重置并重新配对。
录音、文字和控制消息都经过身份认证和端到端加密。内容被修改或来自错误设备时,Mac 会拒绝处理。
每次重新连接都会使用新的会话密钥。旧连接中的加密数据不能直接拿到下一次连接中重放。
音频只在内存里处理和释放,不保存成录音文件。转写历史保存在本机,可关闭,默认保留 1 小时;诊断日志不记录录音和转写正文。
同一局域网内,录音从 iPhone 直接到 Mac。模型准备好以后,不需要公网语音服务。
需要跨 Wi-Fi 或蜂窝网络时,可以走你自己的 Tailscale;undervoice 的设备认证和加密仍然保留。
06 / 输入到任何编辑器
“保留现有接口,把重试改成指数退避,再补三个边界测试。”
listeningMac 会在开始说话时记住当前应用和文本选区。识别过程中如果焦点或选区被其他操作改动,写入会暂停;密码框和开启 Secure Keyboard Entry 的控件不会被写入。
Talk to your Mac, not the room.
先在 Mac 安装模型,再用 iPhone 扫描配对二维码。之后把手机拿到嘴边,按住说话即可。