
快速结论: 在那份被所有人转发的基准测试里,苹果新的端侧 SpeechAnalyzer 确实赢了 Whisper——LibriSpeech test-clean 上词错误率 2.12% 对 3.74%。但那次测试跑的是 Whisper Small,音频是英语朗读有声书,设备是一台 Mac。它从未测试 Whisper Large V3 或 Large V3 Turbo,也就是端侧 iPhone 应用真正加载的模型,也没有碰过会议、口音,或 Whisper 支持的其余约 99 种语言。苹果的引擎确实快、确实准,而且免费——前提是在它支持的 22 种语言之内。Whisper 覆盖的语言大约是这个数字的五倍。
下面所有数字均出自基准测试作者本人的文章、OpenAI 公开的论文与模型卡、Open ASR Leaderboard,或苹果的开发者文档,文末已全部附上链接。本文由 LoroNote 团队写于 2026 年 8 月 23 日。LoroNote 在设备上运行 Whisper Large V3 Turbo,因此我们在这场对比中有利益关系。正因如此,这里的每一个数字都是别人的测量结果,而不是我们自己的。
SpeechAnalyzer 到底是什么
SpeechAnalyzer 是苹果在 WWDC 2025 上发布、随 iOS 26 一同推出的语音框架。它取代了 SFSpeechRecognizer——这个已经老旧的 API 支撑了 iOS 上第三方听写功能整整十年。
有两个公开模块值得关注:
SpeechTranscriber负责语音转文字。SpeechDetector负责判断音频流中哪些片段有人在说话。
全部处理都在设备上完成。语言资源通过系统资源目录下载,而不是由每个应用各自打包,因此使用这个 API 的应用几乎不会增加下载体积。对于 SpeechTranscriber 未覆盖的语言,苹果提供 DictationTranscriber 作为回退方案。
有一个硬性条件被大多数对比文章略过了:SpeechAnalyzer 需要 iOS 26 或更高版本,且不向下兼容。 在一台仍停留在 iOS 18 的 iPhone 上,这个能力根本不存在。
被所有人引用的那份基准测试
2026 年 7 月在科技媒体上扩散的那组数字,来自一位开发者做的单次评测。它实际测量的条件如下:
| 条件 | 内容 |
|---|---|
| 数据集 | LibriSpeech——5,559 条语句(test-clean 2,620,test-other 2,939) |
| 音频类型 | 朗读有声书,单一说话人,干净录音 |
| 语言 | 仅英语 |
| 硬件 | M2 Pro、32GB、macOS 26.5.1,全部在设备上处理 |
| 测试的 Whisper | Tiny、Base、Small |
结果如下:
| 引擎 | test-clean WER | test-other WER |
|---|---|---|
| Apple SpeechAnalyzer | 2.12% | 4.56% |
| Whisper Small(约 460MB) | 3.74% | 7.95% |
| Whisper Base(约 140MB) | 5.42% | 12.51% |
| Whisper Tiny(约 40MB) | 7.88% | 17.04% |
| SFSpeechRecognizer(旧) | 9.02% | 16.25% |
关于这张表,有两件事值得直说。苹果领先自家旧 API 的幅度极大——错误减少约 75%,对于此前基于 SFSpeechRecognizer 开发的人来说,这才是真正的新闻。而且苹果确实赢过了所有被测试的 Whisper 模型。
问题在于,被测试的是哪些模型。
基准测试没有测量的三件事
1. 端侧应用真正运行的 Whisper 模型
Whisper Small 是一个 460MB 的模型。它不是一款认真的转写应用会在现代 iPhone 上加载的模型。LoroNote 运行的是 Large V3 Turbo:8.09 亿参数,为了速度把解码器从 32 层削减到 4 层。
这份基准测试在 Medium、Large 和 Turbo 之前就停下了。作为参照,已公开的评测把 Whisper Large V3 在 LibriSpeech 上的成绩放在 test-clean 约 2.0–2.5% WER、test-other 约 3.9–4.3%——与苹果的 2.12% 和 4.56% 处在同一区间,甚至略好一些。
请谨慎看待这个对比。 上述 Whisper 数字来自各自独立、各用一套文本规范化方式的评测,并不是在同一台机器上与苹果引擎正面对决的结果。单是规范化方式的差异,就能让 LibriSpeech 的 WER 移动一个百分点以上——我们的 WER 指南解释了这是如何发生的。诚实的结论不是「Whisper Large 更强」,而是:还没有任何公开测试,把苹果的引擎与这场对比真正应该涉及的 Whisper 模型放在一起比过,标题所暗示的差距,是所选模型规格造成的结果。
2. 任何比录音棚有声书更难的音频
LibriSpeech 是朗读语音:一个人,一本书,一支好麦克风,没有插话重叠。这是梯子的最底一级,也正因如此,任何引擎都会在这里跑出自己最好的成绩。
真实录音都在更上面。在我们整理过的 Whisper 准确率阶梯里,同一个在干净朗读语音上跑出 2–3% 的 Large V3,放到多个真实英语基准的混合平均上是约 7.4%,放到麦克风远、说话重叠的 AMI 会议室音频上则在 16% 左右。
SpeechAnalyzer 的这些台阶,目前还没有人公开过。在有人做出来之前,有声书上的 2.12% 对于一场摆在桌子中间录下的四人会议,说明力非常有限。基准测试的作者对此很坦率——文中把数据集描述为「朗读有声书语音,不是会议」。
3. 另外九十九种语言
这是最大的缺口,作者也直接点了出来:这些数字「对 Whisper 支持的 100 多种语言什么都没说」。
截至 2026 年 8 月,SpeechTranscriber.supportedLocales 返回的是 22 种语言、42 个地区变体:
中文(简体、繁体、香港)、粤语、日语、韩语、英语(九个地区变体)、西班牙语、法语、德语、意大利语、葡萄牙语、俄语、荷兰语、阿拉伯语、希伯来语、土耳其语、泰语、越南语、马来语、丹麦语、芬兰语、挪威语(书面挪威语)和瑞典语。
Whisper Large V3 覆盖约 100 种。苹果名单里缺的语言并不冷门:没有印地语、没有波兰语、没有捷克语、没有希腊语、没有乌克兰语、没有印尼语。葡萄牙语只有 pt_BR,没有欧洲葡萄牙语。
对中文用户来说,关键点在别处。 zh_CN、zh_TW、zh_HK 以及粤语 yue_CN 都在苹果名单里,所以问题不在于支不支持。问题是两个引擎都没有公开过中文的准确率数字。那份刷屏的基准测试只测了英语,而苹果不公布分语言的 WER。因此,现在说「苹果的中文转写比 Whisper 好」或者反过来,都没有依据。另外值得一提:按 OpenAI 自己的说法,Turbo 在少数语言上损失较多,粤语正是其中之一——如果你录的是粤语,这一点比任何榜单都更值得放在心上。你自己两分钟的录音,目前仍是最可靠的依据。
苹果表示会继续增加语言,所以这份名单迟早会过时。但「支持」和「同样准确」是两回事,这一点对两个引擎都成立。因此完整语言列表更适合拿你自己的音频去验证,而不是相信一个数量。
关于「快三倍」这个数字
速度的说法和准确率传得一样远,脚注也一样:那是拿 Whisper Small 作对照测出来的。
基准测试给出的是 M2 Pro 上大约 12 倍到 40 倍于实时的吞吐区间——一小时音频约需 1.5 到 5 分钟处理完。作者刻意没有公布各模型的精确耗时,要等在空闲机器上重新测量之后再说。
这个区间是真实的,苹果的引擎也确实快。但它来自一颗配 32GB 内存的桌面级 M 系列芯片,而不是手机。在 iPhone 上,任何转写模型真正的瓶颈是内存,而不是算力。这也是为什么好几款知名的「Whisper 应用」在 Mac 版上跑 large,到了手机上却悄悄加载 small 或 medium。我们整理过每款 iOS 应用实际加载的是哪个变体。
什么情况下该选哪个
两者都不是全面胜出的关系。它们本来就是为不同任务设计的。
选择 Apple SpeechAnalyzer,如果:
- 你使用的语言在支持的 22 种之内,尤其是英语;
- 设备是 iOS 26 或更高版本;
- 你需要实时转写,说话过程中结果不断更新——这个 API 本来就是为此设计的;
- 你不希望有模型下载,也不希望有费用。
选择 Whisper Large V3 系列,如果:
- 你的语言不在苹果名单内,或者一段录音里混着多种语言(比如中英夹杂的会议);
- 你需要在较旧设备上得到同样的表现——基于 Whisper 的应用可以运行在远低于 iOS 26 的版本上;
- 你转写的是已有文件而不是实时语音,此时准确率比延迟更重要;
- 你希望无论系统版本如何,转写结果都保持一致。
两个方向都没有免费的午餐。苹果的引擎接入更快、不花钱,在它的范围内表现出色。Whisper 的范围大约宽五倍,而 Large 系列用模型体积和处理时间为这份宽度买单。
挑选 iPhone 应用时会有什么不同
有两个实际影响。
第一,App Store 上的「AI 转写」现在至少指三种不同的东西: 调用苹果端侧 SpeechAnalyzer 的应用、在设备上运行自有 Whisper 模型的应用,以及把音频上传到服务器的应用。它们在隐私、离线可用性和语言覆盖上完全不同,而应用介绍里很少写明属于哪一种。我们的 iOS 语音转文字应用对比就是按音频在哪里处理来分类的。
第二,「端侧」这三个字已经不能说明准确率了。 两条路都在端侧。问题已经从我的音频去了哪里,变成了跑的是哪个模型、多大规格、什么语言。
五分钟就能自己验证
基准测试是在你永远不会录制的数据集上取的平均值。你自己的音频,才是唯一能回答你问题的测试:
- 在你平时录音的那个房间录两分钟:你的麦克风、你的口音,夹几个人名、数字和专业术语。
- 用 iPhone 自带的转写功能处理一遍(受支持机型上的「语音备忘录」,或任何使用苹果引擎的应用)。
- 用基于 Whisper 的应用处理同一个文件。
- 在 200 个字的片段里数错误:每一个被换掉的、漏掉的、凭空多出来的词都算。错误数 ÷ 200 = 你自己的 WER。(完整方法——包括如何事先决定什么算错误——见我们的 WER 指南。)
如果两边都很干净,那就用顺手的那个。差别通常出现在专有名词、重叠说话,以及任何非高资源语言上——恰好就是基准测试停下来的地方。
常见问题
Apple SpeechAnalyzer 比 Whisper 更准吗?
在干净的英语有声书上对比 Whisper Small,是的:WER 2.12% 对 3.74%。但对比 Whisper Large V3 或 Large V3 Turbo,还没有人公开过正面测试。独立评测显示 Large V3 在同一数据集上与之持平或略微领先,但由于规范化方式不同,这只能算粗略比较,不是定论。
中文哪个更准?
目前没有公开数字。刷屏的那份基准测试只测了英语,苹果也不发布分语言的 WER。zh_CN、zh_TW、zh_HK 和粤语都在苹果名单里,支持本身没有问题。至于准确率,用自己两分钟的录音实测,是目前唯一可靠的办法。另外,如果录的是粤语,值得留意 OpenAI 说明中提到 Turbo 在粤语上损失相对较多。
SpeechAnalyzer 能离线工作吗?
可以。它完全在设备上运行,语言资源通过系统资源目录下载一次即可。在这一点上它和端侧 Whisper 应用一致——两者都不会把你的音频送到服务器。
必须要 iOS 26 吗?
必须。SpeechAnalyzer 要求 iOS 26 或更高版本,且不向下兼容。基于 Whisper 的应用可以运行在低得多的版本上,这也是应当同时把两个引擎纳入考虑的现实理由之一。
它们能区分谁在说话吗?
区分说话人是独立于转写的另一个步骤,两个引擎都不会把它作为语音识别的一部分来完成。这是应用在上层另外加的功能——说话人分离是怎么工作的讲了它需要什么,以及会在哪里失效。
LoroNote 为什么用 Whisper 而不是苹果的引擎?
因为语言覆盖和设备覆盖。LoroNote 转写约 100 种语言,包括语言混杂的录音,并支持远早于 iOS 26 的设备。苹果的引擎在它那 22 种语言里表现优秀,但无法直接替代这份宽度。具体的模型选择理由,我们写在 Whisper Large V3 Turbo 指南里。
参考来源
- Apple,Bring advanced speech-to-text to your app with SpeechAnalyzer——介绍该框架的 WWDC25 场次
- Apple,SpeechTranscriber 文档
- Lyonesse,Apple’s New Speech API vs Whisper: The First Real Benchmark——LibriSpeech 评测及其方法论与作者自述的局限
- OpenAI,Robust Speech Recognition via Large-Scale Weak Supervision——Whisper 论文
- OpenAI,whisper-large-v3 模型卡与 whisper-large-v3-turbo 模型卡
- Open ASR Leaderboard——混合基准与 AMI 会议音频数据
基准数字核对于 2026 年 8 月 23 日。苹果支持的地区变体列表会随系统更新变化;在依赖它之前,请在最新版本上确认 SpeechTranscriber.supportedLocales。
