
快速结论: Whisper 没有单一的准确率数字——有的是一架梯子。在干净的单人朗读语音上,大型模型能达到约 2–3% 的词错误率(WER),也就是每 100 个词对 97 个以上。在多个真实英语基准的混合平均上,Whisper Large V3 约为 7.4% WER。在麦克风远、说话重叠的会议室音频上,同一个模型跑到 16% 左右。而在低资源语言上,错误率还可能再翻三倍。Whisper“准不准”,取决于你的录音站在哪一级台阶上——同样取决于你用的应用实际运行的是哪个 Whisper 版本。
本文中的每一个数字都取自 OpenAI 发表的论文与模型卡,或公开的 Open ASR Leaderboard,文末附来源链接。文章由 LoroNote 团队于 2026 年 8 月 19 日撰写。LoroNote 在设备端运行 Whisper Large V3 Turbo,所以我们并非没有立场——正因如此,下文没有一个数字出自我们自己的营销材料。
词错误率(WER)到底衡量什么
WER 把转写弄错的词——被替换、被漏掉或被编造的——计为所说词数的比例。5% 的 WER 意味着每 20 个词错 1 个;16% 意味着每 6 个词错 1 个。从定义本身可以推出两件事:
- WER 只有连同它所测量的音频一起看才有意义。 不说明测试集的“准确率 98%”是口号,不是测量。同一个模型在有声书上能到 97% 以上,在会议室里只有 84%,而这中间什么都没有坏。
- 错误的代价并不相等。 漏掉一个“嗯”和写错一个药名都只计一次。WER 是标准量尺,因为它客观,而不是因为它能反映一份文字稿用起来的感受——所以下文介绍的、用你自己的音频做的测试,胜过任何表格。
完整的定义——计算公式、WER 为何可能超过 100%、以及悄悄移动公开数字的规范化步骤——我们在什么是词错误率?里展开讲了。
准确率的阶梯:同一个模型,四级台阶
以下是 Whisper 大型模型在标准基准上的公开数字:
| 音频条件 | 基准 | 大致 WER | 来源 |
|---|---|---|---|
| 干净朗读语音,单一说话人 | LibriSpeech test-clean | ~2–3% | OpenAI 的 Whisper 论文(2.7%,large) |
| 八个真实英语测试集的混合 | Open ASR Leaderboard 平均 | ~7.4%(Large V3) | Open ASR Leaderboard |
| 会议室、远距麦克风、交叉说话 | AMI 会议语料库 | ~16%(Large V3) | Open ASR Leaderboard |
| 低资源语言示例 | 印地语(Common Voice) | ~27%(Large V3) | openai/whisper-large-v3 模型卡 |
从上往下读这架梯子,规律一目了然:变差的不是模型,是音频。对着嘴边的手机口述,处在最上层附近。隔着咖啡馆小桌的访谈在中间。从桌子远端录下的会议,还没做任何软件选择,就已经站在第三级台阶上了。
用的是哪个 Whisper?版本改变答案
“由 Whisper 驱动”描述的是一个家族,不是一个模型。Whisper 有从 tiny 到 large 的多个尺寸,尺寸之间的差距比厂商之间的差距更大:
- Large V3 是准确率旗舰。OpenAI 用 100 万小时弱标注音频加 400 万小时伪标注音频训练它,并报告在广泛的语言上比 Large V2 少 10–20% 的错误。
- Large V3 Turbo 是速度优化的衍生版:8.09 亿参数,解码器从 32 层砍到 4 层。OpenAI 把代价描述为“轻微的质量下降”——在 Open ASR Leaderboard 上两者的平均值离得很近(平均 WER 约 7.8% 对 7.4%;AMI 上约 16.1% 对 16.0%)。按语言合并看,它的表现与 Large V2 相当,在泰语、粤语等少数语言上损失最大。我们在 Whisper Large V3 Turbo 指南里拆解过这个取舍。
- small 和 medium 的 WER 要高出好几个百分点——一段话的测试就能看出的真实差距。这在 iPhone 上尤其要紧:好几款知名的“Whisper 应用”在手机上运行的是 small 或 medium,即便它们的 Mac 版跑的是 large。我们的 Whisper 应用对比列出了每款 iOS 应用实际加载的版本。
实用规则:在按准确率比较应用之前,先查清每款运行的是哪个 Whisper。跑 Large V3 Turbo 的应用和跑 small 的应用给出的不是同一种准确率,哪怕两边的商店页面都写着“Whisper AI”。
语言比任何软件因素都更能左右数字
Whisper 的训练数据严重偏向高资源语言,准确率也随之分布。英语、西班牙语、德语、日语、韩语等数据充足的语言聚在上文的平均值附近。低资源语言的错误率要高得多——表中的印地语只是一个公开的例子,OpenAI 的模型卡还指出同一语言内部不同口音和方言之间的表现也不均衡。
Whisper Large V3 覆盖约 100 种语言(粤语是 V3 新增的),所以“支持”和“同样准确”是两个不同的主张。如果你的语言不在高资源梯队里,诚实的建议和全文一致:录一小段自己的音频跑一遍,看结果——完整语言名单告诉你 LoroNote 会尝试什么,而两分钟你自己的音频告诉你效果如何。
幻觉:WER 低估的那类错误
OpenAI 的模型卡说得很直接:由于模型是在大规模含噪数据上弱监督训练的,“预测结果可能包含音频中并未实际说出的文本(即幻觉)”。实践中它出现在静音、背景噪声和音乐上——Whisper 是生成式模型,当没有语音可以锚定时,它可能产出通顺却无人说过的句子。
有两件事让它可控:
- 应用可以缓解它。 跳过静音段的语音活动检测,拿走了模型编造文本的主要机会。这是应用层的行为,不是模型设置,也是运行同一个 Whisper 的应用之间真实的差别之一。
- 你可以识别它。 幻觉文本往往出现在你知道当时安静的段落——录音结尾、长时间停顿。如果文字稿中段扎实,而静音处长出了句子,你看到的是幻觉,不是听错。
我们在 Parakeet V3 对比 Whisper Large V3 里把这种行为与转导器架构的模型做了对比——转导器在静音上更少幻觉,而 Whisper 覆盖的语言多得多;天下没有免费的午餐。
真正影响你录音准确率的因素
基准测试之间变的是音频;你的录音之间变的也是这些东西。按影响大小的粗略排序:
- 麦克风距离。 最大的杠杆。放在桌上一臂之内的手机,胜过房间另一头的手机——胜过的幅度超过任何模型升级。
- 噪声与音乐。 平稳的背景噪声让结果平缓变差;音乐和碰撞声让它急剧变差。
- 说话重叠。 交叉说话正是会议语料停在约 16% 而单人语音停在约 3% 的原因。
- 专业词汇。 人名、药名、股票代码和行话出错的比例格外高。LoroNote 的自定义词典正是为此而存在:那些它不该再弄错的高频术语。
- 模型版本——上面唯一纯属软件选择的因素,这也是 LoroNote 在手机上运行最大可行 Whisper 版本的原因。
说话人标注值得单独一提:说话人分离不改变 WER,却决定一份多人文字稿到底能不能用。一份准确却不分说话人的文字稿,整理起来仍然全靠人工;问题的另一半见说话人识别是如何工作的。
十分钟自测 Whisper 的准确率
在你自己的音频上做的测试,胜过本文的每一张表:
- 录大约两分钟贴近真实用途的音频——同样的房间、同样的距离、同样的语言,真实的人名和术语。两分钟的语音约有 250 个词以上,正好够下一步的计数。
- 转写它,对照音频通读结果。
- 在 200 个词的片段里数错误:每一个被替换、缺失或编造的词。错误数 ÷ 200 = 你的 WER。
- 评估错误本身,不只看数量:错五个语气词和错五个客户名字是同一个 WER,后果却完全不同。
这套方法的精确版本——包括如何事先决定什么算错误——在我们的 WER 指南里。
LoroNote 在设备端转写,免费版会转写每段录音的前两分钟——刚好够做这个测试。测试不花一分钱,录音也不会离开你的 iPhone:没有上传步骤,没有账号,开着飞行模式也一样。
常见问题
Whisper 的准确率够做专业文字稿吗?
对于近距麦克风、录音干净、语言资源充足的场景,Whisper 大型模型给出的草稿多数人只需轻改——干净语音 2–3% 的 WER 已接近自动系统的实用上限。对于远距麦克风的会议、严重的交叉说话或必须逐字精确的场合,请预留校对时间:在 16% WER 下,每六个词就有一个需要你过目。
Whisper Large V3 Turbo 比 Large V3 损失多少准确率?
一点点。OpenAI 称这种下降是轻微的,公开排行榜的英语平均值相差不到一个百分点。按语言合并看,Turbo 的表现与 Large V2 相当,在泰语、粤语等少数语言上损失最大。换来的是速度的大幅提升——正是这个取舍让 Large 系列模型在手机上变得可行。
为什么我的文字稿里有没人说过的句子?
那是幻觉,是 Whisper 在静音、噪声和音乐上被记录在案的行为:一个没有语音可锚定的生成式模型,仍可能产出通顺的文本。检查录音里的安静段落。在 Whisper 之前先跑语音活动检测的应用基本能避免它——这是应用行为,不是用户设置。
在设备端运行 Whisper 会降低准确率吗?
不会。同样的模型权重无论在哪里运行都产出同样的转写质量;端侧推理不是降级模式。应用之间的差别在于各自运行哪个版本:云服务托管最大的模型毫不费力,而端侧应用必须装进手机——这就是有些应用运行 small 或 medium 的原因。LoroNote 在本地运行 Large V3 Turbo,把 Large 系列模型和端侧隐私放进了同一款应用。
结语
“Whisper 有多准”有的是一个形状,而不是一个数字:干净朗读语音约 2–3% WER,混合英语基准约 7%,会议音频约 16%,低资源语言更差——外加 WER 低估的幻觉这条注脚。最能改变你自己结果的两个选择,一个是物理的(让麦克风更近),一个是结构的(弄清你的应用运行哪个 Whisper 版本)。其余的,用你自己的录音十分钟就能测出来——那才是唯一真正关于你的基准。
