
快速结论: 词错误率(WER)是转写准确率的标准量尺。它统计一份文字稿出错的三种方式——词被替换、词被删掉、词被凭空插入——再把总数除以实际说出的词数。10% 的 WER 大约意味着每十个词错一个。这个定义里藏着三个意外:WER 可以超过 100%;同一份文字稿会因为计数前文本规范化方式的不同而得到两个分数;不知道测的是什么音频,这个数字就没有意义。而对于中文、日语这类书写时不分词的语言,业界改用字错误率(CER)——一个经常被厂商当作同一指标来引用的不同指标。
本指南由 LoroNote 团队写于 2026 年 8 月 26 日。LoroNote 在设备上运行 Whisper Large V3 Turbo,WER 数字决定我们做什么、敢宣称什么——而下文每一个数字都来自 OpenAI 公开的论文与模型卡,或公开的 Open ASR Leaderboard,文末附全部链接。没有一个是我们自己的测量结果。
公式:文字稿出错的三种方式
WER 比较两份文本:参照文本(实际说出的话,由人工仔细转写)和假设文本(机器产出的结果)。两者之间的每一处差异都落入三类之一:
- 替换(S)——一个词被换成了另一个词
- 删除(D)——说出的词在文字稿里消失了
- 插入(I)——文字稿里多出了没人说过的词
分数是三者之和除以参照文本的词数:
WER = (S + D + I) / N,其中 N 是实际说出的词数——不是文字稿里的词数。
举一个英语的例子(WER 按词计数,而中文怎么计数正是下文 CER 一节的主题)。有人说:“send the report to Priya by Friday morning”——八个词。文字稿写成“send a report to Prisha by Friday”。这是两处替换(the → a、Priya → Prisha)加一处删除(morning):八个词里三个错误,WER 为 37.5%。注意这个例子悄悄夹带的东西:被写错的人名才是真正会让你付出代价的错误,而它的计分和 the 变成 a 完全一样。下文详谈。
WER 为什么可能超过 100%
替换和删除受参照文本长度的限制——你删不掉比实际说出的更多的词。插入不受限制。一个生成式语音模型面对一段近乎无声的音频,可以凭空编出整句话,而每一个编造的词都会被计为插入,分母却几乎为零。这会把 WER 推过 100%——这不是舍入错误,而是公式在按设计工作。这也是为什么幻觉——Whisper 在静音、噪声和音乐上被记录在案的行为——比它在平均 WER 里的占比更值得重视;两种模型架构在这一点上的差异,我们在 Parakeet V3 对比 Whisper Large V3 里比较过。
WER 与“99% 准确”
厂商很少直接宣传词错误率,他们宣传准确率。换算很简单——准确率约等于 100% 减去 WER——但这种表述悄悄做了不少工作。“99% 准确”听起来像是产品本身的属性。而 WER 从来只描述产品在某个特定测试集上的表现,准确率横幅却几乎从不注明测试集。同一个引擎在干净、近距麦克风的朗读语音上拿到 97%,放到远距麦克风的会议上可能只有 84%,而软件什么都没变。一个不附测试集的精确准确率数字,是一个广告决策,不是一次评测。
经验法则:每当遇到一个准确率百分比,用 100 减去它,然后问“在什么音频上?”。如果答案没有公开,这个数字就无法与任何东西比较——包括同一家厂商去年的数字。
错误的代价并不相等——而 WER 不在乎
WER 刻意一视同仁:漏掉一个“嗯”和写错一个药名各计一次。这种中立正是它客观、可跨系统比较的原因,也是它最著名的局限。错了五个语气词的文字稿和错了五个客户名字的文字稿,WER 相同,后果截然不同。
评测团队有时会用关键词加权指标或实体错误率来弥补,但你在论文、排行榜和营销里遇到的头条数字,几乎永远是普通 WER。对任何挑选转写工具的人来说,实际的结论是:做完任何测试,都要去读具体的错误,而不是停在数字上。错误落在哪里,比错了多少个更重要。
规范化:同一个模型为何得到两个分数
在开始计数之前,参照文本和假设文本都要经过规范化:转成小写、去掉标点,统一数字、缩写和拼写——“twenty six”对“26”算不算错?“it’s”对“it is”算不算错?“colour”对“color”呢?每一次评测都用自己的一套规则回答这些问题,而规则会移动分数。
OpenAI 认为这件事重要到专门随 Whisper 发布了一个文本规范化工具,并在 Whisper 论文里用整整一个附录说明规范化选择如何改变测得的 WER。在 LibriSpeech 这样的基准上,仅规范化差异就能让一个模型的公开数字移动一个百分点以上——这个幅度,和许多正面对比声称测出的差距差不多大。
这正是我们在这个博客上反复提醒的一件事,最近一次是在 Apple SpeechAnalyzer 对比里:来自两份独立发表的评测的 WER 数字是粗略的参照,不是定论。唯一干净的比较,是两个系统在同一次评测里、同一批音频上、用同一个规范化工具打分。
不知道测试集,WER 什么都不是
被引用最多的语音基准 LibriSpeech 取材于公版有声书,分成两半,名字本身就说明了一切:test-clean(录音清晰、说话人容易)和 test-other(更难的剩余部分)。同一个语料库,两种条件——每个模型在第二半上的分数都明显更差。这个结构就是 WER 全部道理的缩影:音频是数字的一部分。
Whisper 大型模型的公开数字在更大的尺度上说明同一件事。在干净的单人朗读语音上,约 2–3% WER;在 Open ASR Leaderboard 八个多样化真实英语测试集的平均上,约 7.4%;在麦克风远、说话重叠的会议录音上,16% 左右;在印地语这样的低资源语言上,公开数字接近 27%。同一套权重,一个数量级的跨度——我们在 Whisper 到底有多准?里逐级走过这架梯子。

NIST 二十多年语音识别评测的历史。朗读语音、广播新闻、电话对话与会议语音各有自己的曲线,从未收敛为同一个数字。来源:
NIST Rich Transcription 评测
(公有领域)
测试集还可能藏着另一个陷阱:实际测的是哪个模型。2026 年那份刷屏、声称苹果新引擎赢了 Whisper 的基准测试,测的是 Whisper Small——比端侧应用实际运行的模型小好几档。头条数字是真的;这场比较不是。
当“词”不再成立:中文、日语与韩语的 CER
WER 假设你看一眼就能把句子切成词。中文和日语书写时不分词,“这句话有几个词”本身就是一个建模决定——两个分词器给出两个数,错误率也继承这份分歧。因此这些语言的评测改用字错误率(CER):同一套“替换、删除、插入”的算术,按字而不是按词进行。OpenAI 自己的 Whisper Large V3 模型卡对日语、中文、韩语、泰语等语言报告的就是 CER 而不是 WER。

OpenAI 公布的 Whisper large-v3 与 large-v2 各语言错误率(Common Voice 15、FLEURS)。斜体语言(韩语、日语、普通话、粤语、泰语)按 CER 计分,其余按 WER。来源:
OpenAI Whisper 代码仓库
(MIT 许可证)
韩语是最有说明性的中间情形:它有空格,但助词附着在前面的词上,合法的空格变化会在不改变含义的情况下翻转词边界——按词计数会惩罚没有读者认为是错误的差异,所以按字打分在韩语上同样更稳定。
实际的警告是:5% 的 CER 和 5% 的 WER 不是同一个主张。同样一份输出,按字算的分数在数值上低于按词算的分数,因为一个写错的词里通常仍有几个正确的字。一张悄悄混用两种指标的多语言准确率表——这样的表不少——连自己内部各行之间都没有可比性。这件事与我们直接相关:LoroNote 在设备上转写 100 多种语言,而“它在我的语言里有多准”这个问题,要先弄清你的语言到底是用哪个指标衡量的,才谈得上回答。
十分钟测出你自己的 WER
上面每一个数字都测在别人的音频上。真正回答你问题的测试跑在你的音频上,而且除了一个文本编辑器,什么工具都不需要:
- 录大约两分钟有代表性的音频。 同样的房间、同样的麦克风距离、同样的语言,真实的人名和术语——样本有多诚实,测试就有多诚实。
- 用你在评估的应用转写它。
- 数之前先定规则。 这是所有人都会跳过的一步,也正是上文规范化问题的缩影:忽略标点和大小写,给数字定一个写法,事先决定语气词算不算。什么规则都行——只要在看到输出之前定下来,并在测试第二款应用时原样沿用。
- 给一段 200 个词的片段打分。 对照实际说出的话,数出每一处替换、删除和插入,除以 200。这就是你的 WER,测在唯一真正关于你的音频的基准上。
- 然后去读那些错误。 错五个语气词和错五个客户名字是同一个分数,却是完全不同的一天。如果反复出现的名字总被写错,这个具体问题有具体的解法——LoroNote 的自定义词典就是为那些模型不该再弄错的术语准备的。
因为 LoroNote 在设备端转写,而且每段录音的前两分钟免费,整个实验不花一分钱,录音也不会离开你的 iPhone——没有上传,没有账号,开着飞行模式也一样。
常见问题
词错误率怎么计算?
把三类错误——替换、删除、插入——加起来,除以实际说出的词数:WER = (S + D + I) / N。N 来自参照文本(实际说的话),不是文字稿,所以大量插入可以把 WER 推过 100%。
词错误率多少算好?
完全取决于音频。在干净、近距麦克风的单人语音上,现代大型模型能到 2–3% WER,接近实用上限;在多样化的真实英语音频上,5% 到 10% 左右已属强劲;在有交叉说话的远距麦克风会议上,旗舰模型也在 16% 上下。“好”的 WER 是在与你相似的音频上测出的那个——拿干净语音的数字回答会议室场景的问题,答的是另一个问题。
词错误率可能超过 100% 吗?
可能。插入不受说出词数的限制,一个会编造文本的模型——比如在一段静音里幻觉出句子——累积的错误可以比参照文本的词还多。超过 100% 的 WER 几乎总是插入出了问题,而不是听错了。
为什么两份评测给同一个模型报出不同的 WER?
通常是两个原因叠加:测试音频不同,文本规范化不同。规范化规则——计数前如何统一标点、大小写、数字和缩写——本身就能让一个公开的 LibriSpeech 数字移动一个百分点以上。只有在同一次评测里打分的两个系统,才能干净地比较。
WER 对每种语言都适用吗?
不。对中文、日语这类书写时不分词的语言,词边界本身就有歧义,评测改用字错误率(CER);韩语通常也更适合按字打分。同样的输出,CER 在数值上低于 WER,所以两者绝不能直接比较。
WER 能衡量说话人识别对不对吗?
不能。WER 只给词打分。把词归到正确的人名下是说话人分离,是另一个步骤,有自己的错误指标;一份文字稿可以 WER 很低,却把每一句话都归给错误的说话人。说话人识别是如何工作的讲的就是问题的这一半。
关于词错误率的最后几句话
词错误率是语音识别里最有用的数字,也是最容易被误用的数字。公式本身是诚实的——三类错误除以说出的词数——但每一个公开数字都带着沉默的乘客:它测在哪个测试集上、文本经过了哪套规范化规则、语言不再使用空格时指标发生了什么切换。带着这三个问题去读任何 WER,数字才真正开始提供信息。更好的做法,是花十分钟在你自己的音频上测一个——那是唯一真正关于你的测试集。
参考来源
- OpenAI,Robust Speech Recognition via Large-Scale Weak Supervision——Whisper 论文;附录 C 介绍了文本规范化工具及其对测得 WER 的影响
- OpenAI,whisper-large-v3 模型卡——分语言数字,按语言以 WER 或 CER 报告
- Open ASR Leaderboard——多基准英语平均值与 AMI 会议数据
- LibriSpeech 语料库——test-clean / test-other 的划分
- LoroNote,Whisper 到底有多准?真实数字——上文公开数字及其测量条件
各数字于 2026 年 8 月 26 日对照上述来源复核。
