指南

提高转录准确率的五个因素:按实测效果排序(2026)

LoroNote Team19 min

关于转录准确率的建议大多是泛泛之谈。本指南按公开实测数据,把五个因素按影响从大到小排好:麦克风距离、说话人重叠、噪声与静音、语言与词汇、模型规格——每一条都附上公开数字,说明它到底能让错误率差多少。

快速结论: 转录准不准,大半在软件开始工作之前就已经定了。按公开的实测数据,影响从大到小依次是:麦克风距离与房间声学(同一个旗舰模型,近距离收音时错误率约 2–3%,麦克风离得远的会议录音里则在 16% 左右——错误率翻了五倍)、说话人重叠(会议录音在所有基准里垫底的主因)、噪声与长段静音(静音段正是语音模型凭空编出文字的地方)、语言与词汇(不同语言的公开错误率能差出十倍以上),最后才是模型规格——五项里唯一纯靠换软件就能改的。下文会为每一条给出对应的实测数字。

本指南由 LoroNote 团队写于 2026 年 8 月 27 日。文中每一个基准数字都来自我们经过核查的转写统计页(英文)所汇总的一手来源;结尾的测量方法来自词错误率指南。LoroNote 在设备上运行 Whisper Large V3 Turbo,你的录音条件变好,我们产品的输出就变好——我们没有任何动机告诉你“现在这样就挺准的”。

五个因素,按实测效果排序

因素实测证据你能改变什么
1. 麦克风距离同一模型:近距离约 2–3% WER,麦克风远的会议 16% 左右手机放在哪里
2. 说话人重叠有人抢话的会议录音在所有基准里垫底轮流发言、座位安排
3. 噪声与静音信噪比低于约 10 dB 时识别率急剧下降;幻觉集中在静音段环境、剪掉静音
4. 语言与词汇各语言公开 WER 从 4.3% 到 55.7%;人名和术语最先出错自定义词典、把名字说清楚
5. 模型规格同一次评测里,Whisper Small 的错误约为 Large 级引擎的两倍用哪款应用

顺序本身就是重点。嫌不准就换应用,动的其实是第 5 项;而大部分错误产生在第 1–3 项。

白色背景上的 Shure SM57 动圈麦克风

一支舞台动圈麦克风。但真正起作用的不是硬件的档次,而是麦克风——包括手机内置的那一支——离人声有多近。来源:

Wikimedia Commons (E bailey)

, CC BY-SA 4.0.

因素一:麦克风距离——一项就差五倍

对准确率影响最大的,是麦克风离嘴有多远。公开数据里最有说服力的证据,是同一个模型只换条件的测量结果:Whisper Large V3 在八个真实英语测试集上的平均 WER 约 7.4%,在干净的近距离朗读语音上约 2–3%——而在 AMI 语料上是 16% 左右。AMI 是一批在会议室里、用离说话人很远的麦克风录下的音频。这中间,软件一行都没变,变的只有音频。

实际怎么做:

  • 先挪手机,别急着买设备。 放在说话人手边的手机,胜过房间另一头的昂贵设备。两人访谈时,把手机放在两人中间,再往声音小的那位挪一点。
  • 开会时把设备放到桌子中央,而不是自己座位旁。离最远的发言人每多一米,造成的损失换什么应用都补不回来。
  • 一个人口述的话,条件本来就是最好的。 手机拿在一臂之内说话,就是标准的近距离收音,也是各基准里成绩最好的那类音频。这样录出来还是不准,问题就不在距离,而在下面几项。

因素二:说话人重叠

抢话,是会议音频在各基准里垫底的第二个原因。两个人同时开口时,根本不存在可转写的干净信号——模型只能跟住其中一条声音,没被跟住那条里的每个词都会变成错误。这首先是物理问题,其次才是软件问题,所以再怎么升级模型也绕不开。

实际怎么做:

  • 一次只让一个人说话,比调任何设置都管用。 在你能主持的会议里,等对方把话说完再开口,这个习惯本身就在提高准确率。
  • 让关键发言人坐得离麦克风近一些。 拍板的人要是在远处角落里含糊,转写稿垮掉的也正是那一段。
  • 别指望说话人标签在重叠处还能可靠。 分辨谁说了什么是转写之外的独立步骤,有它自己的出错方式——说话人识别是如何工作的讲了它在哪里失灵。抢话的段落里,转写稿可能每个词都对,却把话安到错误的人头上。

因素三:噪声、音乐与静音

平稳的背景噪声会让转写质量逐渐下滑;Whisper 论文自带的鲁棒性测试显示,噪声一旦超过信噪比约 10 dB 的关口——大致相当于嘈杂咖啡馆或酒吧——识别率就一路下跌,而参与对比的其他模型跌得比 Whisper 还快。音乐比普通噪声更糟,因为它多了一层问题:语音模型是在海量网络音频上训练的,见过大量带歌词的歌,听到音乐就会试着把歌词写下来。

静音有它自己的陷阱。2024 年一项针对 Whisper API 的研究发现,约 1% 的转写里出现了凭空编造的语句——这些句子集中出现在音频安静下来的地方,停顿较长的说话人受影响尤其明显。(静音段催生的插入错误,也正是 WER 可能超过 100% 的原因。)

实际怎么做:

  • 宁选安静的房间,不选更好的麦克风。 安静房间里的手机,胜过嘈杂房间里的好麦克风。
  • 重要的录音,先把背景音乐关掉。 音乐既是盖住人声的噪声,又是一段和人声抢着被转写的文字。
  • 转写前剪掉长段静音,或者干脆分段录——静音不是无害的空白,而是编造文字冒出来的地方。读转写稿时,对应录音里安静的那几段也要多留个心眼。

因素四:语言、口音与词汇

同一个 Whisper 模型,不同语言的公开数字能差出十倍以上——Common Voice 15 上从荷兰语的 4.3% 到阿尔巴尼亚语的 55.7%。口音造成的差距也有据可查:一项经同行评审的研究测过 2019 年前后的五个商用系统,美国黑人说话者的平均错误率为 35%,白人说话者为 19%。模型用什么数据训练,靠设置改不了——但有两件事确实由你决定:

  • 人名、行话和产品术语最先出错,而且每次都错在同一个地方。 模型从没见过你客户的名字,所以每次都会猜出同一个错词。准确率问题里,真正有直接解法的就是这一个:把反复出现的术语在 LoroNote 的自定义词典里登记一次,模型就不再瞎猜了。
  • 说到数字、人名和编号时,刻意放慢、咬清楚。 这个习惯不花一分钱,保护的恰恰是错了代价最大的那些词——错一个日期和错一个语气词,在基准里同样算一个错,对你的工作却是天壤之别。
  • 如果你的语言在公开图表上排名靠后,用自己的两分钟音频实测一次,比看任何表格都可靠——分语言图表,以及为什么有些语言按 CER 而不是 WER 计分,都在词错误率指南里。

因素五:模型规格——唯一靠换软件就能改的

录音条件已经做到现实允许的程度之后,剩下的就看应用运行的是哪个模型了。这个差距一点也不小:在唯一一次把两个级别放到同一条件下实测的基准里,Whisper Small 在 LibriSpeech test-clean 上是 3.74%、test-other 上是 7.95%,而 Large 级引擎在 2% 和 4.5% 附近——错误少了将近一半,只因为应用替你选了模型规格。应用商店里一句“Powered by Whisper”,盖住的是错误率能差出一倍的各种规格,而确实有不少 iOS 应用悄悄跑的是小模型

实际怎么做:为了准确率换应用之前,先查清候选应用实际加载的是哪个规格。LoroNote 在设备上运行的是 Large 家族的 Whisper Large V3 Turbo;在 iPhone 15 Pro 上约 19 倍实时速度(我们自己测的),用上大模型的准确率,不需要拿漫长的等待来换。

帮助不大的那些做法

三件大家常试、但证据并不支持的事:

  • 用更高的采样率录音。 Whisper 在“听”之前会把所有音频重采样到 16,000 Hz——论文里写得明明白白。96 kHz 的录音棚文件和普通语音备忘录,到了模型那里没有任何区别;这份力气不如花在挪近麦克风、找个安静房间上。
  • 换台新手机。 近几代 iPhone 的瓶颈从来不是麦克风本身,而是它摆的位置。(新手机可以转写得更快,但那是速度,不是准确率。)
  • 转写前先做“音质增强”处理。 过猛的降噪会把模型赖以识别的谐波结构一起抹掉。真要用,就拿同一段音频数一数处理前后的错误数来验证,别相信“听起来更干净”——对人耳更干净的声音,对模型未必更干净。

用数字验证,别靠感觉

上面每个因素都能在十分钟内验证:按现在的条件录两分钟,转写,按事先定好的规则数出 200 个词里的错误;然后只改一件事——把手机挪近,或者关掉音乐——再把同一段话录一遍、转一遍。完整的计数方法,包括怎么事先定好“什么算错误”,都在词错误率指南里。LoroNote 在设备端转写,每段录音的前两分钟免费,所以这个前后对比实验一分钱不花,开着飞行模式照样能做。

常见问题

为什么我的转录这么不准确?

按顺序排查这几件事:麦克风离说话人有多远、有没有人抢话、房间吵不吵、录音里静音多不多、出错的词是不是集中在人名和行话,最后才轮到应用运行的是哪个模型。公开基准里,光是“麦克风从近到远”这一个变化,就能把同一个模型的词错误率从约 2–3% 推到 16% 左右——这个差距,换应用是补不回来的。

外接麦克风能提高转录准确率吗?

真正提高准确率的是距离;外接麦克风只是缩短距离的一种手段。别在说话人衣领上的领夹麦,哪怕在大房间里也相当于近距离收音。不过,一部放得够近的手机就能免费拿到大部分同样的效果——先摆好位置,再考虑买硬件。

背景音乐会影响转录吗?

会,而且是两重影响:一方面它像普通噪声一样盖住人声;另一方面,语音模型学过海量带歌词的音频,可能撇下说话人去转写歌词。噪声一旦超过嘈杂咖啡馆那种信噪比约 10 dB 的水平,识别率本身也会急剧下降。重要的录音,先把音乐关掉。

口音导致的错误能用设置解决吗?

靠设置解决不了——对口音的处理能力取决于模型的训练数据,人群之间存在真实差距这一点也有研究证实。你能做的是:选一款运行 Large 级模型的应用(模型越大,对口音变化的包容度越高),把反复出现的名字和术语登记进自定义词典,再用你自己的两分钟音频实测,而不是相信拿别人的声音测出来的平均值。

录音越长,转录越不准吗?

没有证据表明时长本身会拉低准确率——起决定作用的始终是录音条件。一节离得近、环境安静的三小时讲座,从头到尾都能转写出和前十分钟一样的质量。随时长增长的是复查错误的工作量,所以录音越长,上面这些改进反而越值得做。

提高转录准确率:写在最后

准确率的建议大多指向软件,因为软件换起来最容易。可实测数据指向另一边:五倍的差距来自麦克风距离和房间声学,最顽固的错误来自抢话和静音,真正靠软件能改的只有应用加载的模型规格这一项。把手机挪近,找个安静的房间,一次一个人说话,把常出现的名字登记进词典,查清应用用的模型——按这个顺序来,并且每改一处,就用你自己录音的前后错误数验证一次。因为真正要紧的准确率,只有从你自己的录音里测出来的那一个。

来源

各数字于 2026 年 8 月 26–27 日对照上述来源复核。

让声音变成文字 — 离线完成

LoroNote 在 iPhone 上直接转写会议、课程和访谈 — 私密、准确、不限量。

在 App Store 下载