ИИ

Что такое Word Error Rate (WER)? Как измеряют точность расшифровки (2026)

LoroNote Team11 min

WER считает замены, пропуски и вставки против слов, которые прозвучали на самом деле. Что входит в формулу, о чём она молчит, почему одна модель получает разные цифры в двух публикациях — и как за десять минут измерить собственный WER.

Короткий ответ: word error rate (WER) — стандартная линейка точности расшифровки. Она считает три вида ошибок — заменённое слово, пропущенное слово, вставленное слово — и делит их сумму на число слов, которые прозвучали на самом деле. WER 10% означает, что неверно примерно каждое десятое слово. В определении спрятаны три сюрприза: WER может превышать 100%; одна и та же расшифровка может получить две разные оценки в зависимости от того, как текст нормализовали перед подсчётом; и сама по себе цифра ничего не значит, пока неизвестно, на каком аудио её измерили. А для языков, которые пишутся без пробелов, — например японского и китайского — отрасль переходит на посимвольную метрику character error rate (CER), которую поставщики часто цитируют так, будто это то же самое.

Это руководство написано командой LoroNote 26 августа 2026 года. LoroNote выполняет Whisper Large V3 Turbo на устройстве, так что цифры WER определяют, что мы строим и что заявляем, — и каждая цифра ниже взята из опубликованной статьи и карточек моделей OpenAI или из публичного Open ASR Leaderboard; все ссылки в конце. Наших собственных измерений здесь нет.

Формула: три способа ошибиться в расшифровке

WER сравнивает два текста: эталон (то, что было сказано на самом деле, — аккуратная человеческая расшифровка) и гипотезу (то, что выдала машина). Любое расхождение между ними попадает в одну из трёх категорий:

  • Замена (S, substitution) — слово заменено другим словом
  • Пропуск (D, deletion) — произнесённое слово отсутствует в расшифровке
  • Вставка (I, insertion) — в расшифровке есть слово, которого никто не говорил

Оценка — сумма всех трёх, делённая на число слов в эталоне:

WER = (S + D + I) / N, где N — число произнесённых слов, а не число слов в расшифровке.

Разберём пример. Сказано: «пожалуйста, пришлите итоговый отчёт Марине к утру пятницы» — восемь слов. В расшифровке: «пожалуйста, пришлите готовый отчёт Марии к утру». Это две замены (итоговыйготовый, МаринеМарии) и один пропуск (пятницы): три ошибки на восемь слов, WER 37,5%. Обратите внимание, что пример протаскивает незаметно: исковерканное имя — та ошибка, которая действительно дорого обходится, а считается она ровно так же, как «итоговый», ставший «готовым». Об этом ниже.

Почему WER может быть больше 100%

Замены и пропуски ограничены длиной эталона: нельзя пропустить больше слов, чем прозвучало. Вставки — нет. Порождающая речевая модель, получив отрезок почти полной тишины, может выдумать целые предложения, и каждое выдуманное слово — вставка, посчитанная против эталона из почти нуля слов. Это выталкивает WER за 100%, и это не ошибка округления, а формула, работающая как задумано. Поэтому же галлюцинации — задокументированная склонность Whisper выдавать гладкий текст там, где аудио затихает или переходит в музыку, — значат больше, чем их доля в среднем WER: как две архитектуры моделей различаются именно на этом, мы сравнили в статье Parakeet V3 против Whisper Large V3.

WER против «точности 99%»

Поставщики редко рекламируют word error rate — они рекламируют точность. Пересчёт простой: точность — это примерно 100% минус WER. Но подача делает много тихой работы. «Точность 99%» звучит как свойство продукта. WER же всегда описывает продукт на конкретном тестовом наборе, а баннер с процентом точности почти никогда его не называет. Один и тот же движок, зарабатывающий 97% на чистой начитанной речи с близким микрофоном, наберёт 84% на записи совещания с дальним микрофоном — и в программе при этом не изменится ничего. Точная цифра точности без названного тестового набора — это рекламное решение, а не измерение.

Практическое правило: встретив процент точности, вычтите его из 100 и спросите: «на каком аудио?» Если ответ не опубликован, цифру не с чем сравнивать — включая цифру того же поставщика за прошлый год.

Не все ошибки стоят одинаково — а WER этого не видит

WER намеренно демократичен: пропущенное «э-э» стоит ровно столько же, сколько перепутанное название лекарства, — по одной ошибке за каждое. Эта нейтральность делает метрику объективной и сравнимой между системами — и она же остаётся её самым известным ограничением. Расшифровка с пятью исковерканными словами-паразитами и расшифровка с пятью исковерканными именами клиентов имеют одинаковый WER и очень разные последствия.

Команды, занимающиеся оценкой, иногда обходят это взвешенными метриками по ключевым словам или отдельным подсчётом ошибок в именах и названиях, но заголовочные цифры, которые вы встретите — в публикациях, в рейтингах, в рекламе, — почти всегда обычный WER. Практический вывод для любого, кто выбирает инструмент расшифровки: после теста читайте сами ошибки, а не останавливайтесь на их числе. Куда попали ошибки — важнее, чем сколько их.

Нормализация: почему одна модель получает две разные оценки

Прежде чем что-либо считать, эталон и гипотезу нормализуют: приводят к нижнему регистру, убирают пунктуацию, унифицируют числа, сокращения и варианты написания. «Двадцать шесть» — это ошибка против «26»? «Еще» через «е» — против «ещё»? Каждая методика отвечает на такие вопросы собственными правилами, и правила двигают оценку.

OpenAI сочла это настолько важным, что выпустила вместе с Whisper собственный нормализатор текста и посвятила его влиянию отдельное приложение в статье о Whisper. На бенчмарке вроде LibriSpeech разница в одной только нормализации способна сдвинуть опубликованную цифру модели больше чем на процентный пункт — а это примерно размер того разрыва, который многие громкие сравнения объявляют своим главным результатом.

Именно поэтому мы повторяем одно и то же предостережение по всему блогу, последний раз — в сравнении с Apple SpeechAnalyzer: цифры WER из двух отдельно опубликованных измерений — грубый контекст, а не приговор. Чистое сравнение только одно: две системы, оценённые в одном прогоне, на одном аудио, с одним нормализатором.

WER ничего не значит без своего тестового набора

Самый цитируемый речевой бенчмарк, LibriSpeech, собран из аудиокниг в общественном достоянии и разделён на две части, названия которых говорят сами за себя: test-clean (чистые записи, дикторы попроще) и test-other (всё, что сложнее). Один корпус, два условия — и каждая модель заметно хуже на втором. В этой структуре — весь урок WER в миниатюре: аудио является частью цифры.

Опубликованные показатели крупных моделей Whisper демонстрируют то же самое в полном масштабе. На чистой начитанной речи одного диктора — примерно 2–3% WER. В среднем по восьми разнообразным реальным английским наборам Open ASR Leaderboard — около 7,4%. На записях совещаний с далёкими микрофонами и перекрывающимися голосами — около 16%. На языке с малым объёмом данных вроде хинди опубликованные цифры стоят около 27%. Одни и те же веса, разброс на порядок — эту лестницу мы прошли ступенька за ступенькой в статье Насколько точен Whisper?

График NIST по истории STT-бенчмарков: показатели ошибок с 1988 по 2011 год для читаемой речи, новостей, телефонных разговоров и записей встреч, каждая задача на своей кривой

Более двадцати лет оценок NIST, по одной кривой на задачу — читаемая речь, новости, телефонные разговоры и записи встреч так и не сходятся к одному числу. Источник:

оценка NIST Rich Transcription

(общественное достояние).

Тестовый набор может прятать и другую ловушку: какую именно модель тестировали. Бенчмарк, разлетевшийся в 2026 году с заявлением, что новый движок Apple обошёл Whisper, измерял Whisper Small — на несколько размеров меньше моделей, которые локальные приложения реально запускают. Заголовочная цифра была настоящей; сравнение — нет.

Когда «слово» перестаёт работать: CER для японского, китайского и корейского

WER предполагает, что предложение можно разделить на слова, просто взглянув на него. Японский и китайский пишутся без пробелов, поэтому «сколько слов в этом предложении» — само по себе модельное решение: два токенизатора дают два разных подсчёта, и метрика наследует это разногласие. Для таких языков оценки переходят на character error rate (CER) — ту же арифметику замен, пропусков и вставок, применённую к символам вместо слов. Карточка модели Whisper Large V3 у самой OpenAI приводит для японского, китайского, корейского и тайского именно CER, а не WER.

Официальный график OpenAI: показатели ошибок Whisper large-v3 и large-v2 по языкам на Common Voice 15 и FLEURS; языки курсивом оцениваются по CER

Опубликованные OpenAI показатели ошибок Whisper large-v3 и large-v2 по языкам (Common Voice 15, FLEURS). Языки, набранные курсивом, — корейский, японский, мандаринский, кантонский, тайский — оцениваются по CER, остальные по WER. Источник:

репозиторий OpenAI Whisper

(лицензия MIT).

Корейский — поучительный промежуточный случай: пробелы в нём есть, но частицы присоединяются к словам, а допустимые варианты расстановки пробелов меняют границы слов, не меняя смысла, — так что пословный подсчёт наказывает за различия, которые ни один читатель не назвал бы ошибками, и посимвольная оценка стабильнее и здесь.

Практическое предупреждение: CER 5% и WER 5% — не одно и то же утверждение. Посимвольные оценки численно ниже пословных на том же выводе, потому что в неверном слове обычно всё равно есть несколько верных символов. Многоязычная таблица точности, тихо смешивающая две метрики, — а таких много — несравнима между собственными строками. Для нас это не абстракция: LoroNote расшифровывает более 100 языков на устройстве, и вопрос «насколько он точен на моём языке» имеет ответ только после того, как выяснится, какой метрикой ваш язык вообще измеряют.

Как за десять минут измерить собственный WER

Каждая цифра выше измерена на чужом аудио. Тест, который отвечает на ваш вопрос, выполняется на вашем — и не требует ничего, кроме текстового редактора:

  1. Запишите около двух минут репрезентативного аудио. Та же комната, то же расстояние до микрофона, тот же язык, настоящие имена и термины — тест честен ровно настолько, насколько честна выборка.
  2. Расшифруйте запись приложением, которое оцениваете.
  3. Определите правила до подсчёта. Этот шаг пропускают все, а это задача нормализации из раздела выше в миниатюре: игнорируйте пунктуацию и регистр, выберите одно написание для чисел и заранее решите, считаются ли слова-паразиты. Подойдут любые правила — если вы зафиксировали их до взгляда на результат и держите неизменными, когда тестируете второе приложение.
  4. Оцените отрезок в 200 слов. Сверьте расшифровку с тем, что было сказано, и посчитайте каждую замену, каждый пропуск и каждую вставку. Разделите на 200. Это ваш WER — на единственном бенчмарке, который вообще был про ваше аудио.
  5. Затем прочитайте сами ошибки. Пять исковерканных слов-паразитов и пять исковерканных имён клиентов — одинаковая оценка и совсем разные дни. Если раз за разом ломаются одни и те же имена, у этой конкретной проблемы есть конкретное решение: пользовательский словарь LoroNote существует ровно для терминов, которые модель пора перестать путать.

LoroNote расшифровывает на устройстве, а первые две минуты каждой записи бесплатны, так что весь эксперимент ничего не стоит, и запись не покидает iPhone: ни шага загрузки, ни аккаунта, и авиарежим ничего не меняет.

Частые вопросы

Как рассчитывается word error rate?

Сложите три вида ошибок — замены, пропуски и вставки — и разделите на число слов, которые прозвучали на самом деле: WER = (S + D + I) / N. N берётся из эталона (того, что было сказано), а не из расшифровки, — поэтому обильные вставки могут вытолкнуть WER за 100%.

Какой WER считается хорошим?

Это целиком зависит от аудио. На чистой речи одного диктора с близким микрофоном современные крупные модели достигают 2–3% WER — это около практического потолка; на разнообразном реальном английском аудио примерно 5–10% — сильный результат; на совещаниях с далёким микрофоном и перебиваниями даже флагманские модели показывают около 16%. «Хороший» WER — тот, что измерен на аудио, похожем на ваше: поставщик, цитирующий цифры чистой речи для сценария переговорной, отвечает на другой вопрос.

Может ли WER быть больше 100%?

Может. Вставки не ограничены числом произнесённых слов, поэтому модель, выдумывающая текст — например, галлюцинирующая предложения на отрезке тишины, — способна накопить больше ошибок, чем в эталоне слов. WER выше 100% почти всегда сигнализирует о проблеме вставок, а не об ослышках.

Почему два измерения дают одной модели разные WER?

Обычно по двум причинам сразу: разное тестовое аудио и разная нормализация текста. Правила нормализации — как перед подсчётом унифицируются пунктуация, регистр, числа и сокращения — сами по себе способны сдвинуть опубликованную цифру на LibriSpeech больше чем на пункт. Чисто сравнимы только две системы, оценённые в одном прогоне.

Подходит ли WER для любого языка?

Нет. Для языков, которые пишутся без пробелов, — например японского и китайского — границы слов неоднозначны, и оценки используют character error rate (CER); корейскому посимвольная оценка обычно тоже подходит лучше. Значения CER численно ниже WER на том же выводе, поэтому напрямую сравнивать их нельзя.

Измеряет ли WER, правильно ли определены говорящие?

Нет. WER оценивает только слова. Приписать их правильному человеку — это диаризация, отдельный этап с собственной метрикой ошибок, и расшифровка может иметь низкий WER, приписывая каждую реплику не тому голосу. Как работает определение говорящих описывает эту половину задачи.

Word Error Rate: главное

Word error rate — самая полезная цифра в распознавании речи и самая лёгкая для злоупотребления. Формула честная — три вида ошибок против произнесённых слов, — но у каждой опубликованной цифры есть молчаливые попутчики: тестовый набор, на котором её измерили; нормализатор, подготовивший текст; и подмена метрики там, где язык перестаёт использовать пробелы. Читайте любой WER с этими тремя вопросами — и цифры станут по-настоящему информативными. А лучше потратьте десять минут и измерьте один на собственном аудио: это единственный тестовый набор, который вообще был про вас.

Источники

Цифры сверены с указанными источниками 26 августа 2026 года.

Ваш голос становится текстом — офлайн

LoroNote расшифровывает встречи, лекции и интервью прямо на iPhone — приватно, точно и без ограничений.

Скачать в App Store