Насколько точен Whisper? Реальные цифры — от аудиокниг до переговорных (2026)
Команда LoroNote9 min

Содержание
- Что на самом деле измеряет WER
- Лестница точности: одна модель, четыре ступени
- Какой именно Whisper? Вариант меняет ответ
- Язык влияет на цифры сильнее любого программного выбора
- Галлюцинации: ошибка, которую WER недооценивает
- Что реально влияет на точность ваших записей
- Как за десять минут измерить точность Whisper самому
- Часто задаваемые вопросы
- Вывод
- Официальные ресурсы
Короткий ответ: единой цифры точности у Whisper нет — есть лестница. На чистой начитанной речи одного диктора крупные модели достигают примерно 2–3% пословных ошибок (WER), то есть верны более 97 слов из 100. По смеси реальных английских бенчмарков Whisper Large V3 в среднем даёт около 7,4% WER. На аудио из переговорных — далёкие микрофоны, перекрывающиеся голоса — та же модель показывает около 16%. А на языках с малым объёмом данных ошибка может вырасти ещё втрое. «Точен» ли Whisper, зависит от того, на какой ступени стоит ваша запись, — и в той же мере от того, какой именно вариант Whisper запускает ваше приложение.
Каждая цифра в этой статье взята из опубликованной статьи и карточек моделей OpenAI или из публичного рейтинга Open ASR Leaderboard — ссылки в источниках в конце. Материал подготовила команда LoroNote 19 августа 2026 года. LoroNote запускает Whisper Large V3 Turbo на устройстве, так что интерес у нас есть — именно поэтому ниже нет ни одной нашей собственной маркетинговой цифры.
Что на самом деле измеряет WER
WER считает слова, которые расшифровка передала неверно — заменённые, пропущенные или выдуманные, — как долю от произнесённых. WER 5% — это одна ошибка на каждые 20 слов; 16% — одна на шесть. Из определения следуют две вещи:
- WER имеет смысл только вместе с аудио, на котором он измерен. «Точность 98%» без названного тестового набора — лозунг, а не измерение. Одна и та же модель даёт 97%+ на аудиокниге и 84% в конференц-зале, и ничего при этом не сломано.
- Не все ошибки стоят одинаково. Пропущенное «э-э» и перепутанное название лекарства считаются по одному разу. WER — стандартная линейка, потому что она объективна, а не потому, что передаёт, насколько расшифровкой удобно пользоваться. Поэтому тест на собственном аудио, описанный ниже, важнее любой таблицы.
Полное определение — формулу, причину, по которой WER может превышать 100%, и шаг нормализации, тихо двигающий опубликованные цифры, — мы разобрали в статье Что такое word error rate?
Лестница точности: одна модель, четыре ступени
Вот опубликованные показатели крупных моделей Whisper на стандартных бенчмарках:
| Условия записи | Бенчмарк | Примерный WER | Источник |
|---|---|---|---|
| Чистая начитанная речь, один диктор | LibriSpeech test-clean | ~2–3% | Статья OpenAI о Whisper (2,7%, large) |
| Смесь реального английского, восемь наборов | Среднее Open ASR Leaderboard | ~7,4% (Large V3) | Open ASR Leaderboard |
| Переговорные, далёкие микрофоны, перебивания | Корпус встреч AMI | ~16% (Large V3) | Open ASR Leaderboard |
| Пример языка с малым объёмом данных | Хинди (Common Voice) | ~27% (Large V3) | Карточка openai/whisper-large-v3 |
Прочитайте лестницу сверху вниз, и закономерность очевидна: хуже становится не модель — хуже становится аудио. Диктовка в телефон у самого рта — это верхняя ступень. Интервью через столик в кафе — середина. Встреча, записанная с дальнего края стола, оказывается на третьей ступени ещё до того, как сделан хоть один программный выбор.
Какой именно Whisper? Вариант меняет ответ
«Работает на Whisper» описывает семейство, а не модель. Whisper выпускается в размерах от tiny до large, и разброс между ними больше, чем разброс между поставщиками:
- Large V3 — флагман по точности. OpenAI обучила его на 1 миллионе часов слабо размеченного аудио плюс 4 миллионах часов псевдоразмеченного и сообщает, что ошибок стало на 10–20% меньше, чем у Large V2, на широком наборе языков.
- Large V3 Turbo — производная, оптимизированная по скорости: 809 миллионов параметров, декодер сокращён с 32 слоёв до 4. Плату за это OpenAI описывает как «незначительное снижение качества» — в Open ASR Leaderboard средние стоят рядом (примерно 7,8% против 7,4% среднего WER; примерно 16,1% против 16,0% на AMI). В сумме по языкам Turbo работает примерно как Large V2, а больше всего теряет на нескольких языках вроде тайского и кантонского. Этот компромисс мы разобрали в руководстве по Whisper Large V3 Turbo.
- Small и medium дают на несколько пунктов больший WER — разрыв, заметный уже на тесте длиной в один абзац. На iPhone это важно особенно: несколько известных «Whisper-приложений» запускают на телефоне small или medium, даже когда их версии для Mac работают на large. Наше сравнение Whisper-приложений перечисляет, какой вариант реально загружает каждое приложение для iOS.
Практическое правило: прежде чем сравнивать приложения по точности, проверьте, какой Whisper запускает каждое. Приложение с Large V3 Turbo и приложение со small предлагают не одну и ту же точность, что бы обе страницы ни писали про «Whisper AI».
Язык влияет на цифры сильнее любого программного выбора
Обучающие данные Whisper сильно смещены в сторону языков с большим объёмом материала, и точность следует за этим. Английский, испанский, немецкий, японский, корейский и другие хорошо представленные языки группируются возле средних значений выше. У языков с малым объёмом данных ошибка намного выше — цифра по хинди в таблице лишь один опубликованный пример, и карточка модели OpenAI отмечает неровные результаты также между акцентами и диалектами внутри языков.
Whisper Large V3 охватывает около 100 языков (кантонский добавлен в V3), так что «поддерживается» и «одинаково точен» — разные утверждения. Если ваш язык вне верхнего эшелона, честный совет тот же, что и во всей статье: прогоните короткую собственную запись и посмотрите на результат — полный список языков показывает, за что LoroNote возьмётся, а две минуты вашего аудио — насколько хорошо.
Галлюцинации: ошибка, которую WER недооценивает
Карточка модели OpenAI говорит прямо: поскольку модели обучены на больших массивах шумных данных, «предсказания могут содержать текст, которого в аудио на самом деле не звучало (то есть галлюцинации)». На практике это проявляется на тишине, фоновом шуме и музыке: Whisper — порождающая модель, и, когда речи, за которую можно зацепиться, нет, она может выдать гладкие фразы, которых никто не говорил.
Держать это под контролем помогают две вещи:
- Приложения умеют это смягчать. Детектор голосовой активности, пропускающий тихие участки, лишает модель главной возможности выдумывать текст. Это поведение уровня приложения, а не настройка модели, и одно из реальных различий между приложениями с одним и тем же Whisper.
- Это можно заметить. Галлюцинированный текст обычно появляется на участках, которые, как вы знаете, были тихими, — в конце записи, на длинной паузе. Если середина расшифровки крепкая, а на паузах выросли предложения, перед вами галлюцинация, а не ослышка.
Мы сравнили это поведение с моделью-трансдьюсером в статье Parakeet V3 против Whisper Large V3 — трансдьюсеры меньше галлюцинируют на тишине, зато Whisper покрывает несравнимо больше языков; бесплатного обеда нет.
Что реально влияет на точность ваших записей
В бенчмарках различается аудио — и в ваших записях различается то же самое. В примерном порядке влияния:
- Расстояние до микрофона. Самый большой рычаг. Телефон на расстоянии вытянутой руки на столе выигрывает у телефона на другом конце комнаты больше, чем любое обновление модели.
- Шум и музыка. Ровный фоновый шум портит результат постепенно; музыка и стук — резко.
- Перекрывающиеся голоса. Перебивания — причина, по которой корпуса встреч стоят на ~16%, когда речь одного диктора стоит на ~3%.
- Специальная лексика. В именах, названиях препаратов, тикерах и жаргоне модель ошибается непропорционально часто. Пользовательский словарь LoroNote существует ровно для этого: повторяющиеся термины, которые пора перестать путать.
- Вариант модели — единственный фактор выше, который является чисто программным выбором; поэтому LoroNote запускает самый крупный из вариантов Whisper, практичных на телефоне.
Отдельное замечание про метки говорящих: диаризация не меняет WER, но решает, можно ли вообще пользоваться расшифровкой с несколькими голосами. Точная расшифровка без меток говорящих всё равно требует ручного разбора; вторая половина задачи описана в руководстве по разделению говорящих.
Как за десять минут измерить точность Whisper самому
Тест на собственном аудио важнее любой таблицы в этой статье:
- Запишите около двух минут, похожих на реальное использование: та же комната, то же расстояние, тот же язык, настоящие имена и термины. Две минуты речи — это больше 250 слов, как раз достаточно для подсчёта ниже.
- Расшифруйте и прочитайте результат, сверяясь с аудио.
- Посчитайте ошибки на отрезке в 200 слов: каждое заменённое, пропущенное или выдуманное слово. Ошибки ÷ 200 = ваш WER.
- Оцените сами ошибки, а не только их число: пять исковерканных «э-э» и пять исковерканных имён клиентов — одинаковый WER и совсем разные последствия.
Точная версия этого метода — включая то, как заранее решить, что считается ошибкой, — в нашем руководстве по WER.
LoroNote расшифровывает на устройстве, а бесплатная версия расшифровывает первые две минуты каждой записи — ровно столько, сколько нужно для этого теста. Он ничего не стоит, и запись не покидает iPhone: нет ни шага загрузки, ни аккаунта, и авиарежим ничего не меняет.
Часто задаваемые вопросы
Достаточно ли точен Whisper для профессиональных расшифровок?
Для чистых записей с близким микрофоном на хорошо представленных языках крупные модели Whisper дают черновики, которые большинство людей лишь слегка правит: 2–3% WER на чистой речи — близко к практическому потолку автоматических систем. Для встреч с далёким микрофоном, сильных перебиваний или критичной дословности закладывайте время на вычитку: при 16% WER вашего внимания требует одно слово из шести.
Теряет ли Whisper Large V3 Turbo в точности по сравнению с Large V3?
Немного. OpenAI называет снижение незначительным, а публичные средние рейтинга расходятся в английском меньше чем на пункт. В сумме по языкам Turbo работает примерно как Large V2, с наибольшими потерями на нескольких языках вроде тайского и кантонского. Взамен он существенно быстрее — тот самый размен, который делает модель Large-серии практичной на телефоне.
Почему в расшифровке есть фразы, которых никто не говорил?
Это галлюцинация — задокументированное поведение Whisper на тишине, шуме и музыке: порождающая модель без речи, за которую можно зацепиться, всё равно может выдать связный текст. Проверьте тихие участки записи. Приложения, прогоняющие детектор голосовой активности перед Whisper, в основном этого избегают — это поведение приложения, а не пользовательская настройка.
Снижает ли запуск Whisper на устройстве его точность?
Нет. Одни и те же веса модели дают одно и то же качество расшифровки, где бы они ни работали; вывод на устройстве — не «урезанный режим». Между приложениями различается то, какой вариант они запускают: облачным сервисам легко разместить самые крупные модели, а приложениям на устройстве нужно уместиться в телефон — поэтому некоторые запускают small или medium. LoroNote запускает Large V3 Turbo локально, совмещая модель Large-серии и приватность на устройстве в одном приложении.
Вывод
У вопроса «насколько точен Whisper» есть форма, а не число: примерно 2–3% WER на чистой начитанной речи, около 7% по смеси английских бенчмарков, порядка 16% на аудио встреч — и хуже на языках с малым объёмом данных; плюс галлюцинации — оговорка, которую WER недооценивает. Два выбора, сильнее всего влияющие на ваши результаты, — физический (поднесите микрофон ближе) и структурный (знайте, какой вариант Whisper запускает ваше приложение). Остальное измеряется за десять минут на вашей собственной записи — единственном бенчмарке, который вообще был про вас.
Официальные ресурсы
Ваш голос становится текстом — офлайн
LoroNote расшифровывает встречи, лекции и интервью прямо на iPhone — приватно, точно и без ограничений.
Скачать в App Store