
Содержание
- Пять факторов: что и насколько влияет
- Фактор 1. Расстояние до микрофона: пятикратная разница
- Фактор 2. Перебивания
- Фактор 3. Шум, музыка и тишина
- Фактор 4. Язык, акцент и словарь
- Фактор 5. Размер модели: единственное, что решается софтом
- Что почти не помогает
- Проверяйте цифрами, а не на слух
- Частые вопросы
- Как улучшить точность расшифровки: главное
- Источники
Короткий ответ: точность расшифровки в основном определяется ещё до запуска программы. Если расставить факторы по опубликованным измерениям, порядок такой. Первое — расстояние до микрофона и акустика помещения: та же флагманская модель, что показывает 2–3% word error rate на речи, записанной с близкого расстояния, на записях совещаний с дальним микрофоном даёт около 16% — ошибок становится в пять раз больше. Второе — перебивания: главная причина, по которой записи совещаний занимают последние места во всех бенчмарках. Третье — шум и долгие паузы: именно в тишине речевые модели выдумывают текст, которого никто не говорил. Четвёртое — язык и словарь: опубликованные показатели по языкам расходятся более чем в десять раз. И только пятое — размер модели, единственный фактор, который целиком зависит от выбора программы. Ниже к каждому утверждению приложена его измеренная цифра.
Это руководство написано командой LoroNote 27 августа 2026 года. Все цифры бенчмарков взяты из первоисточников, собранных на нашей странице проверенной статистики расшифровки; метод измерения в конце — из нашего руководства по word error rate. LoroNote выполняет Whisper Large V3 Turbo прямо на устройстве, поэтому чем лучше ваши условия записи, тем лучше работает и наше приложение — уверять вас, что точность и так в порядке, нам попросту невыгодно.
Пять факторов: что и насколько влияет
| Фактор | Измеренные данные | Что в ваших руках |
|---|---|---|
| 1. Расстояние до микрофона | ~2–3% WER с близким микрофоном против ~16% на совещаниях (одна и та же модель) | Где лежит телефон |
| 2. Перебивания | Записи совещаний с наложением голосов — последние строчки любого бенчмарка | Очерёдность реплик, рассадка |
| 3. Шум и тишина | Ниже ~10 дБ сигнал/шум распознавание резко падает; галлюцинации возникают в паузах | Обстановка, обрезка пауз |
| 4. Язык и словарь | Опубликованные WER по языкам — от 4,3% до 55,7%; имена и термины страдают первыми | Пользовательский словарь, чёткая речь |
| 5. Размер модели | У Whisper Small примерно вдвое больше ошибок, чем у движков класса Large | Выбор приложения — единственный «софтовый» фактор |
Порядок здесь не случаен. Кто недоволен точностью, обычно идёт искать приложение получше — то есть берётся за пятый пункт, хотя основные потери приходятся на первые три.

Динамический сценический микрофон. Но дело не в классе техники, а в том, насколько близко к голосу находится любой микрофон — в том числе встроенный в телефон. Источник:
Wikimedia Commons (E bailey)
, CC BY-SA 4.0.
Фактор 1. Расстояние до микрофона: пятикратная разница
Сильнее всего на точность влияет расстояние от микрофона до говорящего. Нагляднее всего это видно по одной и той же модели, измеренной в разных условиях: Whisper Large V3 в среднем даёт около 7,4% WER на восьми разнообразных реальных английских наборах, примерно 2–3% — на чистой начитанной речи с близким микрофоном, и около 16% — на корпусе AMI, записанном в переговорных с дальними микрофонами. Программа при этом не менялась. Менялось только аудио.
Что делать на практике:
- Сначала переложите телефон — покупать ничего не нужно. Телефон, лежащий рядом с говорящим, работает лучше дорогой аппаратуры на другом конце комнаты. В интервью на двоих телефону место между вами, чуть ближе к тому, кто говорит тише.
- На совещаниях кладите устройство в центр стола, а не возле себя. Каждый лишний метр до самого дальнего участника обходится дороже, чем способна вернуть любая смена приложения.
- Если вы диктуете в одиночку, лучшие условия у вас уже есть. Телефон на расстоянии вытянутой руки — это и есть запись с близким микрофоном, верхняя ступень лестницы точности. Если такие записи всё равно расшифровываются плохо, причина не в расстоянии, а в факторах ниже.
Фактор 2. Перебивания
Наложение голосов — вторая причина, по которой записи совещаний держатся в конце бенчмарков. Когда двое говорят одновременно, чистого сигнала попросту нет: модель вынуждена выбрать один голос, и каждое слово второго превращается в ошибку. Это в первую очередь физика, а не софт — потому проблема и переживает любое обновление моделей.
Что делать на практике:
- Говорить по одному — полезнее любой настройки. Если совещание ведёте вы, привычка давать друг другу договорить напрямую повышает точность расшифровки.
- Сажайте ключевых участников ближе к микрофону. Если человек, принимающий решения, бормочет из дальнего угла, именно на его репликах расшифровка и посыплется.
- Учтите: на перебиваниях сбиваются и метки говорящих. Определение, кто что сказал, — отдельный этап со своими слабыми местами; где он ломается, разобрано в статье как работает определение говорящих. Расшифровка может верно передать слова — и приписать их не тому человеку именно в месте наложения.
Фактор 3. Шум, музыка и тишина
Ровный фоновый шум портит расшифровку постепенно. Тесты устойчивости в самой статье о Whisper показывают: как только шум переходит рубеж примерно в 10 дБ отношения сигнал/шум — уровень шумного кафе или бара, — распознавание резко падает, причём конкурирующие модели в этих условиях сдавали ещё быстрее Whisper. С музыкой дело обстоит хуже, и не только из-за громкости: речевые модели, обученные на огромных массивах веб-аудио, слышали очень много песен — и охотно принимаются записывать текст песни вместо речи.
У тишины своя ловушка. Исследование API Whisper 2024 года нашло выдуманные фразы примерно в 1% расшифровок — они скапливаются там, где запись затихает, и особенно часто в речи людей, которые подолгу держат паузы. (Такие вставки из тишины — это ещё и ответ на вопрос, как word error rate может превысить 100%.)
Что делать на практике:
- Выбирайте комнату потише, а не микрофон получше. Телефон в тихой комнате даёт больше, чем хороший микрофон в шумной.
- Выключайте фоновую музыку, если запись важна. Музыка и заглушает голос, и сама претендует на место в расшифровке.
- Перед расшифровкой вырезайте долгие паузы или записывайте частями: тишина — не пустое место, а участок, где появляется выдуманный текст. И тихие места готовой расшифровки читайте с недоверием.
Фактор 4. Язык, акцент и словарь
Опубликованные показатели одной и той же модели Whisper расходятся по языкам более чем в десять раз — от 4,3% (нидерландский) до 55,7% (албанский) на Common Voice 15. Разница между акцентами тоже реальна и подтверждена: рецензируемое исследование, измерив пять коммерческих систем образца 2019 года, получило в среднем 35% ошибок у чернокожих американцев против 19% у белых. Что попало в обучающие данные модели, настройками не изменить. Но две вещи действительно в ваших руках:
- Имена, термины и названия продуктов распознаются хуже всего — и ошибка повторяется из раза в раз. Модель никогда не видела фамилию вашего клиента и будет каждый раз подставлять одну и ту же неверную догадку. Из всех проблем точности только у этой есть прямое решение: занесите повторяющийся термин в пользовательский словарь LoroNote один раз — и модель перестанет гадать.
- Числа, имена и коды произносите особенно чётко. Это ничего не стоит, а защищает ровно те слова, где ошибка обходится дороже всего: в бенчмарке перевранная дата и перевранное слово-паразит считаются одинаково, в работе — нет.
- Если ваш язык в нижней части таблиц — двухминутная проба на собственной записи скажет больше любой таблицы. График по языкам и объяснение, почему часть языков оценивается по CER, а не по WER, есть в руководстве по WER.
Фактор 5. Размер модели: единственное, что решается софтом
Когда с записью сделано всё возможное, остаётся один вопрос: какую модель запускает ваше приложение. Разница отнюдь не косметическая. В единственном бенчмарке, где их прогнали бок о бок, Whisper Small набрал 3,74% на LibriSpeech test-clean и 7,95% на test-other, а движки класса Large держались около 2% и 4,5% — вдвое меньше ошибок из-за одного решения о размере модели, которое приложение приняло за вас. Надпись «Powered by Whisper» в описании может означать любой из размеров, хотя их точность различается вдвое, — и немало iOS-приложений без лишнего шума ставят именно младшие.
Поэтому прежде чем менять приложение ради точности, выясните, какой вариант каждое из них на самом деле загружает. LoroNote запускает на устройстве Whisper Large V3 Turbo — модель семейства Large; на iPhone 15 Pro расшифровка идёт примерно в 19 раз быстрее реального времени (наше собственное измерение), так что расплачиваться за точность большой модели долгим ожиданием не приходится.
Что почти не помогает
Три способа, к которым прибегают чаще всего — и которые не подтверждаются данными:
- Запись с более высокой частотой дискретизации. Прежде чем слушать, Whisper приводит всё аудио к 16 000 Гц — об этом прямо сказано в статье. Студийный файл 96 кГц и обычная голосовая заметка приходят к модели в одинаковом виде; лучше потратьте усилия на расстояние и тишину.
- Новый телефон. В современных iPhone узкое место — не микрофон, а его положение. (Новый телефон может расшифровывать быстрее, но это уже другое свойство.)
- Фильтры «улучшения» звука перед расшифровкой. Агрессивное шумоподавление способно смазать гармоническую структуру, по которой модель читает речь. Если всё же пользуетесь таким фильтром, проверьте его подсчётом ошибок «до и после» на одном и том же фрагменте, а не на слух: чище для уха — не значит чище для модели.
Проверяйте цифрами, а не на слух
Каждый из этих факторов проверяется за десять минут. Запишите две минуты в нынешних условиях, расшифруйте и посчитайте ошибки на отрезке в 200 слов по заранее зафиксированным правилам. Потом поменяйте что-то одно — переложите телефон или выключите музыку — и прогоните тот же текст ещё раз. Полный метод подсчёта, включая договорённость о том, что считать ошибкой, — в нашем руководстве по WER. LoroNote расшифровывает на устройстве, а первые две минуты каждой записи бесплатны, так что эксперимент «до и после» не стоит ничего и работает даже в авиарежиме.
Частые вопросы
Почему моя расшифровка такая неточная?
Пройдитесь по факторам по порядку: далеко ли лежал микрофон, перебивали ли друг друга участники, было ли в комнате шумно и много ли в записи пауз, не приходятся ли ошибки в основном на имена и термины — и, наконец, какую модель запускает приложение. В опубликованных бенчмарках одно только расстояние до микрофона сдвигает одну и ту же модель с примерно 2–3% до около 16% word error rate. Сменой приложения такую разницу не отыграть.
Улучшает ли внешний микрофон точность расшифровки?
Точность улучшает расстояние, а внешний микрофон — лишь один из способов его сократить. Петличка на говорящем даже в большом зале даёт, по сути, запись с близкого расстояния. Но телефон, положенный рядом, даёт почти тот же эффект бесплатно: сначала положение, потом техника.
Влияет ли фоновая музыка на расшифровку?
Влияет дважды. Во-первых, она заглушает голос, как любой шум. Во-вторых, речевые модели, обученные на огромном количестве аудио с текстами песен, могут записать песню вместо говорящего. К тому же, когда шум переходит уровень примерно в 10 дБ сигнал/шум — громкость шумного кафе, — резко падает и само распознавание. На важных записях музыку выключайте.
Можно ли исправить ошибки из-за акцента настройкой?
Настройкой — нет: работа с акцентами определяется обучающими данными модели, и разница между группами говорящих подтверждена исследованиями. Что в ваших силах: выбрать приложение с моделью класса Large (крупные модели лучше справляются с вариативностью произношения), занести повторяющиеся имена и термины в пользовательский словарь и мерить точность на собственных двух минутах, а не по средним, полученным на чужих голосах.
Длинные записи расшифровываются менее точно?
Сама по себе длительность на точность не влияет — влияют условия. Трёхчасовая лекция, записанная близко и в тишине, расшифровывается так же, как её первые десять минут. С длительностью растёт только объём вычитки — поэтому чем длиннее ваши записи, тем важнее советы выше.
Как улучшить точность расшифровки: главное
Советы о точности обычно указывают на программы — программу проще всего сменить. Измеренные данные указывают в другую сторону: пятикратная разница возникает из-за расстояния до микрофона и акустики помещения, самые упорные ошибки — из-за перебиваний и тишины, а софтом решается ровно одно: размер модели, которую загружает приложение. Переложите телефон, сделайте комнату тише, говорите по очереди, занесите в словарь свои имена и термины, проверьте модель — именно в этом порядке. И каждое изменение подтверждайте подсчётом ошибок «до и после» на собственной записи: единственная цифра точности, которая имеет значение, — ваша.
Источники
- Статистика AI-расшифровки: каждая цифра проверена — первоисточники и даты проверки всех бенчмарк-цифр выше
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — пересэмплирование в 16 000 Гц; устойчивость к добавленному шуму (деградация ниже ~10 дБ сигнал/шум)
- Open ASR Leaderboard — средние по смешанным бенчмаркам и цифры по переговорным AMI
- Koenecke et al., Racial disparities in automated speech recognition (PNAS, 2020) — измеренный разрыв по акцентам и диалектам
- Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms (2024) — галлюцинации на тишине
- Lyonesse, Apple’s New Speech API vs Whisper — прогон Small против движков класса Large бок о бок
- LoroNote, Что такое word error rate? — метод измерения для тестов «до и после»
Цифры сверены с указанными источниками 26–27 августа 2026 года.
Ваш голос становится текстом — офлайн
LoroNote расшифровывает встречи, лекции и интервью прямо на iPhone — приватно, точно и без ограничений.
Скачать в App Store