ИИ

Apple SpeechAnalyzer или Whisper (2026): что бенчмарк не измерил

LoroNote Team9 min

Локальный SpeechAnalyzer от Apple обошёл Whisper в широко разошедшемся бенчмарке — но тот тест гонял Whisper Small на английских аудиокнигах. Что он измерил, чего не измерил и какой движок под какую запись.

Короткий ответ: в бенчмарке, который все репостили, новый локальный SpeechAnalyzer от Apple действительно обошёл Whisper — 2,12% пословных ошибок против 3,74% на LibriSpeech test-clean. Вот только тот тест гонял Whisper Small, на английских аудиокнигах, на Mac. Whisper Large V3 и Large V3 Turbo — те самые модели, которые локальное приложение реально загружает на iPhone, — в нём не участвовали, как не участвовали ни совещания, ни акценты, ни один из примерно 99 остальных языков Whisper. Движок Apple быстрый, точный и бесплатный — в пределах тех 22 языков, которые он поддерживает. Whisper покрывает примерно впятеро больше.

Все цифры ниже взяты из статьи самого автора бенчмарка, из опубликованных работ и карточек моделей OpenAI, из Open ASR Leaderboard или из документации Apple для разработчиков — все ссылки в конце. Текст написан командой LoroNote 23 августа 2026 года. LoroNote выполняет Whisper Large V3 Turbo на устройстве, так что в этом сравнении у нас есть интерес. Именно поэтому каждая цифра здесь — чужое измерение, а не наше.

Что такое SpeechAnalyzer на самом деле

SpeechAnalyzer — это речевой фреймворк, который Apple показала на WWDC 2025 и выпустила в iOS 26. Он заменяет SFSpeechRecognizer — устаревший API, десять лет тянувший на себе почти всю стороннюю диктовку в iOS.

Важны два публичных модуля:

  • SpeechTranscriber превращает речь в текст.
  • SpeechDetector находит в аудиопотоке участки с речью.

Всё выполняется на устройстве. Языковые ресурсы загружаются через системный каталог, а не поставляются вместе с каждым приложением, — поэтому приложение, использующее этот API, почти не растёт в размере. Для языков, которые SpeechTranscriber не покрывает, Apple предлагает DictationTranscriber как запасной вариант.

Есть жёсткое требование, которое большинство сравнений пропускает: SpeechAnalyzer требует iOS 26 или новее и не имеет обратной совместимости. На iPhone, оставшемся на iOS 18, его попросту нет.

Тот самый бенчмарк

Цифры, разошедшиеся по техноизданиям в июле 2026 года, взяты из одного тестирования, которое провёл разработчик. Вот что именно измерялось:

ПараметрЗначение
КорпусLibriSpeech — 5559 высказываний (2620 test-clean, 2939 test-other)
АудиоНачитанная речь из аудиокниг, один диктор, чистая запись
Языктолько английский
ОборудованиеM2 Pro, 32 ГБ, macOS 26.5.1, полностью на устройстве
Протестированные WhisperTiny, Base, Small

И результаты:

ДвижокWER test-cleanWER test-other
Apple SpeechAnalyzer2,12%4,56%
Whisper Small (~460 МБ)3,74%7,95%
Whisper Base (~140 МБ)5,42%12,51%
Whisper Tiny (~40 МБ)7,88%17,04%
SFSpeechRecognizer (старый)9,02%16,25%

О таблице стоит сказать две вещи прямо. Отрыв Apple от собственного старого API огромен — примерно на 75% меньше ошибок, и для всех, кто строил на SFSpeechRecognizer, это и есть настоящая новость. И Apple действительно обошла все протестированные модели Whisper.

Вопрос в том, какие модели тестировали.

Три вещи, которых бенчмарк не измерил

1. Модели Whisper, которые локальные приложения реально запускают

Whisper Small — модель на 460 МБ. Это не то, что серьёзное приложение для расшифровки загружает на современный iPhone. LoroNote выполняет Large V3 Turbo: 809 миллионов параметров, декодер сокращён с 32 слоёв до 4 ради скорости.

Бенчмарк остановился, не дойдя до Medium, Large и Turbo. Для масштаба: опубликованные измерения помещают Whisper Large V3 на LibriSpeech примерно в 2,0–2,5% WER на test-clean и около 3,9–4,3% на test-other — тот же диапазон, что 2,12% и 4,56% у Apple, или чуть лучше.

Относитесь к этому сравнению осторожно. Приведённые цифры Whisper получены в отдельных измерениях, каждое со своей нормализацией текста, а не в очной дуэли на той же машине против движка Apple. Один только выбор нормализации сдвигает WER на LibriSpeech больше чем на пункт — как именно это происходит, объясняет наше руководство по WER. Честный вывод — не «Whisper Large выигрывает». Честный вывод в том, что ни один опубликованный тест не сравнивал движок Apple с теми моделями Whisper, о которых на самом деле идёт речь, а разрыв, который подразумевали заголовки, — следствие выбранного размера модели.

2. Всё, что сложнее студийной аудиокниги

LibriSpeech — это начитанная речь: один человек, книга, хороший микрофон, никто не говорит поверх. Это нижняя ступень лестницы, и именно на ней любой движок показывает свой лучший результат.

Реальные записи находятся выше. На лестнице точности, которую мы описали для Whisper, тот же Large V3, который даёт 2–3% на чистой начитанной речи, в среднем показывает около 7,4% на смеси реальных английских бенчмарков и около 16% на аудио переговорных AMI, где микрофоны далеко, а голоса накладываются.

Для SpeechAnalyzer эти ступени никто не публиковал. Пока этого нет, результат 2,12% на аудиокниге почти ничего не говорит о совещании вчетвером, записанном с середины стола. Автор бенчмарка был в этом откровенен: в статье корпус описан как «начитанная речь из аудиокниг, а не совещания».

3. Ещё девяносто девять языков

Это самый большой пробел, и автор указал на него прямо: цифры «ничего не говорят о более чем 100 языках, которые поддерживает Whisper».

По состоянию на август 2026 года SpeechTranscriber.supportedLocales возвращает 42 региональных варианта, охватывающих 22 языка:

английский (девять региональных вариантов), арабский, вьетнамский, датский, иврит, испанский, итальянский, кантонский, китайский (упрощённый, традиционный, Гонконг), корейский, малайский, немецкий, нидерландский, норвежский (букмол), португальский, русский, тайский, турецкий, финский, французский, шведский и японский.

Whisper Large V3 покрывает около 100. Пропуски в списке Apple — не экзотика: нет хинди, нет польского, нет чешского, нет греческого, нет украинского, нет индонезийского. Португальский есть только как pt_BR, европейского варианта нет.

Для русскоязычного читателя ключевой момент другой. ru_RU в списке Apple есть, так что дело не в поддержке. Дело в том, что для русского языка ни у одного из движков нет опубликованных цифр точности. Растиражированный бенчмарк измерял только английский, а Apple не публикует WER по языкам. Поэтому утверждать сегодня, что Apple расшифровывает русский лучше Whisper или наоборот, значит говорить без основания. Две минуты собственной записи — пока самый надёжный источник.

Apple заявила, что языки будут добавляться, так что список со временем устареет. Но «поддерживается» и «одинаково точен» — разные утверждения для обоих движков. Поэтому полный список языков стоит проверять на собственном аудио, а не доверять подсчёту.

Насчёт «в три раза быстрее»

Утверждение о скорости разошлось так же широко, как и о точности, и у него та же сноска: измеряли против Whisper Small.

Бенчмарк сообщил диапазон производительности примерно от 12 до 40 раз быстрее реального времени на M2 Pro — час аудио примерно за 1,5–5 минут. Точные времена по каждой модели автор намеренно придержал до более чистых замеров на незагруженной машине.

Диапазон настоящий, и движок Apple действительно быстрый. Но получен он на настольном чипе серии M с 32 ГБ оперативной памяти, а не на телефоне. На iPhone ограничивающим фактором для любой модели расшифровки становится память, а не вычислительная мощность. По этой же причине несколько известных «приложений с Whisper» тихо загружают на телефоне small или medium, тогда как их версии для Mac выполняют large. Мы разобрали, какой вариант на самом деле загружает каждое приложение для iOS.

Когда что выбрать

Ни один не выигрывает вообще. Они сделаны под разные задачи.

Берите Apple SpeechAnalyzer, если:

  • ваш язык входит в 22 поддерживаемых, особенно если это английский;
  • на устройстве iOS 26 или новее;
  • нужна расшифровка в реальном времени, с промежуточными результатами, которые обновляются по ходу речи, — API задуман именно для этого;
  • не хотите ни загрузки модели, ни расходов.

Берите семейство Whisper Large V3, если:

  • ваш язык вне списка Apple или в одной записи смешиваются несколько языков;
  • нужна одинаковая работа на старых устройствах: приложения на Whisper работают заметно ниже iOS 26;
  • вы расшифровываете готовые файлы, а не живую речь, и точность важнее задержки;
  • хотите одинаковый результат независимо от версии системы.

Бесплатного сыра нет ни в одну сторону. Движок Apple быстрее внедряется, ничего не стоит и отлично работает в своих границах. Границы Whisper примерно впятеро шире, и варианты Large платят за эту широту размером модели и временем обработки.

Что это меняет при выборе приложения для iPhone

Два практических следствия.

Во-первых, «расшифровка с ИИ» в App Store теперь означает как минимум три разные вещи: приложение, вызывающее локальный SpeechAnalyzer от Apple; приложение, выполняющее собственную модель Whisper на устройстве; и приложение, отправляющее ваше аудио на сервер. Приватность, работа офлайн и охват языков у них совершенно разные, а в описаниях об этом почти никогда не сказано. Наше сравнение приложений для распознавания речи на iOS сортирует их по тому, где обрабатывается аудио.

Во-вторых, слово «локально» больше ничего не говорит о точности. Оба пути локальные. Вопрос сместился с куда уходит моё аудио на какая модель, какого размера, на каком языке.

Проверьте сами за пять минут

Бенчмарки — это средние по корпусам, которые вы никогда не запишете. Ваше собственное аудио — единственный тест, отвечающий на ваш вопрос:

  1. Запишите две минуты в том помещении, где обычно записываете: ваш микрофон, ваша манера речи, несколько имён, чисел и специальных терминов.
  2. Расшифруйте встроенным средством iPhone (Диктофон на поддерживаемом устройстве или приложение, использующее движок Apple).
  3. Расшифруйте тот же файл приложением на Whisper.
  4. Посчитайте ошибки на отрезке в 200 слов: каждое заменённое, пропущенное или выдуманное слово. Ошибки ÷ 200 = ваш WER. (Полный метод — включая то, как решить, что считается ошибкой, — в нашем руководстве по WER.)

Если оба варианта выходят чистыми, берите тот, что удобнее. Разница обычно проявляется на именах собственных, наложении речи и любом языке за пределами группы с богатыми данными — то есть ровно там, где бенчмарк перестал смотреть.

Частые вопросы

Apple SpeechAnalyzer точнее Whisper?

Против Whisper Small на чистых английских аудиокнигах — да: 2,12% против 3,74% WER. Против Whisper Large V3 или Large V3 Turbo прямого теста никто не публиковал. Отдельные измерения ставят Large V3 на том же корпусе вровень или чуть впереди, но разная нормализация делает это скорее грубым сопоставлением, чем приговором.

Какой точнее на русском?

Опубликованных цифр нет. Растиражированный бенчмарк измерял только английский, а Apple не раскрывает WER по языкам. ru_RU в списке Apple присутствует, так что с поддержкой всё в порядке. Что до точности, проверка на двух минутах собственной записи — сегодня единственный надёжный способ.

SpeechAnalyzer работает офлайн?

Работает. Всё выполняется на устройстве, языковые ресурсы один раз загружаются через системный каталог. В этом он совпадает с локальным приложением на Whisper: ни то ни другое не отправляет аудио на сервер.

Обязательно ли iOS 26?

Обязательно. SpeechAnalyzer требует iOS 26 или новее и не имеет обратной совместимости. Приложения на Whisper работают на заметно более старых версиях, и это одна из практических причин держать в поле зрения оба движка.

Различает ли кто-нибудь из них говорящих?

Определение говорящих — отдельный этап, и ни один из движков не выполняет его в составе распознавания речи. Приложения добавляют это сверху — как работает разделение говорящих объясняет, что для этого нужно и где оно ломается.

Почему LoroNote использует Whisper, а не движок Apple?

Из-за охвата языков и устройств. LoroNote расшифровывает около 100 языков, включая записи со смешением языков, на устройствах задолго до iOS 26. Движок Apple отлично работает в пределах своих 22 языков, но такую широту не заменяет. Выбор конкретной модели мы разобрали в руководстве по Whisper Large V3 Turbo.

Источники

Цифры бенчмарка проверены 23 августа 2026 года. Список поддерживаемых Apple языков меняется с обновлениями системы: перед тем как на него полагаться, проверьте SpeechTranscriber.supportedLocales на актуальной сборке.

Ваш голос становится текстом — офлайн

LoroNote расшифровывает встречи, лекции и интервью прямо на iPhone — приватно, точно и без ограничений.

Скачать в App Store