ИИ

Расшифровка прямо на устройстве: как iPhone запускает Whisper (2026)

LoroNote Team9 min

ИИ-расшифровка на устройстве означает, что речевая модель работает в самом телефоне — этапа, на котором аудио куда-то загружается, просто не существует. Что происходит между микрофоном и текстом, чем занят Neural Engine, почему размер модели в приложении выбирает не процессор, а память, и чего локальная расшифровка действительно не умеет.

Короткий ответ: ИИ-расшифровка на устройстве означает, что модель распознавания речи работает на процессорах самого телефона: запись превращается в текст, никуда не отправляясь. Приватность здесь держится не на договоре, а на архитектуре: этапа, на котором аудио загружалось бы на сервер, просто нет — и это легко проверить самому, расшифровав запись в авиарежиме. «На устройстве» не значит «менее точно»: одни и те же веса модели дают одинаковый результат где угодно. Зато у телефона есть свой жёсткий лимит: какого размера модель поместится в приложение, решает не скорость вычислений, а память — поэтому одни приложения без лишнего шума ставят младшие варианты Whisper, а другие умещают модель семейства Large. Разберём по порядку, что происходит между микрофоном и текстом.

Эта статья написана командой LoroNote 27 августа 2026 года. LoroNote выполняет Whisper Large V3 Turbo целиком на устройстве, так что здесь описан механизм, на котором стоит наш собственный продукт. К каждой цифре бенчмарков приложен первоисточник — большинство собрано на нашей странице проверенной статистики расшифровки (на английском); единственное наше собственное измерение помечено отдельно.

Что на самом деле значит «на устройстве»

Любой сервис расшифровки делает одно и то же; различие в одном — где работает модель.

ЭтапОблачная расшифровкаРасшифровка на устройстве
ЗаписьНа вашем телефонеНа вашем телефоне
ЗагрузкаАудио уходит на серверы провайдераЭтапа не существует
Речевая модельРаботает на серверных GPUРаботает на процессорах телефона
РезультатТекст возвращается по сетиТекст создаётся на месте
Работа офлайнНетДа — сеть не нужна ни одному этапу
Кто имеет доступ к аудиоВы + инфраструктура провайдераТолько тот, у кого телефон

Главные здесь — две последние строки. Работа офлайн — не функция, добавленная к локальной расшифровке, а побочный эффект архитектуры: в конвейере нет ни одного этапа, которому нужна сеть. Приватность устроена так же: аудио, которое никогда не загружалось, невозможно ни хранить, ни потерять при утечке, ни просмотреть на стороне провайдера — не потому, что провайдер пообещал не трогать запись, а потому, что трогать попросту нечего: копии не существует. Это утверждение об архитектуре, а не юридическая гарантия — что оно означает для ваших собственных обязательств, решать вам, но сам технический факт проверяется в авиарежиме.

Конвейер: что происходит между микрофоном и текстом

Современные речевые модели вроде Whisper от OpenAI обрабатывают аудио в несколько вполне конкретных этапов, и в приложении на устройстве все они выполняются локально:

  1. Пересэмплирование. Аудио приводится к 16 000 Гц — в статье о Whisper прямо сказано, что весь обучающий звук пересэмплирован до этой частоты, так что всё, что выше, отбрасывается ещё до того, как модель начнёт слушать. (Поэтому запись со студийной частотой дискретизации не повышает точность.)
  2. Спектрограмма. Звуковой сигнал превращается в мел-спектрограмму — по статье, это логарифмическое представление, вычисляемое окнами по 25 миллисекунд с шагом 10 миллисекунд. Модель не слышит «звук»: она читает похожую на картинку карту того, на каких частотах и в какие моменты сосредоточена энергия.
  3. Кодирование. Энкодер-трансформер сжимает спектрограмму во внутреннее представление того, что прозвучало.
  4. Декодирование. Декодер-трансформер пишет расшифровку токен за токеном, опираясь и на представление аудио, и на уже написанный текст. Поэтому Whisper читается так гладко — и поэтому же он способен сочинить связный текст поверх тишины.

Ни одному из этих этапов нет дела до того, где он выполняется. Серверный GPU и телефон производят одну и ту же математику над одними и теми же весами — именно поэтому расшифровка на устройстве стала возможной, как только телефонные чипы доросли до задачи.

Железо: чем занят Neural Engine

Телефонные чипы давно перестали быть просто процессорами. В системах-на-кристалле Apple серии A рядом с CPU и GPU стоит отдельный блок для нейросетевой математики — Neural Engine; в анонсе iPhone 15 Pro Apple писала, что Neural Engine в A17 Pro до двух раз быстрее предшественника. Реальные приложения для расшифровки конвертируют свои модели в формат Apple Core ML, чтобы это железо эффективно выполняло энкодер и декодер.

Иллюстрация системы-на-кристалле Apple A16 Bionic

Иллюстрация чипа Apple серии A. Рядом с CPU и GPU в таких чипах стоит отдельный блок — Neural Engine, который и выполняет математику речевой модели прямо на устройстве. Источник:

Wikimedia Commons (Henriok)

, CC0.

Однако на практике всё упирается не в скорость вычислений, а в то, помещается ли модель в память. Опубликованная OpenAI таблица показывает масштаб (параметры и справочные объёмы памяти, измеренные на серверном GPU):

Вариант WhisperПараметрыСправочная памятьОтносительная скорость (A100)
tiny39 млн~1 ГБ~10×
base74 млн~1 ГБ~7×
small244 млн~2 ГБ~4×
medium769 млн~5 ГБ~2×
large1,55 млрд~10 ГБ
turbo809 млн~6 ГБ~8×

У этой таблицы есть две важные оговорки. Колонки памяти и скорости — справочные цифры OpenAI для вывода на GPU: у телефона нет отдельной видеопамяти, а реальные приложения квантуют модели под Core ML, что меняет и объём, и скорость. Читайте таблицу как соотношение вариантов между собой, а не как паспорт конкретного приложения. Но именно это соотношение и есть суть: маленькая модель помещается в телефон без труда, модель семейства Large — только ценой серьёзной инженерии, и потому немало известных iPhone-приложений без лишнего шума загружают small или medium, даже если их настольные версии работают на large. Whisper Large V3 Turbo — 809 миллионов параметров с декодером, урезанным с 32 слоёв до 4, — существует ровно для того, чтобы точность семейства Large влезла в этот бюджет; почему LoroNote выбрала именно её, мы рассказывали отдельно.

Теряет ли расшифровка на устройстве в точности?

Нет — и это самое живучее заблуждение о ней. Веса модели — детерминированная математика: один и тот же вариант выдаёт расшифровку одного и того же качества и на телефоне, и на сервере. «На устройстве» — не урезанный режим.

Между приложениями различается другое: какой вариант каждое из них загружает, и это различие велико — по опубликованным данным, младшие варианты Whisper ошибаются примерно вдвое чаще движков семейства Large на одном и том же бенчмарке. Так что вопрос о точности никогда не звучал как «облако или устройство?». Он звучит как «какая модель?» — и задавать его нужно каждому приложению отдельно. Измеренные цифры, от чистой начитанной речи до переговорных, собраны в статье насколько точен Whisper.

Насколько это быстро на практике?

Одна цифра здесь наша собственная, поэтому отмечаем это отдельно: на iPhone 15 Pro LoroNote расшифровывает примерно в 19 раз быстрее реального времени — часовая запись становится текстом примерно за три минуты, целиком на устройстве (измерение LoroNote, 13.08.2026). Для сравнения с другим локальным движком: бенчмарк SpeechAnalyzer из iOS 26 сообщал о производительности примерно в 12–40 раз быстрее реального времени на настольном M2 Pro — с важными оговорками о том, что этот бенчмарк проверял, а что нет.

У скорости на устройстве есть свойство, которого нет у облачной: она ваша. Ни очереди, ни лимитов, ни поминутного счётчика — ещё один час расшифровки обойдётся вам в заряд батареи, а не в строку счёта.

Чего расшифровка на устройстве действительно не умеет

Честное определение включает и границы:

  • Модель становится лучше только с обновлением приложения. Облачный провайдер может за ночь подменить модель на серверах; приложение на устройстве несёт модель внутри себя, так что улучшения приходят вместе с обновлениями — зато у вас на виду, а не втихую.
  • Большие пакетные задачи по-прежнему за большим железом. Расшифровать сотни часов для исследовательского архива быстрее на настольном GPU или в платной облачной очереди, чем на любом телефоне.
  • Всему, что по сути многопользовательское, нужен сервер. Живая общая расшифровка, которую десять человек правят прямо во время звонка, — задача координации, а не расшифровки; когда облачный сервис всё же уместен, разобрано в руководстве по офлайн-расшифровке.
  • Долгая работа расходует батарею. Расшифровка выполняется не постоянно, а один раз на запись, но длинный файл — настоящая работа для чипа: трёхчасовую партию разумно запускать на зарядке.

Но главного эти границы не отменяют: личные записи — совещания, лекции, интервью, заметки — обрабатываются на железе, которое у вас уже есть, с точностью выбранной вами модели, и ничто не покидает устройство.

Частые вопросы

Расшифровка на устройстве действительно приватна?

Её приватность архитектурная: в конвейере нет этапа загрузки, поэтому копии вашего аудио, которую можно было бы хранить или потерять, не существует нигде. Архитектуру можно проверить самостоятельно — включите авиарежим и расшифруйте запись. Что этот факт означает для ваших обязательств по конфиденциальности, судить только вам; техническое утверждение простое: аудио остаётся в телефоне.

Работает ли расшифровка на устройстве офлайн?

Да, по построению — сеть не нужна ни одному этапу конвейера. Модель скачивается один раз вместе с приложением; после этого запись и расшифровка одинаково работают в подвале, в самолёте и в авиарежиме.

Расшифровка на устройстве менее точна, чем облачная?

Не из-за места выполнения: одинаковые веса дают одинаковое качество где угодно. Разница в точности между приложениями возникает из-за того, какой вариант модели каждое загружает, — а на младшие варианты приложения толкает именно нехватка памяти в телефоне. Проверяйте модель, а не место.

Почему некоторые iPhone-приложения ставят младшие модели Whisper?

Из-за памяти. Справочная таблица OpenAI охватывает варианты от 39 миллионов до 1,55 миллиарда параметров, и старшие из них требуют нескольких гигабайт ещё до всяких телефонных ограничений. Чтобы уместить модель семейства Large в телефон, нужна осознанная инженерия — квантование, конвертация в Core ML, оптимизированная под скорость архитектура вроде четырёхслойного декодера Turbo, — и вкладываются в неё не все.

Встроенная диктовка Apple — это тоже ИИ-расшифровка на устройстве?

Всё в большей степени да. SpeechAnalyzer из iOS 26 работает целиком на устройстве, как и приложения на Whisper; различия — в охвате и условиях: движок Apple на август 2026 года поддерживал 22 языка против примерно 100 у Whisper и требует iOS 26. Мы подробно сравнили оба движка.

Сильно ли расшифровка на устройстве расходует батарею?

Расшифровка — это разовый всплеск вычислений, а не постоянный фоновый расход: она работает, пока идёт обработка, и заканчивается, как только текст готов. На короткой записи расход незаметен; многочасовые партии разумно, как любую тяжёлую задачу, запускать на зарядке.

Расшифровка прямо на устройстве: главное

ИИ-расшифровка на устройстве — не ухудшенная копия облачного сервиса, а та же математика, выполненная на кремнии, который у вас уже есть. Определение, которое стоит запомнить, состоит из трёх частей: у аудио нет этапа загрузки (проверяется авиарежимом), точность — свойство варианта модели, а не места выполнения, и какой вариант приложение способно нести, решает память телефона, а не его скорость. Оценивайте любое локальное приложение по последнему вопросу — тому самому, на который маркетинг так и не отвечает: «Какая модель внутри?»

Источники

Цифры сверены с указанными источниками 27 августа 2026 года.

Ваш голос становится текстом — офлайн

LoroNote расшифровывает встречи, лекции и интервью прямо на iPhone — приватно, точно и без ограничений.

Скачать в App Store