AIオンデバイスAI文字起こしとは?iPhoneがWhisperを動かす仕組み(2026年)
オンデバイスAI文字起こしでは、音声認識モデルがスマホそのものの上で動きます。音声が通るアップロード工程がそもそも存在しません。マイクからテキストまでの間で実際に起きていること、Neural Engineの役割、アプリが積めるモデルのサイズを演算速度ではなくメモリが決める理由、そしてオンデバイスに本当にできないことを整理しました。
AIオンデバイスAI文字起こしでは、音声認識モデルがスマホそのものの上で動きます。音声が通るアップロード工程がそもそも存在しません。マイクからテキストまでの間で実際に起きていること、Neural Engineの役割、アプリが積めるモデルのサイズを演算速度ではなくメモリが決める理由、そしてオンデバイスに本当にできないことを整理しました。
AI単語誤り率(WER)は、置換・脱落・挿入という3種類の誤りを、実際に話された語数で割った指標です。計算式に何が含まれ、何が含まれないのか、同じモデルの数値が評価ごとに違う理由、日本語でCERが使われる理由、自分の録音で10分で測る方法まで整理します。
AIAppleのオンデバイスSpeechAnalyzerがWhisperを上回ったベンチマークが話題になりました。ただしそのテストは英語のオーディオブックでWhisper Smallを回しただけです。何を測り、何を測らなかったのか、日本語はどうなのかを整理します。
AIWhisperの実際の精度:クリーンな朗読音声では単語誤り率(WER)約2〜3%、複数の実際の英語ベンチマークの平均では約7%、会議室の録音では約16%です。そして、この数値を最も大きく動かす要因が何かも、あわせて整理しました。
AIiPhone・iPad向けWhisperアプリの上位4本を、各アプリが実際に実行しているWhisperモデルのバリアントと、端末上かサーバー上かで比較します。
AIParakeet V3とWhisper Large V3を実践的に比較。ベンチマークの精度(WER)、速度、対応言語、ハルシネーションの挙動を整理し、日本語の文字起こしとオンデバイス利用にどちらが合うかを解説します。
AIWhisper Large V3 TurboがLarge V3をどう高速・軽量化したのか、残された弱点、そしてLoroNoteが端末内文字起こしに採用する理由を解説します。