KI

Wie genau ist Whisper? Echte Zahlen — vom Hörbuch bis zum Besprechungsraum (2026)

LoroNote-Team9 min

Whisper-Genauigkeit in echten Zahlen: rund 2–3 % Wortfehlerrate bei sauberer Sprache, etwa 7 % über gemischte englische Benchmarks, rund 16 % im Meetingraum.

Die Kurzantwort: Es gibt keine einzelne Genauigkeitszahl für Whisper — es gibt eine Leiter. Bei sauberer, vorgelesener Sprache mit einer einzelnen Stimme erreichen die großen Modelle rund 2–3 % Wortfehlerrate (WER), also mehr als 97 richtige Wörter von 100. Über eine Mischung realer englischer Benchmarks liegt Whisper Large V3 im Schnitt bei etwa 7,4 % WER. Bei Meeting-Audio mit entfernten Mikrofonen und durcheinandersprechenden Personen liegt dasselbe Modell bei rund 16 %. Und bei ressourcenarmen Sprachen kann sich die Fehlerrate noch einmal verdreifachen. Ob Whisper „genau“ ist, hängt davon ab, auf welcher Sprosse Ihre Aufnahme sitzt — und ebenso sehr davon, welche Whisper-Variante die von Ihnen genutzte App tatsächlich ausführt.

Jede Zahl in diesem Artikel stammt aus OpenAIs veröffentlichtem Paper und den Model Cards oder vom öffentlichen Open ASR Leaderboard, verlinkt in den Quellen am Ende. Verfasst vom LoroNote-Team am 19. August 2026. LoroNote führt Whisper Large V3 Turbo auf dem Gerät aus — wir haben hier also ein Eigeninteresse, und genau deshalb ist keine der Zahlen unten unsere eigene Marketingzahl.

Was die Wortfehlerrate tatsächlich misst

Die WER zählt die Wörter, die eine Transkription falsch wiedergegeben hat — ersetzt, ausgelassen oder erfunden —, als Anteil der gesprochenen Wörter. 5 % WER bedeutet einen Fehler alle 20 Wörter; 16 % heißt: jedes sechste Wort. Aus der Definition folgen zwei Dinge:

  1. Eine WER sagt nur zusammen mit dem Audio etwas aus, an dem sie gemessen wurde. „98 % genau“ ohne benannten Testdatensatz ist ein Slogan, keine Messung. Dasselbe Modell liefert über 97 % bei einem Hörbuch und 84 % im Konferenzraum, ohne dass irgendetwas kaputt wäre.
  2. Nicht alle Fehler kosten gleich viel. Ein verschlucktes „ähm“ und ein falscher Medikamentenname zählen beide einmal. Die WER ist der Standardmaßstab, weil sie objektiv ist — nicht, weil sie erfasst, wie brauchbar sich ein Transkript anfühlt. Genau deshalb schlägt der Test mit dem eigenen Audio, siehe unten, jede Tabelle.

Die vollständige Definition – die Formel, warum die WER über 100 % liegen kann und der Normalisierungsschritt, der veröffentlichte Zahlen stillschweigend verschiebt – steht in Was ist die Wortfehlerrate?

Die Genauigkeitsleiter: ein Modell, vier Sprossen

Dies sind veröffentlichte Werte für Whispers große Modelle auf Standard-Benchmarks:

AudiobedingungenBenchmarkUngefähre WERQuelle
Saubere vorgelesene Sprache, eine StimmeLibriSpeech test-clean~2–3 %OpenAIs Whisper-Paper (2,7 %, large)
Gemischtes reales Englisch, acht TestsetsOpen-ASR-Leaderboard-Durchschnitt~7,4 % (Large V3)Open ASR Leaderboard
Meetingräume, entfernte Mikrofone, DurcheinanderredenAMI-Meeting-Korpus~16 % (Large V3)Open ASR Leaderboard
Beispiel für ressourcenarme SpracheHindi (Common Voice)~27 % (Large V3)Model Card openai/whisper-large-v3

Lesen Sie die Leiter von oben nach unten, und das Muster ist offensichtlich: Nicht das Modell wird schlechter — das Audio wird es. Diktat in ein Telefon nahe am Mund liegt auf der obersten Sprosse. Ein Interview über einen Cafétisch hinweg in der Mitte. Ein Meeting, aufgenommen vom anderen Ende des Tisches, landet auf der dritten Sprosse — bevor auch nur eine einzige Software-Entscheidung gefallen ist.

Welches Whisper? Die Variante ändert die Antwort

„Powered by Whisper“ bezeichnet eine Familie, kein Modell. Whisper erscheint in Größen von tiny bis large, und die Spannweite zwischen ihnen ist größer als die zwischen Anbietern:

  • Large V3 ist das Genauigkeits-Flaggschiff. OpenAI trainierte es auf 1 Million Stunden schwach gelabeltem Audio plus 4 Millionen Stunden pseudo-gelabeltem Audio und berichtet 10–20 % weniger Fehler als Large V2 über eine breite Palette von Sprachen.
  • Large V3 Turbo ist das geschwindigkeitsoptimierte Derivat: 809 Millionen Parameter, der Decoder von 32 auf 4 Schichten gekürzt. OpenAI nennt den Preis dafür eine „geringfügige Qualitätseinbuße“ — auf dem Open ASR Leaderboard liegen die Durchschnitte nah beieinander (etwa 7,8 % vs. 7,4 % mittlere WER; etwa 16,1 % vs. 16,0 % auf AMI). Über alle Sprachen kombiniert verhält es sich ähnlich wie Large V2 und verliert am meisten in wenigen Sprachen wie Thailändisch und Kantonesisch. Diesen Kompromiss haben wir in unserem Whisper-Large-V3-Turbo-Leitfaden auseinandergenommen.
  • Small und medium liegen mehrere Punkte höher in der WER — ein realer Abstand, den ein Ein-Absatz-Test sichtbar macht. Auf iPhones zählt das besonders, denn mehrere bekannte „Whisper-Apps“ führen auf dem Telefon small oder medium aus, selbst wenn ihre Mac-Versionen large nutzen. Unser Whisper-App-Vergleich listet, welche Variante jede iOS-App tatsächlich lädt.

Die praktische Regel: Prüfen Sie, welches Whisper eine App ausführt, bevor Sie Apps nach Genauigkeit vergleichen. Eine App mit Large V3 Turbo und eine App mit small bieten nicht dieselbe Genauigkeit — ganz gleich, was beide Einträge über „Whisper-KI“ sagen.

Die Sprache bewegt die Zahl stärker als alles andere in der Software

Whispers Trainingsdaten sind stark zu ressourcenreichen Sprachen verschoben, und die Genauigkeit folgt dem. Englisch, Spanisch, Deutsch, Japanisch, Koreanisch und andere gut vertretene Sprachen liegen nahe an den Durchschnitten oben. Ressourcenarme Sprachen liegen weit darüber — der Hindi-Wert in der Tabelle ist ein veröffentlichtes Beispiel, und OpenAIs Model Card vermerkt zusätzlich ungleichmäßige Leistung über Akzente und Dialekte innerhalb von Sprachen.

Whisper Large V3 deckt rund 100 Sprachen ab (Kantonesisch kam mit V3 hinzu) — „unterstützt“ und „gleich genau“ sind also verschiedene Aussagen. Liegt Ihre Sprache außerhalb der ressourcenreichen Riege, gilt derselbe ehrliche Rat wie überall in diesem Artikel: Lassen Sie eine kurze eigene Aufnahme durchlaufen und schauen Sie sich das Ergebnis an — die vollständige Sprachliste sagt, was LoroNote versucht, und zwei Minuten eigenes Audio sagen, wie gut.

Halluzinationen: der Fehler, den die WER untertreibt

OpenAIs Model Card sagt es direkt: Weil die Modelle auf großen, verrauschten Datenmengen trainiert sind, „können die Vorhersagen Texte enthalten, die im Audio gar nicht gesprochen wurden (d. h. Halluzination)“. In der Praxis zeigt sich das bei Stille, Hintergrundgeräuschen und Musik — Whisper ist ein generatives Modell, und wo keine Sprache es verankert, kann es flüssige Sätze produzieren, die niemand gesagt hat.

Zwei Dinge halten das beherrschbar:

  • Apps können es abmildern. Eine Sprachaktivitätserkennung, die stille Passagen überspringt, nimmt dem Modell seine Hauptgelegenheit, Text zu erfinden. Das ist ein Verhalten auf App-Ebene, keine Modelleinstellung — und einer der echten Unterschiede zwischen Apps, die dasselbe Whisper ausführen.
  • Sie können es erkennen. Halluzinierter Text erscheint typischerweise an Stellen, von denen Sie wissen, dass sie still waren — das Ende einer Aufnahme, eine lange Pause. Ist die Mitte eines Transkripts solide, aber in den Stillen wachsen Sätze, sehen Sie eine Halluzination, kein Verhören.

Dieses Verhalten haben wir in Parakeet V3 vs. Whisper Large V3 mit einem Modell in Transducer-Architektur verglichen — Transducer halluzinieren bei Stille weniger, während Whisper weit mehr Sprachen abdeckt; geschenkt gibt es nichts.

Was die Genauigkeit bei Ihren Aufnahmen wirklich bewegt

Benchmarks variieren das Audio; Ihre Aufnahmen variieren dieselben Dinge. In grober Reihenfolge der Wirkung:

  1. Mikrofonabstand. Der größte Hebel überhaupt. Ein Telefon in Armlänge auf dem Tisch schlägt ein Telefon quer durch den Raum deutlicher als jedes Modell-Upgrade.
  2. Lärm und Musik. Gleichmäßige Hintergrundgeräusche verschlechtern das Ergebnis moderat; Musik und Geklapper verschlechtern es stark.
  3. Sich überlappende Sprechende. Durcheinanderreden ist der Grund, warum Meeting-Korpora bei ~16 % liegen, während Einzelsprecher-Audio bei ~3 % sitzt.
  4. Fachvokabular. Namen, Medikamente, Börsenkürzel und Fachjargon scheitern überproportional. Genau dafür existiert LoroNotes eigenes Wörterbuch: wiederkehrende Begriffe, die das Modell nicht länger falsch schreiben soll.
  5. Die Modellvariante — der einzige Faktor oben, der eine reine Software-Entscheidung ist. Deshalb führt LoroNote die größte auf dem Telefon praktikable Whisper-Variante aus.

Sprecherbeschriftungen verdienen eine Anmerkung: Diarisierung ändert die WER nicht, aber sie entscheidet, ob ein Transkript mit mehreren Stimmen überhaupt brauchbar ist. Ein genaues Transkript ohne Sprecher bleibt Nacharbeit; So funktioniert die Sprechererkennung behandelt diese Hälfte des Problems.

So messen Sie Whispers Genauigkeit selbst — in zehn Minuten

Ein Test mit Ihrem eigenen Audio übertrifft jede Tabelle in diesem Artikel:

  1. Nehmen Sie rund zwei Minuten auf, die Ihrer echten Nutzung ähneln — gleicher Raum, gleicher Abstand, gleiche Sprache, echte Namen und Fachbegriffe. Zwei Minuten Sprache sind gut 250 Wörter — genug für die Zählung unten.
  2. Transkribieren Sie die Aufnahme und vergleichen Sie das Ergebnis mit dem Audio.
  3. Zählen Sie die Fehler in einem Abschnitt von 200 Wörtern: jedes ersetzte, fehlende oder erfundene Wort. Fehler ÷ 200 = Ihre WER.
  4. Beurteilen Sie die Fehler, nicht nur die Anzahl: fünf verunglückte Füllwörter und fünf verunglückte Kundennamen sind dieselbe WER — und ein sehr unterschiedlicher Arbeitstag.

Die präzise Fassung dieser Methode – einschließlich der Frage, wie Sie vorab festlegen, was als Fehler zählt – steht in unserem WER-Leitfaden.

Der Test kostet nichts: Die Gratisversion von LoroNote transkribiert die ersten zwei Minuten jeder Aufnahme — genau genug für diesen Test. Und weil LoroNote auf dem Gerät transkribiert, verlässt die Aufnahme Ihr iPhone nie — kein Upload-Schritt, kein Konto, und der Flugmodus ändert nichts.

Häufig gestellte Fragen

Ist Whisper genau genug für professionelle Transkripte?

Für saubere Aufnahmen mit nahem Mikrofon in ressourcenreichen Sprachen liefern Whispers große Modelle Entwürfe, die die meisten nur leicht nachbearbeiten — die 2–3 % WER bei sauberer Sprache liegen nahe an der praktischen Obergrenze automatischer Systeme. Bei Meetings mit entfernten Mikrofonen, viel Durcheinanderreden oder kritischem exaktem Wortlaut planen Sie Korrekturzeit ein: Bei 16 % WER braucht eines von sechs Wörtern Ihre Aufmerksamkeit.

Verliert Whisper Large V3 Turbo Genauigkeit gegenüber Large V3?

Geringfügig. OpenAI stuft die Einbuße als klein ein, und die öffentlichen Leaderboard-Durchschnitte liegen im Englischen deutlich unter einem Punkt auseinander. Über alle Sprachen kombiniert verhält sich Turbo ähnlich wie Large V2, mit den größten Verlusten in wenigen Sprachen wie Thailändisch und Kantonesisch. Im Gegenzug ist es dramatisch schneller — der Kompromiss, der ein Modell der Large-Serie auf einem Telefon praktikabel macht.

Warum enthält mein Transkript Sätze, die niemand gesagt hat?

Das ist eine Halluzination, ein dokumentiertes Verhalten von Whisper bei Stille, Lärm und Musik: Ein generatives Modell ohne Sprache als Anker kann trotzdem flüssigen Text produzieren. Prüfen Sie die stillen Passagen Ihrer Aufnahme. Apps, die vor Whisper eine Sprachaktivitätserkennung ausführen, vermeiden das weitgehend — es ist ein App-Verhalten, keine Benutzereinstellung.

Verringert die Ausführung auf dem Gerät Whispers Genauigkeit?

Nein. Dieselben Modellgewichte liefern dieselbe Transkriptionsqualität, egal wo sie laufen; On-Device-Inferenz ist kein reduzierter Modus. Was sich zwischen Apps unterscheidet, ist die ausgeführte Variante — Cloud-Dienste hosten die größten Modelle mühelos, während On-Device-Apps ins Telefon passen müssen, weshalb manche small oder medium ausführen. LoroNote führt Large V3 Turbo lokal aus und vereint damit ein Modell der Large-Serie und On-Device-Datenschutz in einer App.

Fazit

„Wie genau ist Whisper“ hat eine Form, keine Zahl: rund 2–3 % WER bei sauberer vorgelesener Sprache, etwa 7 % über gemischte englische Benchmarks, rund 16 % bei Meeting-Audio — und schlechter bei ressourcenarmen Sprachen, mit Halluzination als dem Vorbehalt, den die WER untertreibt. Die beiden Entscheidungen, die Ihre eigenen Ergebnisse am stärksten bewegen, sind physisch (das Mikrofon näher heranbringen) und strukturell (wissen, welche Whisper-Variante Ihre App ausführt). Der Rest ist in zehn Minuten mit einer eigenen Aufnahme messbar — dem einzigen Benchmark, in dem es je um Sie ging.

Offizielle Ressourcen

Ihre Stimme wird zu Text — offline

LoroNote transkribiert Meetings, Vorlesungen und Interviews direkt auf Ihrem iPhone — privat, präzise und unbegrenzt.

Im App Store laden