Whisper (OpenAI)
Open-Source-Speech-to-Text-Modell von OpenAI, das mehrsprachige Audio-Transkription, Übersetzung und Sprach-Identifikation in einem einzigen Modell vereint.
Definition
Whisper ist ein Speech-to-Text-Modell von OpenAI, das im September 2022 unter MIT-Lizenz als Open Source veröffentlicht wurde. Es kombiniert in einem einzigen Modell mehrere Audio-Aufgaben: Transkription gesprochener Sprache in 99 Sprachen, direkte Übersetzung aus jeder dieser Sprachen ins Englische, automatische Erkennung der Eingabesprache sowie eine grobe Zeitstempel-Vergabe pro Phrase. Whisper ist damit eines der ersten echten Multitask-Audio-Modelle und hat seit Release das Open-Source-Ökosystem für Spracherkennung dominiert.
Die Veröffentlichung war ungewöhnlich, weil OpenAI nicht nur das Paper, sondern Code, Modellgewichte und Trainings-Anleitung freigab. Damit wurde Whisper zur Standard-Baseline für Forschung und Industrie und löste die zuvor dominierenden Mozilla DeepSpeech, Kaldi und Wav2Vec 2.0 in vielen Anwendungen ab.
Architektur
Whisper basiert auf einer klassischen Encoder-Decoder-Transformer-Architektur, ähnlich dem ursprünglichen Vaswani-Transformer von 2017. Die wesentlichen Bausteine:
- Audio-Vorverarbeitung: Das Eingangssignal wird auf 16 kHz resampelt und in 30-Sekunden-Chunks geschnitten. Jeder Chunk wird in ein Log-Mel-Spektrogramm mit 80 Bins überführt.
- Encoder: Ein Transformer-Encoder mit Self-Attention verarbeitet das Spektrogramm und produziert eine kontextualisierte Audio-Repräsentation.
- Decoder: Ein Transformer-Decoder generiert die Text-Ausgabe Token für Token, konditioniert auf die Encoder-Ausgabe und auf Steuer-Tokens für Sprache, Aufgabe (transcribe oder translate) und Zeitstempel.
- Multitask-Training: Alle Aufgaben werden in einem einzigen Modell trainiert, gesteuert über spezielle Tokens am Beginn der Sequenz.
Die Trainingsdaten umfassen 680.000 Stunden multilingualer Audio-Text-Paare, die aus dem öffentlichen Web gesammelt wurden. Etwa ein Drittel ist nicht-englisch, was Whisper deutlich besser in Mehrsprachigkeit macht als viele Vorgänger. Der Ansatz wird als Weak Supervision bezeichnet, weil die Labels nicht aufwendig manuell erstellt, sondern aus vorhandenen Untertiteln und Transkripten extrahiert wurden.
Praxis
Whisper läuft in mehreren Varianten je nach Genauigkeits- und Latenz-Anforderung:
- tiny und base: Echtzeit-Inferenz auf Mobilgeräten oder im Browser via WebAssembly, geeignet für Voice-Commands.
- small und medium: Server-Inferenz für Batch-Transkription, gutes Genauigkeits-Latenz-Verhältnis.
- large-v3: maximale Qualität, etwa 10 GB VRAM, geeignet für professionelle Untertitelung.
- turbo: seit Ende 2024 das neue Default-Modell, achtmal schneller als large-v3 bei nahezu identischer Qualität.
Die OpenAI-API kostet 0.006 Dollar pro Audio-Minute, also etwa 0.36 Dollar pro Stunde. Lokale Inferenz ist kostenlos abgesehen von Compute. Implementationen wie whisper.cpp (C++-Port) ermöglichen effiziente CPU-Inferenz, faster-whisper nutzt CTranslate2 für GPU-Inferenz mit zwei- bis dreifacher Beschleunigung.
Typische Anwendungen umfassen Podcast- und Video-Transkription, Untertitelung, Meeting-Mitschriften, Call-Center-Analyse, Voice-Assistenten und barrierefreie Dokumentation. Beliebte Endprodukte mit Whisper-Backend sind MacWhisper, Aiko, Fireflies, Otter.ai und viele wissenschaftliche Interview-Tools.
Häufige Fehler
- Stille-Halluzinationen ignorieren: Whisper erfindet bei längeren Stille-Passagen gelegentlich Texte wie "Vielen Dank fürs Zuschauen" oder Werbe-Floskeln aus dem Trainingskorpus. Voice Activity Detection (VAD) vor der Transkription beseitigt das Problem zuverlässig.
- Diarisierung mitannehmen: Whisper transkribiert, weist aber keine Sprecher zu. Wer "Sprecher A sagt X, Sprecher B sagt Y" braucht, kombiniert Whisper mit pyannote.audio oder NeMo Diarisation.
- Dialekte überschätzen: Schweizerdeutsch, starke regionale Varianten und Slang werden oft fehlerhaft transkribiert. Hier helfen spezialisierte Schweizerdeutsch-Fine-Tunes aus Forschungsprojekten von ZHAW und FHNW oder eigene LoRA-Adaptionen.
- Real-Time-Erwartungen: Whisper ist primär für Batch-Inferenz auf 30-Sekunden-Chunks gebaut. Echte Streaming-Anwendungen benötigen spezialisierte Wrapper wie whisper-streaming oder Anbieter wie Deepgram.
- Lizenz-Verwechslung: Die Modellgewichte sind MIT-lizenziert und dürfen kommerziell genutzt werden. Trotzdem haben Trainingsdaten potenziell urheberrechtliche Implikationen, die bei sensitiven Branchen rechtlich geprüft werden sollten.
Abgrenzung
- Google Speech-to-Text: proprietäre Cloud-API mit besserer Streaming-Latenz und eingebauter Diarisierung, aber teurer und nicht lokal lauffähig.
- Azure Speech Services: vergleichbar mit Google, mit guter Branchen-Anpassung und Compliance-Optionen.
- Deepgram: spezialisiert auf Echtzeit-Streaming mit niedrigsten Latenzen, kommerziell.
- AssemblyAI: kommerziell, mit guter Diarisierung und Topic-Detection out of the box.
- Wav2Vec 2.0 (Meta): der direkte technische Vorläufer, weniger Multitask, vor allem in Forschungs-Workflows verbreitet.
- NeMo (NVIDIA): Open-Source-Framework mit Whisper-Integration und zusätzlichen ASR-Modellen, optimiert für GPU-Cluster.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist Whisper?+
Whisper ist ein Speech-to-Text-Modell von OpenAI, das im September 2022 als Open-Source-Release veröffentlicht wurde. Es transkribiert Audio in 99 Sprachen, übersetzt direkt ins Englische und erkennt die Eingabesprache automatisch. Whisper läuft sowohl lokal als auch über die OpenAI-API.
Wie wurde Whisper trainiert?+
Whisper wurde auf 680.000 Stunden mehrsprachiger und multitask-überwachter Audio-Daten trainiert, die aus dem Web gesammelt wurden. Ein Drittel davon ist nicht-englisch. Das Training ist bewusst auf Robustheit gegen Akzente, Hintergrundrauschen und technische Sprache ausgelegt, nicht auf maximalen Benchmark-Score in einer Studiosituation.
Welche Whisper-Varianten gibt es?+
Die Hauptvarianten sind tiny (39M Parameter), base (74M), small (244M), medium (769M) und large (1550M). Dazu kommen large-v2 (Dezember 2022), large-v3 (2023) und large-v3-turbo (2024), die letzteren mit deutlich besserer Genauigkeit und schnellerer Inferenz. Whisper-turbo läuft etwa achtmal schneller als large-v3 bei minimalem Qualitätsverlust.
Was kostet Whisper in der API?+
Die OpenAI-Whisper-API kostet 0.006 Dollar pro Minute Audio (etwa 0.36 Dollar pro Stunde). Lokale Nutzung ist kostenlos abgesehen von Compute, ein large-v3-Lauf benötigt etwa 10 GB VRAM. Whisper.cpp ermöglicht CPU-Inferenz auf Laptops mit akzeptabler Geschwindigkeit für Real-Time-Anwendungen.
Welche Sprachen unterstützt Whisper?+
Whisper unterstützt 99 Sprachen mit unterschiedlicher Qualität. Für Deutsch, Französisch, Spanisch, Italienisch und Englisch liegt die Word Error Rate unter 5 Prozent. Für Schweizerdeutsch und stark dialektale Varianten ist die Genauigkeit deutlich schwächer, hier kommen spezialisierte Schweizerdeutsch-Fine-Tunes aus Forschungsprojekten von ZHAW und FHNW zum Einsatz.
Was sind typische Whisper-Anwendungen?+
Typische Anwendungen sind Podcast-Transkription, Untertitelung von Videos, Meeting-Mitschriften, Voice-Interfaces, Call-Center-Analyse und barrierefreie Dokumentation. Tools wie MacWhisper, Aiko, Fireflies und Otter.ai nutzen Whisper als Backend. Auch viele wissenschaftliche Interview-Workflows haben auf Whisper gewechselt.
Was sind Schwächen von Whisper?+
Whisper neigt zu Halluzinationen in Stille-Passagen, kann gelegentlich nicht gesprochene Texte erfinden (etwa Werbe-Disclaimer am Ende) und ist bei sehr kurzen Clips weniger zuverlässig. Sprecher-Diarisierung (Wer spricht wann?) ist nicht eingebaut und erfordert zusätzliche Modelle wie pyannote.audio.
Wie unterscheidet sich Whisper von Google Speech-to-Text?+
Whisper ist offen, lokal lauffähig und deckt mehr Sprachen ab. Google Speech-to-Text und Azure Speech bieten dafür bessere Real-Time-Streaming-Latenzen, eingebaute Sprecher-Diarisierung und Domain-Adaption über benutzerdefinierte Vokabulare. Für Compliance-kritische Anwendungen ist lokales Whisper oft vorzuziehen.
Verwandte Begriffe
Quellen
- Radford et al. (2022) Robust Speech Recognition via Large-Scale Weak Supervision
- OpenAI Whisper GitHub Repository
- OpenAI API Documentation (Audio Endpoints)
- Hugging Face Whisper Model Cards
Wikidata: Q120759195 · Zuletzt geprüft: 2026-07-02