Audio online in Text transkribieren — privates Whisper AI
Wandeln Sie Sprache in Audio- und Videodateien mit Whisper AI direkt im Browser in Text um. Ohne Upload, kostenlos, mit Kopieren und TXT-Download.
🔒 Läuft vollständig in Ihrem Browser — nichts wird hochgeladenSprache zu Text, ohne Ihre Aufnahmen hochzuladen
Dieser Transkriptor verwandelt gesprochene Worte in einer Audio- oder Videodatei mithilfe des Spracherkennungsmodells Whisper von OpenAI in reinen Text. Anders als die meisten Online-Transkriptionsdienste sendet er Ihre Datei nirgendwohin. Das Modell läuft über Transformers.js und ONNX Runtime direkt in Ihrem Browser, nutzt Ihre Grafikkarte per WebGPU, wenn verfügbar, und weicht andernfalls auf WebAssembly auf der CPU aus. Interviews, Besprechungsaufnahmen, Vorlesungen, Sprachnotizen und private Videos bleiben die ganze Zeit auf Ihrem Gerät.
Der einzige Netzwerk-Download ist das Modell selbst. Beim ersten Durchlauf lädt das Tool die Whisper-Gewichte vom Hugging Face Model Hub, die der Browser anschließend zwischenspeichert, sodass die nächste Transkription fast sofort startet. Diese Anfrage enthält keinerlei Daten Ihres Audios.
So funktioniert die Transkription
Wenn Sie auf Transcribe klicken, wird die Tonspur dekodiert und auf 16 kHz Mono umgerechnet – das Format, das Whisper erwartet. Lange Aufnahmen werden in Fenster von bis zu 30 Sekunden aufgeteilt, und jeder Schnitt wird an die leiseste Stelle nahe dem Fensterende gesetzt, sodass Wörter nur selten mittendrin zerschnitten werden. Stille Fenster werden übersprungen, weil Whisper dazu neigt, Phrasen wie „Thank you“ zu erfinden, wenn es nichts hört. Jedes Fenster wird in einem Hintergrund-Worker transkribiert, damit die Seite reaktionsfähig bleibt, und der Text erscheint, sobald ein Abschnitt fertig ist.
Whisper Tiny ist die schnellste Option und funktioniert gut bei deutlicher Sprache. Whisper Base ist bei Akzenten und verrauschtem Audio spürbar genauer, erfordert dafür aber einen größeren Download und eine langsamere Verarbeitung. Wenn Sie die gesprochene Sprache kennen, wählen Sie sie aus; die automatische Erkennung hört sich den Anfang der Aufnahme an und wählt die wahrscheinlichste Sprache. Die Option Translate erzeugt englischen Text aus Sprache in einer anderen Sprache.
Tipps für bessere Ergebnisse
Die Geschwindigkeit hängt von Ihrer Hardware ab: Mit WebGPU dauern einige Minuten Audio oft deutlich weniger als eine Minute, während die reine CPU-Verarbeitung nahezu Echtzeit benötigen kann. Aufnahmen mit einem einzelnen Sprecher nah am Mikrofon liefern den besten Text. Hintergrundmusik, durcheinander sprechende Personen und starke Kompression verringern die Genauigkeit. Die Ausgabe enthält weder Sprecherbezeichnungen noch Zeitstempel; wenn Sie Untertitel mit Timing benötigen, verwenden Sie stattdessen den automatischen Untertitel-Generator. Prüfen Sie Namen, Zahlen und Fachbegriffe stets gründlich, bevor Sie das Transkript veröffentlichen oder zitieren. Sehr lange Dateien benötigen viel Arbeitsspeicher; wenn einem Tab der Speicher ausgeht, teilen Sie die Aufnahme zuerst in kürzere Teile.
So verwenden Sie
- Datei hinzufügenZiehen Sie eine Audioaufnahme oder ein Video mit Sprache in das Feld.
- Modell und Sprache wählenWählen Sie Tiny für Geschwindigkeit oder Base für Genauigkeit, und legen Sie die gesprochene Sprache fest oder belassen Sie Auto-detect.
- TranskribierenKlicken Sie auf Transcribe und sehen Sie zu, wie der Text Fenster für Fenster erscheint, während das Modell arbeitet.
- Kopieren oder herunterladenKorrigieren Sie das Transkript, dann kopieren Sie es oder speichern es als .txt-Datei.