Audio online naar tekst transcriberen — privé Whisper AI
Zet spraak in audio- en videobestanden om naar tekst met Whisper AI dat in je browser draait. Geen uploads, gratis, met kopiëren en TXT-download.
🔒 Draait volledig in uw browser — niets wordt geüploadSpraak naar tekst zonder je opnamen te uploaden
Deze transcriptietool zet gesproken woorden in een audio- of videobestand om naar platte tekst met het spraakherkenningsmodel Whisper van OpenAI. In tegenstelling tot de meeste online transcriptiediensten stuurt deze tool je bestand nergens naartoe. Het model draait in je browser via Transformers.js en ONNX Runtime, gebruikt je grafische kaart via WebGPU wanneer die beschikbaar is en valt anders terug op WebAssembly op de CPU. Interviews, vergaderopnamen, colleges, spraakmemo's en privévideo's blijven de hele tijd op je apparaat.
De enige download via het netwerk is het model zelf. Bij de eerste keer haalt de tool de Whisper-gewichten op van de Hugging Face-modelhub, waarna de browser ze in de cache bewaart, zodat de volgende transcriptie vrijwel meteen begint. Er zit niets van je audio in dat verzoek.
Hoe de transcriptie werkt
Wanneer je op Transcribe drukt, wordt het audiospoor gedecodeerd en herbemonsterd naar 16 kHz mono, het formaat dat Whisper verwacht. Lange opnamen worden opgesplitst in vensters van maximaal 30 seconden, en elke knip wordt op het stilste moment vlak voor het einde van het venster geplaatst, zodat woorden zelden doormidden worden geknipt. Stille vensters worden overgeslagen, omdat Whisper de neiging heeft zinnen als ‘Thank you’ te verzinnen wanneer het niets hoort. Elk venster wordt in een achtergrondworker getranscribeerd, zodat de pagina responsief blijft, en de tekst verschijnt zodra elk stuk klaar is.
Whisper Tiny is de snelste optie en werkt goed bij duidelijke spraak. Whisper Base is merkbaar nauwkeuriger bij accenten en rumoerige audio, ten koste van een grotere download en tragere verwerking. Als je de gesproken taal kent, selecteer die dan; automatische detectie luistert naar het eerste deel van de opname en kiest de meest waarschijnlijke taal. De optie Translate maakt Engelse tekst van spraak in een andere taal.
Tips voor betere resultaten
De snelheid hangt af van je hardware: met WebGPU duren een paar minuten audio vaak ruim minder dan een minuut, terwijl verwerking op alleen de CPU bijna realtime kan duren. Opnamen met één spreker dicht bij de microfoon geven de beste tekst. Achtergrondmuziek, door elkaar pratende mensen en zware compressie verminderen de nauwkeurigheid. De uitvoer bevat geen sprekerlabels of tijdstempels; heb je ondertitels met timing nodig, gebruik dan de automatische ondertitelgenerator. Controleer altijd namen, getallen en vakjargon voordat je de transcriptie publiceert of citeert. Zeer lange bestanden vragen veel geheugen; als een tabblad geen geheugen meer heeft, splits de opname dan eerst in kortere delen.
Hoe te gebruiken
- Voeg een bestand toeSleep een audio-opname of een video met spraak naar het vak.
- Kies model en taalKies Tiny voor snelheid of Base voor nauwkeurigheid, en stel de gesproken taal in of laat Auto-detect staan.
- TranscribeerDruk op Transcribe en zie de tekst venster voor venster verschijnen terwijl het model werkt.
- Kopieer of downloadLees de transcriptie na en kopieer haar of sla haar op als .txt-bestand.