Transkribera ljud till text online — privat Whisper AI
Omvandla tal i ljud- och videofiler till text med Whisper AI som körs i din webbläsare. Inga uppladdningar, gratis, med kopiering och TXT-nedladdning.
🔒 Körs helt i din webbläsare — ingenting laddas uppTal till text utan att ladda upp dina inspelningar
Den här transkriberingen omvandlar talade ord i en ljud- eller videofil till ren text med hjälp av OpenAI:s taligenkänningsmodell Whisper. Till skillnad från de flesta transkriberingstjänster på nätet skickar den inte din fil någonstans. Modellen körs i din webbläsare via Transformers.js och ONNX Runtime, använder ditt grafikkort via WebGPU när det finns tillgängligt och faller annars tillbaka på WebAssembly på processorn. Intervjuer, mötesinspelningar, föreläsningar, röstmemon och privata videor stannar på din enhet hela tiden.
Den enda nedladdningen över nätverket är själva modellen. Första gången hämtar verktyget Whisper-vikterna från Hugging Face-modellhubben, som webbläsaren sedan cachar, så att nästa transkribering startar nästan direkt. Ingenting från ditt ljud ingår i den förfrågan.
Så fungerar transkriberingen
När du trycker på Transcribe avkodas ljudspåret och samplas om till 16 kHz mono, formatet som Whisper förväntar sig. Långa inspelningar delas upp i fönster på upp till 30 sekunder, och varje klipp placeras vid det tystaste ögonblicket nära slutet av fönstret så att ord sällan delas mitt itu. Tysta fönster hoppas över eftersom Whisper tenderar att hitta på fraser som ”Thank you” när den inte hör något. Varje fönster transkriberas i en bakgrundsworker så att sidan förblir responsiv, och texten visas så snart varje del är klar.
Whisper Tiny är det snabbaste alternativet och fungerar bra för tydligt tal. Whisper Base är märkbart mer exakt med brytningar och brusigt ljud, till priset av en större nedladdning och långsammare bearbetning. Om du vet vilket språk som talas, välj det; automatisk identifiering lyssnar på början av inspelningen och väljer det mest sannolika språket. Alternativet Translate skapar engelsk text från tal på ett annat språk.
Tips för bättre resultat
Hastigheten beror på din hårdvara: med WebGPU tar några minuters ljud ofta klart under en minut, medan bearbetning enbart på processorn kan ta nästan realtid. Inspelningar med en talare nära mikrofonen ger bäst text. Bakgrundsmusik, personer som pratar i mun på varandra och kraftig komprimering minskar precisionen. Resultatet saknar talaretiketter och tidsstämplar, så om du behöver undertexter med tidskoder bör du i stället använda den automatiska undertextgeneratorn. Korrekturläs alltid namn, siffror och fackord innan du publicerar eller citerar transkriptionen. Mycket långa filer kräver mycket minne; om en flik får slut på minne, dela först upp inspelningen i kortare delar.
Hur man använder
- Lägg till en filSläpp en ljudinspelning eller en video med tal i rutan.
- Välj modell och språkVälj Tiny för hastighet eller Base för precision, och ange det talade språket eller låt Auto-detect vara kvar.
- TranskriberaTryck på Transcribe och se texten dyka upp fönster för fönster medan modellen arbetar.
- Kopiera eller ladda nerKorrekturläs transkriptionen och kopiera den sedan eller spara den som en .txt-fil.