Transkrypcja audio na tekst online — prywatny Whisper AI
Zamieniaj mowę z plików audio i wideo na tekst dzięki Whisper AI działającemu w przeglądarce. Bez przesyłania, za darmo, z kopiowaniem i pobieraniem TXT.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłaneMowa na tekst bez przesyłania nagrań
To narzędzie do transkrypcji zamienia wypowiedziane słowa z pliku audio lub wideo na zwykły tekst przy użyciu modelu rozpoznawania mowy Whisper od OpenAI. W przeciwieństwie do większości internetowych usług transkrypcji nie wysyła Twojego pliku nigdzie. Model działa w Twojej przeglądarce za pośrednictwem Transformers.js i ONNX Runtime, wykorzystując kartę graficzną przez WebGPU, gdy jest dostępne, a w przeciwnym razie korzystając z WebAssembly na procesorze. Wywiady, nagrania spotkań, wykłady, notatki głosowe i prywatne filmy przez cały czas pozostają na Twoim urządzeniu.
Jedynym pobieraniem z sieci jest sam model. Przy pierwszym uruchomieniu narzędzie pobiera wagi Whisper z hubu modeli Hugging Face, które przeglądarka następnie zapisuje w pamięci podręcznej, dzięki czemu kolejna transkrypcja rozpoczyna się niemal natychmiast. To żądanie nie zawiera żadnych danych z Twojego nagrania.
Jak działa transkrypcja
Po naciśnięciu Transcribe ścieżka dźwiękowa jest dekodowana i przepróbkowywana do 16 kHz mono, czyli formatu, którego oczekuje Whisper. Długie nagrania są dzielone na okna o długości do 30 sekund, a każde cięcie umieszczane jest w najcichszym momencie blisko końca okna, dzięki czemu słowa rzadko są przecinane w połowie. Ciche okna są pomijane, ponieważ Whisper ma tendencję do wymyślania fraz takich jak „Thank you”, gdy nic nie słyszy. Każde okno jest transkrybowane w workerze działającym w tle, więc strona pozostaje responsywna, a tekst pojawia się, gdy tylko każdy fragment zostanie ukończony.
Whisper Tiny to najszybsza opcja, która dobrze sprawdza się przy wyraźnej mowie. Whisper Base jest zauważalnie dokładniejszy przy akcentach i zaszumionym dźwięku, kosztem większego pobierania i wolniejszego przetwarzania. Jeśli znasz język wypowiedzi, wybierz go; automatyczne wykrywanie słucha początkowej części nagrania i wybiera najbardziej prawdopodobny język. Opcja Translate tworzy tekst w języku angielskim z mowy w innym języku.
Wskazówki dla lepszych wyników
Szybkość zależy od Twojego sprzętu: z WebGPU kilka minut nagrania zajmuje często znacznie mniej niż minutę, natomiast przetwarzanie wyłącznie na procesorze może trwać niemal tyle, ile samo nagranie. Najlepszy tekst dają nagrania z jednym mówcą blisko mikrofonu. Muzyka w tle, nakładające się głosy i silna kompresja obniżają dokładność. Wynik nie zawiera oznaczeń mówców ani znaczników czasu, więc jeśli potrzebujesz napisów z synchronizacją, użyj zamiast tego automatycznego generatora napisów. Zawsze sprawdzaj nazwy, liczby i słownictwo specjalistyczne przed opublikowaniem lub cytowaniem transkrypcji. Bardzo długie pliki wymagają dużo pamięci; jeśli w karcie zabraknie pamięci, najpierw podziel nagranie na krótsze części.
Jak używać
- Dodaj plikUpuść w polu nagranie audio lub film zawierający mowę.
- Wybierz model i językWybierz Tiny, jeśli liczy się szybkość, lub Base, jeśli liczy się dokładność, a następnie ustaw język wypowiedzi lub pozostaw Auto-detect.
- TranskrybujNaciśnij Transcribe i obserwuj, jak tekst pojawia się okno po oknie w trakcie pracy modelu.
- Skopiuj lub pobierzSprawdź transkrypcję, a następnie skopiuj ją lub zapisz jako plik .txt.