Транскрипция аудио в текст онлайн — приватный Whisper AI
Преобразуйте речь из аудио- и видеофайлов в текст с помощью Whisper AI, работающего в вашем браузере. Без загрузки на сервер, бесплатно, с копированием и скачиванием в TXT.
🔒 Работает полностью в вашем браузере — ничего не загружаетсяРечь в текст без загрузки ваших записей
Этот транскрибатор превращает произнесённые слова в аудио- или видеофайле в обычный текст с помощью модели распознавания речи Whisper от OpenAI. В отличие от большинства онлайн-сервисов транскрипции, он никуда не отправляет ваш файл. Модель работает прямо в вашем браузере через Transformers.js и ONNX Runtime, используя видеокарту через WebGPU, когда она доступна, а в противном случае переключаясь на WebAssembly на процессоре. Интервью, записи совещаний, лекции, голосовые заметки и личные видео всё время остаются на вашем устройстве.
Единственное, что загружается из сети, — это сама модель. При первом запуске инструмент получает веса Whisper из хаба моделей Hugging Face, которые браузер затем кэширует, поэтому следующая транскрипция начинается почти сразу. Никаких данных вашего аудио в этом запросе нет.
Как работает транскрипция
Когда вы нажимаете Transcribe, звуковая дорожка декодируется и передискретизируется в 16 кГц моно — формат, который ожидает Whisper. Длинные записи разбиваются на окна длительностью до 30 секунд, и каждый разрез ставится в самый тихий момент ближе к концу окна, поэтому слова редко разрезаются пополам. Тихие окна пропускаются, поскольку Whisper склонен выдумывать фразы вроде «Thank you», когда ничего не слышит. Каждое окно транскрибируется в фоновом worker, так что страница остаётся отзывчивой, а текст появляется сразу, как только готов очередной фрагмент.
Whisper Tiny — самый быстрый вариант, который хорошо справляется с чёткой речью. Whisper Base заметно точнее при акцентах и зашумлённом аудио, но требует более объёмной загрузки и работает медленнее. Если вы знаете язык речи, выберите его; автоопределение прослушивает начало записи и выбирает наиболее вероятный язык. Опция Translate создаёт английский текст из речи на другом языке.
Советы для лучших результатов
Скорость зависит от вашего оборудования: с WebGPU несколько минут аудио часто обрабатываются значительно быстрее чем за минуту, тогда как обработка только на процессоре может занимать почти столько же времени, сколько длится запись. Лучший текст дают записи с одним говорящим рядом с микрофоном. Фоновая музыка, одновременная речь нескольких людей и сильное сжатие снижают точность. Результат не содержит пометок говорящих и временных меток, поэтому если вам нужны субтитры с таймингом, воспользуйтесь вместо этого автоматическим генератором субтитров. Всегда проверяйте имена, числа и специальную терминологию, прежде чем публиковать или цитировать расшифровку. Очень длинные файлы требуют много памяти; если вкладке не хватает памяти, сначала разделите запись на более короткие части.
Как использовать
- Добавьте файлПеретащите в поле аудиозапись или видео с речью.
- Выберите модель и языкВыберите Tiny для скорости или Base для точности, а также укажите язык речи или оставьте Auto-detect.
- ТранскрибируйтеНажмите Transcribe и наблюдайте, как текст появляется окно за окном по мере работы модели.
- Скопируйте или скачайтеПроверьте расшифровку, затем скопируйте её или сохраните как файл .txt.