Transcrever áudio para texto online — Whisper AI privado
Converta a fala de arquivos de áudio e vídeo em texto com o Whisper AI rodando no seu navegador. Sem uploads, grátis, com cópia e download em TXT.
🔒 Executa completamente no seu navegador — nada é enviadoDa fala ao texto sem enviar suas gravações
Este transcritor transforma as palavras faladas de um arquivo de áudio ou vídeo em texto simples usando o modelo de reconhecimento de fala Whisper, da OpenAI. Ao contrário da maioria dos serviços de transcrição online, ele não envia seu arquivo para lugar nenhum. O modelo é executado dentro do seu navegador por meio do Transformers.js e do ONNX Runtime, usando sua placa de vídeo via WebGPU quando disponível e recorrendo ao WebAssembly na CPU caso contrário. Entrevistas, gravações de reuniões, aulas, notas de voz e vídeos privados permanecem no seu dispositivo o tempo todo.
O único download pela rede é o próprio modelo. Na primeira execução, a ferramenta busca os pesos do Whisper no hub de modelos do Hugging Face, que o navegador depois guarda em cache, para que a próxima transcrição comece quase imediatamente. Nada do seu áudio é incluído nessa solicitação.
Como funciona a transcrição
Quando você clica em Transcribe, a faixa de áudio é decodificada e reamostrada para 16 kHz mono, o formato que o Whisper espera. Gravações longas são divididas em janelas de até 30 segundos, e cada corte é posicionado no momento mais silencioso perto do fim da janela, para que as palavras raramente sejam cortadas ao meio. Janelas silenciosas são ignoradas porque o Whisper tende a inventar frases como «Thank you» quando não ouve nada. Cada janela é transcrita em um worker em segundo plano para que a página continue responsiva, e o texto aparece assim que cada trecho é concluído.
O Whisper Tiny é a opção mais rápida e funciona bem com fala clara. O Whisper Base é visivelmente mais preciso com sotaques e áudio ruidoso, ao custo de um download maior e de um processamento mais lento. Se você souber o idioma falado, selecione-o; a detecção automática escuta a primeira parte da gravação e escolhe o idioma mais provável. A opção Translate gera texto em inglês a partir de fala em outro idioma.
Dicas para melhores resultados
A velocidade depende do seu hardware: com WebGPU, alguns minutos de áudio costumam levar bem menos de um minuto, enquanto o processamento apenas na CPU pode se aproximar do tempo real. Gravações com um único locutor próximo ao microfone geram o melhor texto. Música de fundo, vozes sobrepostas e compressão forte reduzem a precisão. O resultado não tem identificação de locutores nem marcações de tempo; se você precisa de legendas com tempos, use o gerador automático de legendas. Revise sempre nomes, números e vocabulário especializado antes de publicar ou citar a transcrição. Arquivos muito longos exigem bastante memória; se uma aba ficar sem memória, divida primeiro a gravação em partes menores.
Como usar
- Adicione um arquivoArraste para a caixa uma gravação de áudio ou um vídeo com fala.
- Escolha modelo e idiomaEscolha Tiny para velocidade ou Base para precisão, e defina o idioma falado ou deixe Auto-detect.
- TranscrevaClique em Transcribe e veja o texto aparecer janela por janela enquanto o modelo trabalha.
- Copie ou baixeRevise a transcrição e depois copie-a ou salve-a como arquivo .txt.