MT Media Tools

Transcribir audio a texto online — Whisper AI privado

Convierte la voz de archivos de audio y vídeo en texto con Whisper AI ejecutándose en tu navegador. Sin subidas, gratis, con copia y descarga en TXT.

🔒 Se ejecuta completamente en tu navegador — nada se carga

Drop an audio or video file here or click to browse

No file selected.

Advertisement

De voz a texto sin subir tus grabaciones

Este transcriptor convierte las palabras habladas de un archivo de audio o vídeo en texto plano utilizando el modelo de reconocimiento de voz Whisper de OpenAI. A diferencia de la mayoría de los servicios de transcripción online, no envía tu archivo a ninguna parte. El modelo se ejecuta dentro de tu navegador mediante Transformers.js y ONNX Runtime, usando tu tarjeta gráfica a través de WebGPU cuando está disponible y recurriendo a WebAssembly en la CPU en caso contrario. Entrevistas, grabaciones de reuniones, clases, notas de voz y vídeos privados permanecen en tu dispositivo en todo momento.

La única descarga de red es el propio modelo. En la primera ejecución, la herramienta obtiene los pesos de Whisper del hub de modelos de Hugging Face, que el navegador guarda después en caché, de modo que la siguiente transcripción empieza casi de inmediato. Esa solicitud no incluye absolutamente nada de tu audio.

Cómo funciona la transcripción

Al pulsar Transcribe, la pista de audio se decodifica y se remuestrea a 16 kHz mono, el formato que espera Whisper. Las grabaciones largas se dividen en ventanas de hasta 30 segundos, y cada corte se sitúa en el momento más silencioso cerca del final de la ventana, para que las palabras rara vez queden partidas por la mitad. Las ventanas en silencio se omiten porque Whisper tiende a inventar frases como «Thank you» cuando no oye nada. Cada ventana se transcribe en un worker en segundo plano para que la página siga respondiendo, y el texto aparece en cuanto termina cada fragmento.

Whisper Tiny es la opción más rápida y funciona bien con voz clara. Whisper Base es notablemente más preciso con acentos y audio ruidoso, a costa de una descarga mayor y un procesamiento más lento. Si conoces el idioma hablado, selecciónalo; la detección automática escucha la primera parte de la grabación y elige el idioma más probable. La opción Translate genera texto en inglés a partir de voz en otro idioma.

Consejos para obtener mejores resultados

La velocidad depende de tu hardware: con WebGPU, unos minutos de audio suelen tardar bastante menos de un minuto, mientras que el procesamiento solo con CPU puede acercarse al tiempo real. Las grabaciones con un único hablante cerca del micrófono dan el mejor texto. La música de fondo, las voces superpuestas y una compresión fuerte reducen la precisión. El resultado no incluye etiquetas de hablante ni marcas de tiempo, así que si necesitas subtítulos con tiempos, usa en su lugar el generador automático de subtítulos. Revisa siempre nombres, números y vocabulario especializado antes de publicar o citar la transcripción. Los archivos muy largos necesitan mucha memoria; si una pestaña se queda sin memoria, divide primero la grabación en partes más cortas.

Cómo usar

  1. Añade un archivoArrastra al recuadro una grabación de audio o un vídeo con voz.
  2. Elige modelo e idiomaElige Tiny para mayor velocidad o Base para mayor precisión, y selecciona el idioma hablado o deja Auto-detect.
  3. TranscribePulsa Transcribe y observa cómo el texto aparece ventana a ventana mientras trabaja el modelo.
  4. Copia o descargaRevisa la transcripción y luego cópiala o guárdala como archivo .txt.

Preguntas frecuentes

¿Se sube mi audio a un servidor?
No. Tu audio o vídeo se decodifica y transcribe en tu propio dispositivo. Lo único que se descarga es el propio modelo Whisper, que procede del hub de modelos de Hugging Face y queda guardado en la caché de tu navegador.
¿Por qué la primera transcripción es más lenta?
La primera ejecución descarga el modelo de reconocimiento de voz (aproximadamente 40–130 MB según el modelo que elijas) y ONNX Runtime. Después quedan en caché, por lo que las siguientes ejecuciones arrancan mucho más rápido.
¿Qué idiomas se admiten?
Whisper entiende unos 100 idiomas. Elige el idioma hablado para obtener la mejor precisión o usa Auto-detect. También puedes traducir voz de otros idiomas a texto en inglés.
¿Qué precisión tiene?
La voz clara con poco ruido de fondo se transcribe bien, sobre todo con el modelo Base. Los acentos, la música, los hablantes superpuestos y los términos técnicos pueden provocar errores, así que revisa siempre el texto.
¿Funciona con archivos de vídeo?
Sí. Funcionan MP4, WebM, MOV, MKV y la mayoría de los formatos de audio. La pista de audio se extrae en el navegador, con ffmpeg.wasm como alternativa para los formatos que el navegador no puede decodificar por sí mismo.
Advertisement