Saltar al contenido principal

Whisper Transcriber

Convierte grabaciones en texto editable sin enviarlas a ninguna parte. El audio se decodifica, se remuestrea y lo transcribe un modelo Whisper que se ejecuta en un Web Worker dentro de tu propio navegador: detrás de esta utilidad no hay ningún servidor de transcripción.

Tarjeta de presentación de Whisper Transcriber

Abrir utilidad

Qué hace

Whisper Transcriber convierte el habla en texto en tu propio equipo. Le das un archivo de audio o vídeo —o grabas directamente desde el micrófono— y obtienes una transcripción completa junto con segmentos con marcas de tiempo que puedes editar y exportar como TXT, SRT o WebVTT.

Todo ocurre en la pestaña del navegador: el medio se decodifica y se mezcla a mono 16 kHz, el modelo Whisper de OpenAI se ejecuta mediante Transformers.js sobre ONNX Runtime Web y el resultado no sale de la página. Nada se sube, se encola ni se almacena en un servidor.

La aplicación está construida como una microaplicación independiente en static/utility-apps/whisper-transcriber. El shell de CAD AutoScript la incrusta en un iframe del mismo origen, de modo que el transcriptor puede evolucionar en su propio repositorio mientras comparte el catálogo, el artículo, las reacciones, los comentarios y la capa de acceso de este sitio.

Primera ejecución: la descarga del modelo

La primera vez que pulsas Start Transcription, el navegador descarga los pesos del modelo multilingüe Whisper Tiny desde Hugging Face Hub y los guarda en caché. Ese es el único tráfico de red que genera la utilidad, y no contiene audio: solo los archivos del modelo.

Cuánto depende del motor que se ejecute; la etiqueta en la parte superior de la utilidad muestra siempre la cifra de tu dispositivo antes de empezar:

MotorPesosDispositivo habitual
WASM~41 MBMóviles y tabletas, y cualquier navegador sin WebGPU
WebGPU~77 MBNavegadores de escritorio con soporte de GPU
  • Las ejecuciones posteriores parten de esa caché y no necesitan red en absoluto.
  • Borrar los datos del sitio, usar una ventana privada o la presión de almacenamiento del navegador pueden desalojar la caché y provocar una nueva descarga.
  • La revisión del modelo está fijada a un commit concreto, así que siempre se descarga la misma versión.

Cuándo usarla

  • Redactar actas de reuniones, llamadas con proveedores o revisiones de diseño a partir de una grabación.
  • Convertir vídeos de recorridos e inspecciones en texto que se puede buscar.
  • Dictar listas de pendientes y observaciones de calidad en obra en lugar de teclearlas.
  • Producir subtítulos SRT o WebVTT para vídeos internos de formación y traspaso.
  • Transcribir material que no puedes subir a un servicio de terceros.

Flujo de trabajo

  1. Arrastra un archivo de audio o vídeo a la zona de carga, o pulsa Record Audio y detén la grabación al terminar.
  2. Espera a que la línea de estado indique que el medio está listo: muestra la duración y si se usará la tubería por ventanas.
  3. Cambia el idioma, las marcas de tiempo y el motor si los valores por defecto no encajan con la grabación.
  4. Pulsa Start Transcription. En la primera ejecución la barra de progreso muestra la descarga del modelo; después pasa directamente a la inferencia.
  5. Corrige la transcripción sobre la marcha: el área de texto es editable y las exportaciones leen de ella.
  6. Copia el texto o exporta TXT, SRT o WebVTT.
  7. Pulsa Clear File para liberar de la memoria el medio, la transcripción y el modelo cargado.

Ajustes

AjusteOpcionesQué cambia
ModelWhisper Tiny (multilingüe)Los pesos usados para el reconocimiento. El tamaño mostrado es el que tu dispositivo descargará realmente.
LanguageAutomatic Detection, English Only, Russian OnlyAutomatic deja que Whisper detecte el idioma; elegirlo explícitamente es más fiable en clips cortos o ruidosos.
TimestampsShow Timestamps, Text OnlyLas marcas de tiempo generan la lista de segmentos que necesita la exportación a SRT y WebVTT.
Engine RuntimeAuto (GPU/WASM), WASM Only, WebGPU PreferredAuto usa la GPU en escritorio y WASM en móviles. WASM es más lento pero funciona en todas partes, y la utilidad recurre a él por su cuenta cuando la vía por GPU no está disponible.

Grabaciones largas

Los clips cortos se decodifican de una sola pasada. Los medios más largos se analizan primero y luego se procesan mediante una cadena de ventanas mono, de modo que en memoria solo hay una ventana a la vez mientras el modelo permanece cargado entre ellas. En escritorio son ventanas de 30 segundos con 5 de solapamiento; en móvil, 15 y 3, lo que reduce a la mitad el pico de memoria. La transcripción se va rellenando ventana a ventana, y Cancel detiene la ejecución sin perder lo ya producido.

En el móvil

La utilidad funciona en navegadores móviles y ajusta varias cosas por ti: el motor por defecto es WASM, se descarga el modelo más pequeño de 41 MB y el audio se trocea en ventanas más cortas. Conviene tener presentes dos cosas.

  • Mantén la pestaña en primer plano. La utilidad pide al sistema que no apague la pantalla, pero eso no impide que suspenda la página si cambias a otra aplicación. Una transcripción larga necesita la pestaña visible.
  • Será más lento que un portátil. Aquí se ejecuta inferencia real en tu dispositivo, y un teléfono simplemente tiene menos que ofrecer.

Privacidad

  • El audio, el vídeo, los nombres de archivo, el texto de la transcripción y tus ediciones se quedan en la página. Nunca se envían a CAD AutoScript, a analítica ni a ninguna API de transcripción.
  • Las únicas peticiones salientes son los archivos del modelo fijados en Hugging Face Hub. No se cargan fuentes, scripts ni rastreadores desde ningún otro sitio, y la compilación se verifica automáticamente antes de publicarse.
  • Solo se accede al micrófono después de pulsar Record Audio, y esta es la única utilidad del sitio a la que se concede permiso de micrófono.
  • Clear File libera el flujo del micrófono, los búferes de audio y el modelo cargado. Cerrar la pestaña hace lo mismo.
  • No se guarda nada en tu cuenta ni se conserva historial de transcripciones: guarda o exporta lo que quieras conservar antes de salir de la página.

Requisitos y límites

  • Una versión actual de Chromium, Firefox o Safari con soporte de WebAssembly, en escritorio o móvil. WebGPU es opcional y solo aporta velocidad.
  • 41 MB libres de caché del navegador para el modelo (77 MB en la vía WebGPU), además de memoria de trabajo proporcional a la duración de la grabación.
  • Whisper Tiny prioriza la velocidad sobre la precisión: revisa el vocabulario técnico, los números de pieza y los nombres propios.
  • Los acentos marcados, las voces superpuestas y el ruido de obra degradan el resultado; acercar el micrófono ayuda mucho más que cualquier ajuste de aquí.
  • La separación por hablantes, la transcripción continua en directo y los modelos Whisper mayores no forman parte de esta versión.
  • ⚠️ Las transcripciones son una ayuda de redacción. Contrástalas con la grabación antes de citarlas en un informe, un acta o cualquier documento contractual.

Herramientas relacionadas

Comentarios / informe de errores

LinkedInGitHub