Перейти к основному содержимому

Whisper Transcriber

Превращайте записи в редактируемый текст, никуда их не отправляя. Аудио декодируется, приводится к нужной частоте и распознаётся моделью Whisper внутри Web Worker прямо в вашем браузере — сервера расшифровки за этой утилитой нет.

Обзорная карточка Whisper Transcriber

Открыть утилиту

Что делает утилита

Whisper Transcriber переводит речь в текст на вашем же компьютере. Вы даёте ей аудио- или видеофайл — либо записываете звук прямо с микрофона — и получаете полный транскрипт плюс сегменты с таймкодами, которые можно отредактировать и выгрузить в TXT, SRT или WebVTT.

Всё происходит во вкладке браузера: медиа декодируется и сводится в моно 16 кГц, модель OpenAI Whisper выполняется через Transformers.js на ONNX Runtime Web, а результат не покидает страницу. Ничего не загружается на сервер, не ставится в очередь и не сохраняется.

Приложение собрано как самостоятельное микро-приложение в static/utility-apps/whisper-transcriber. Оболочка CAD AutoScript встраивает его в iframe того же origin, поэтому транскрайбер развивается в собственном репозитории, но использует общий каталог, статью, реакции, комментарии и слой доступа этого сайта.

Первый запуск: загрузка модели

При первом нажатии Start Transcription браузер скачивает веса мультиязычной модели Whisper Tiny с Hugging Face Hub и кэширует их. Это единственный сетевой трафик утилиты, и он не содержит вашего аудио — только файлы модели.

Сколько именно — зависит от того, какой движок запустится; бейдж вверху утилиты всегда показывает величину для вашего устройства заранее:

ДвижокВесаТипичное устройство
WASM~41 МБТелефоны и планшеты, а также браузеры без WebGPU
WebGPU~77 МБДесктопные браузеры с поддержкой GPU
  • Последующие запуски берут модель из кэша и вообще не требуют сети.
  • Очистка данных сайта, режим инкогнито или нехватка места в хранилище браузера могут вытеснить кэш и вызвать повторную загрузку.
  • Ревизия модели закреплена конкретным коммитом, поэтому каждый раз скачивается одна и та же версия.

Когда пригодится

  • Оформление протокола совещания, звонка с поставщиком или разбора проекта по записи.
  • Превращение видеообходов и инспекций в текст, по которому можно искать.
  • Надиктовка списков замечаний и наблюдений QA вместо набора текста на объекте.
  • Подготовка субтитров SRT или WebVTT для внутренних обучающих видео и передачи дел.
  • Расшифровка материалов, которые нельзя выгружать в сторонний сервис.

Порядок работы

  1. Перетащите аудио- или видеофайл в зону загрузки либо нажмите Record Audio и остановите запись по готовности.
  2. Дождитесь, пока строка статуса сообщит о готовности медиа — там видны длительность и то, будет ли использован оконный конвейер.
  3. При необходимости смените язык, таймкоды и движок, если значения по умолчанию не подходят записи.
  4. Нажмите Start Transcription. На первом запуске прогресс покажет загрузку модели, дальше сразу начнётся распознавание.
  5. Правьте транскрипт на месте — поле редактируемое, и выгрузки берут текст именно из него.
  6. Скопируйте текст или выгрузите TXT, SRT либо WebVTT.
  7. Нажмите Clear File, чтобы выгрузить из памяти медиа, транскрипт и загруженную модель.

Настройки

НастройкаВариантыНа что влияет
ModelWhisper Tiny (мультиязычная)Веса для распознавания. Показанный размер — тот, который реально скачает ваше устройство.
LanguageAutomatic Detection, English Only, Russian OnlyAutomatic определяет язык сам; явный выбор надёжнее на коротких и шумных записях.
TimestampsShow Timestamps, Text OnlyТаймкоды дают список сегментов, необходимый для экспорта SRT и WebVTT.
Engine RuntimeAuto (GPU/WASM), WASM Only, WebGPU PreferredAuto берёт GPU на десктопе и WASM на телефонах. WASM медленнее, но работает везде, и утилита сама откатывается на него, когда путь через GPU недоступен.

Длинные записи

Короткие фрагменты декодируются за один проход. Длинное медиа сначала анализируется, а затем прогоняется конвейером моно-окон: в памяти одновременно находится только одно окно, а модель остаётся загруженной между ними. На десктопе окна по 30 секунд с перекрытием в 5, на телефонах — 15 и 3, что вдвое снижает пик памяти. Транскрипт наполняется окно за окном, а Cancel останавливает работу, не стирая уже полученный текст.

На телефоне

Утилита работает в мобильных браузерах, и часть настроек выставляется за вас: движком по умолчанию идёт WASM, скачивается меньшая модель на 41 МБ, а аудио режется на более короткие окна. Помнить стоит о двух вещах.

  • Держите вкладку на переднем плане. Утилита просит систему не гасить экран, но это не мешает ей выгрузить страницу, если вы переключитесь на другое приложение. Длинной расшифровке нужна открытая вкладка.
  • Будет медленнее ноутбука. Это настоящий вывод модели на вашем устройстве, а у телефона ресурсов просто меньше.

Приватность

  • Аудио, видео, имена файлов, текст транскрипта и ваши правки остаются на странице. Они не отправляются ни в CAD AutoScript, ни в аналитику, ни в какой-либо API расшифровки.
  • Единственные исходящие запросы — закреплённые файлы модели с Hugging Face Hub. Никаких шрифтов, скриптов и трекеров со сторонних адресов не загружается, и сборка проверяется на это автоматически перед публикацией.
  • Микрофон включается только после нажатия Record Audio, и это единственная утилита сайта, которой вообще выдано разрешение на микрофон.
  • Clear File освобождает поток микрофона, аудиобуферы и загруженную модель. Закрытие вкладки делает то же самое.
  • Ничего не записывается в ваш аккаунт, история транскриптов не ведётся — сохраните или выгрузите нужное до ухода со страницы.

Требования и ограничения

  • Актуальная версия Chromium, Firefox или Safari с поддержкой WebAssembly — на десктопе или телефоне. WebGPU необязателен и лишь ускоряет работу.
  • 41 МБ свободного кэша браузера под модель (77 МБ на пути через WebGPU) плюс рабочая память, пропорциональная длине записи.
  • Whisper Tiny выбирает скорость в ущерб точности: технические термины, номера позиций и имена собственные нужно вычитывать.
  • Сильный акцент, перебивающие друг друга голоса и шум на объекте ухудшают результат — микрофон ближе к говорящему помогает сильнее любых настроек.
  • Разделение по говорящим, потоковая расшифровка в реальном времени и более крупные модели Whisper в эту версию не входят.
  • ⚠️ Транскрипт — черновой материал. Сверьте его с записью, прежде чем цитировать в отчёте, протоколе или любом договорном документе.

Смежные инструменты

Обратная связь и сообщения об ошибках

  • Создать issue на GitHub
  • Напишите нам с указанием слага whisper-transcriber, чтобы мы могли воспроизвести проблему.
LinkedInGitHub