Whisper Transcriber
Превращайте записи в редактируемый текст, никуда их не отправляя. Аудио декодируется, приводится к нужной частоте и распознаётся моделью Whisper внутри Web Worker прямо в вашем браузере — сервера расшифровки за этой утилитой нет.

Что делает утилита
Whisper Transcriber переводит речь в текст на вашем же компьютере. Вы даёте ей аудио- или видеофайл — либо записываете звук прямо с микрофона — и получаете полный транскрипт плюс сегменты с таймкодами, которые можно отредактировать и выгрузить в TXT, SRT или WebVTT.
Всё происходит во вкладке браузера: медиа декодируется и сводится в моно 16 кГц, модель OpenAI Whisper выполняется через Transformers.js на ONNX Runtime Web, а результат не покидает страницу. Ничего не загружается на сервер, не ставится в очередь и не сохраняется.
Приложение собрано как самостоятельное микро-приложение в static/utility-apps/whisper-transcriber. Оболочка CAD AutoScript встраивает его в iframe того же origin, поэтому транскрайбер развивается в собственном репозитории, но использует общий каталог, статью, реакции, комментарии и слой доступа этого сайта.
Первый запуск: загрузка модели
При первом нажатии Start Transcription браузер скачивает веса мультиязычной модели Whisper Tiny с Hugging Face Hub и кэширует их. Это единственный сетевой трафик утилиты, и он не содержит вашего аудио — только файлы модели.
Сколько именно — зависит от того, какой движок запустится; бейдж вверху утилиты всегда показывает величину для вашего устройства заранее:
| Движок | Веса | Типичное устройство |
|---|---|---|
| WASM | ~41 МБ | Телефоны и планшеты, а также браузеры без WebGPU |
| WebGPU | ~77 МБ | Десктопные браузеры с поддержкой GPU |
- Последующие запуски берут модель из кэша и вообще не требуют сети.
- Очистка данных сайта, режим инкогнито или нехватка места в хранилище браузера могут вытеснить кэш и вызвать повторную загрузку.
- Ревизия модели закреплена конкретным коммитом, поэтому каждый раз скачивается одна и та же версия.
Когда пригодится
- Оформление протокола совещания, звонка с поставщиком или разбора проекта по записи.
- Превращение видеообходов и инспекций в текст, по которому можно искать.
- Надиктовка списков замечаний и наблюдений QA вместо набора текста на объекте.
- Подготовка субтитров SRT или WebVTT для внутренних обучающих видео и передачи дел.
- Расшифровка материалов, которые нельзя выгружать в сторонний сервис.
Порядок работы
- Перетащите аудио- или видеофайл в зону загрузки либо нажмите Record Audio и остановите запись по готовности.
- Дождитесь, пока строка статуса сообщит о готовности медиа — там видны длительность и то, будет ли использован оконный конвейер.
- При необходимости смените язык, таймкоды и движок, если значения по умолчанию не подходят записи.
- Нажмите Start Transcription. На первом запуске прогресс покажет загрузку модели, дальше сразу начнётся распознавание.
- Правьте транскрипт на месте — поле редактируемое, и выгрузки берут текст именно из него.
- Скопируйте текст или выгрузите TXT, SRT либо WebVTT.
- Нажмите Clear File, чтобы выгрузить из памяти медиа, транскрипт и загруженную модель.
Настройки
| Настройка | Варианты | На что влияет |
|---|---|---|
| Model | Whisper Tiny (мультиязычная) | Веса для распознавания. Показанный размер — тот, который реально скачает ваше устройство. |
| Language | Automatic Detection, English Only, Russian Only | Automatic определяет язык сам; явный выбор надёжнее на коротких и шумных записях. |
| Timestamps | Show Timestamps, Text Only | Таймкоды дают список сегментов, необходимый для экспорта SRT и WebVTT. |
| Engine Runtime | Auto (GPU/WASM), WASM Only, WebGPU Preferred | Auto берёт GPU на десктопе и WASM на телефонах. WASM медленнее, но работает везде, и утилита сама откатывается на него, когда путь через GPU недоступен. |
Длинные записи
Короткие фрагменты декодируются за один проход. Длинное медиа сначала анализируется, а затем прогоняется конвейером моно-окон: в памяти одновременно находится только одно окно, а модель остаётся загруженной между ними. На десктопе окна по 30 секунд с перекрытием в 5, на телефонах — 15 и 3, что вдвое снижает пик памяти. Транскрипт наполняется окно за окном, а Cancel останавливает работу, не стирая уже полученный текст.
На телефоне
Утилита работает в мобильных браузерах, и часть настроек выставляется за вас: движком по умолчанию идёт WASM, скачивается меньшая модель на 41 МБ, а аудио режется на более короткие окна. Помнить стоит о двух вещах.
- Держите вкладку на переднем плане. Утилита просит систему не гасить экран, но это не мешает ей выгрузить страницу, если вы переключитесь на другое приложение. Длинной расшифровке нужна открытая вкладка.
- Будет медленнее ноутбука. Это настоящий вывод модели на вашем устройстве, а у телефона ресурсов просто меньше.
Приватность
- Аудио, видео, имена файлов, текст транскрипта и ваши правки остаются на странице. Они не отправляются ни в CAD AutoScript, ни в аналитику, ни в какой-либо API расшифровки.
- Единственные исходящие запросы — закреплённые файлы модели с Hugging Face Hub. Никаких шрифтов, скриптов и трекеров со сторонних адресов не загружается, и сборка проверяется на это автоматически перед публикацией.
- Микрофон включается только после нажатия Record Audio, и это единственная утилита сайта, которой вообще выдано разрешение на микрофон.
- Clear File освобождает поток микрофона, аудиобуферы и загруженную модель. Закрытие вкладки делает то же самое.
- Ничего не записывается в ваш аккаунт, история транскриптов не ведётся — сохраните или выгрузите нужное до ухода со страницы.
Требования и ограничения
- Актуальная версия Chromium, Firefox или Safari с поддержкой WebAssembly — на десктопе или телефоне. WebGPU необязателен и лишь ускоряет работу.
- 41 МБ свободного кэша браузера под модель (77 МБ на пути через WebGPU) плюс рабочая память, пропорциональная длине записи.
- Whisper Tiny выбирает скорость в ущерб точности: технические термины, номера позиций и имена собственные нужно вычитывать.
- Сильный акцент, перебивающие друг друга голоса и шум на объекте ухудшают результат — микрофон ближе к говорящему помогает сильнее любых настроек.
- Разделение по говорящим, потоковая расшифровка в реальном времени и более крупные модели Whisper в эту версию не входят.
- ⚠️ Транскрипт — черновой материал. Сверьте его с записью, прежде чем цитировать в отчёте, протоколе или любом договорном документе.
Смежные инструменты
Обратная связь и сообщения об ошибках
- Создать issue на GitHub
- Напишите нам с указанием слага
whisper-transcriber, чтобы мы могли воспроизвести проблему.