Whisper Transcriber
Перетворюйте записи на редагований текст, нікуди їх не надсилаючи. Аудіо декодується, приводиться до потрібної частоти й розпізнається моделлю Whisper усередині Web Worker просто у вашому браузері — сервера розшифровки за цією утилітою немає.

Що робить утиліта
Whisper Transcriber перетворює мовлення на текст на вашому ж комп'ютері. Ви даєте їй аудіо- або відеофайл — чи записуєте звук просто з мікрофона — і отримуєте повний транскрипт та сегменти з таймкодами, які можна відредагувати й вивантажити у TXT, SRT або WebVTT.
Усе відбувається у вкладці браузера: медіа декодується та зводиться в моно 16 кГц, модель OpenAI Whisper виконується через Transformers.js на ONNX Runtime Web, а результат не залишає сторінку. Нічого не завантажується на сервер, не ставиться в чергу й не зберігається.
Застосунок зібраний як самостійний мікрозастосунок у static/utility-apps/whisper-transcriber. Оболонка CAD AutoScript вбудовує його в iframe того самого origin, тож транскрайбер розвивається у власному репозиторії, але користується спільним каталогом, статтею, реакціями, коментарями та шаром доступу цього сайту.
Перший запуск: завантаження моделі
Під час першого натискання Start Transcription браузер завантажує ваги багатомовної моделі Whisper Tiny із Hugging Face Hub і кешує їх. Це єдиний мережевий трафік утиліти, і він не містить вашого аудіо — лише файли моделі.
Скільки саме — залежить від того, який рушій запуститься; бейдж угорі утиліти завжди показує величину для вашого пристрою заздалегідь:
| Рушій | Ваги | Типовий пристрій |
|---|---|---|
| WASM | ~41 МБ | Телефони та планшети, а також браузери без WebGPU |
| WebGPU | ~77 МБ | Десктопні браузери з підтримкою GPU |
- Наступні запуски беруть модель із кешу й узагалі не потребують мережі.
- Очищення даних сайту, режим анонімного перегляду або брак місця у сховищі браузера можуть витіснити кеш і спричинити повторне завантаження.
- Ревізія моделі закріплена конкретним комітом, тож щоразу завантажується та сама версія.
Коли це знадобиться
- Оформлення протоколу наради, дзвінка з постачальником або розбору проєкту за записом.
- Перетворення відеообходів та інспекцій на текст, у якому можна шукати.
- Надиктовування переліків зауважень і спостережень QA замість набору тексту на об'єкті.
- Підготовка субтитрів SRT або WebVTT для внутрішніх навчальних відео та передавання справ.
- Розшифровка матеріалів, які не можна вивантажувати у сторонній сервіс.
Порядок роботи
- Перетягніть аудіо- або відеофайл у зону завантаження чи натисніть Record Audio і зупиніть запис, коли завершите.
- Дочекайтеся, доки рядок статусу повідомить про готовність медіа — там видно тривалість і те, чи буде застосовано віконний конвеєр.
- За потреби змініть мову, таймкоди та рушій, якщо типові значення не пасують запису.
- Натисніть Start Transcription. На першому запуску прогрес показує завантаження моделі, далі одразу починається розпізнавання.
- Правте транскрипт на місці — поле редаговане, і вивантаження беруть текст саме з нього.
- Скопіюйте текст або вивантажте TXT, SRT чи WebVTT.
- Натисніть Clear File, щоб вивантажити з пам'яті медіа, транскрипт і завантажену модель.
Налаштування
| Налаштування | Варіанти | На що впливає |
|---|---|---|
| Model | Whisper Tiny (багатомовна) | Ваги для розпізнавання. Показаний розмір — той, який реально завантажить ваш пристрій. |
| Language | Automatic Detection, English Only, Russian Only | Automatic визначає мову самостійно; явний вибір надійніший на коротких і шумних записах. |
| Timestamps | Show Timestamps, Text Only | Таймкоди дають список сегментів, потрібний для експорту SRT і WebVTT. |
| Engine Runtime | Auto (GPU/WASM), WASM Only, WebGPU Preferred | Auto бере GPU на десктопі та WASM на телефонах. WASM повільніший, але працює всюди, і утиліта сама відкочується на нього, коли шлях через GPU недоступний. |
Довгі записи
Короткі фрагменти декодуються за один прохід. Довге медіа спершу аналізується, а потім проганяється конвеєром моно-вікон: у пам'яті одночасно перебуває лише одне вікно, а модель лишається завантаженою між ними. На десктопі вікна по 30 секунд із перекриттям у 5, на телефонах — 15 і 3, що вдвічі знижує пік пам'яті. Транскрипт наповнюється вікно за вікном, а Cancel зупиняє роботу, не стираючи вже отриманий текст.
На телефоні
Утиліта працює в мобільних браузерах, і частина налаштувань виставляється за вас: рушієм за замовчуванням іде WASM, завантажується менша модель на 41 МБ, а аудіо ріжеться на коротші вікна. Пам'ятати варто про дві речі.
- Тримайте вкладку на передньому плані. Утиліта просить систему не гасити екран, але це не завадить їй вивантажити сторінку, якщо ви перемкнетеся на інший застосунок. Довгій розшифровці потрібна відкрита вкладка.
- Буде повільніше за ноутбук. Це справжній вивід моделі на вашому пристрої, а в телефона ресурсів просто менше.
Приватність
- Аудіо, відео, імена файлів, текст транскрипту та ваші правки лишаються на сторінці. Вони не надсилаються ні до CAD AutoScript, ні в аналітику, ні до будь-якого API розшифровки.
- Єдині вихідні запити — закріплені файли моделі з Hugging Face Hub. Жодних шрифтів, скриптів і трекерів зі сторонніх адрес не завантажується, і збірка перевіряється на це автоматично перед публікацією.
- Мікрофон вмикається лише після натискання Record Audio, і це єдина утиліта сайту, якій узагалі надано дозвіл на мікрофон.
- Clear File звільняє потік мікрофона, аудіобуфери та завантажену модель. Закриття вкладки робить те саме.
- Нічого не записується у ваш акаунт, історія транскриптів не ведеться — збережіть або вивантажте потрібне до того, як залишите сторінку.
Вимоги та обмеження
- Актуальна версія Chromium, Firefox або Safari з підтримкою WebAssembly — на десктопі чи телефоні. WebGPU необов'язковий і лише пришвидшує роботу.
- 41 МБ вільного кешу браузера під модель (77 МБ на шляху через WebGPU) плюс робоча пам'ять, пропорційна довжині запису.
- Whisper Tiny обирає швидкість коштом точності: технічні терміни, номери позицій та власні назви потрібно вичитувати.
- Сильний акцент, накладання голосів і шум на об'єкті погіршують результат — мікрофон ближче до мовця допомагає більше за будь-які налаштування.
- Розділення за мовцями, потокова розшифровка в реальному часі та більші моделі Whisper до цієї версії не входять.
- ⚠️ Транскрипт — чорновий матеріал. Звірте його із записом, перш ніж цитувати у звіті, протоколі чи будь-якому договірному документі.
Суміжні інструменти
Зворотний зв'язок і повідомлення про помилки
- Створити issue на GitHub
- Напишіть нам із зазначенням слага
whisper-transcriber, щоб ми могли відтворити проблему.