Skip to main content

Whisper Transcriber

Перетворюйте записи на редагований текст, нікуди їх не надсилаючи. Аудіо декодується, приводиться до потрібної частоти й розпізнається моделлю Whisper усередині Web Worker просто у вашому браузері — сервера розшифровки за цією утилітою немає.

Оглядова картка Whisper Transcriber

Відкрити утиліту

Що робить утиліта

Whisper Transcriber перетворює мовлення на текст на вашому ж комп'ютері. Ви даєте їй аудіо- або відеофайл — чи записуєте звук просто з мікрофона — і отримуєте повний транскрипт та сегменти з таймкодами, які можна відредагувати й вивантажити у TXT, SRT або WebVTT.

Усе відбувається у вкладці браузера: медіа декодується та зводиться в моно 16 кГц, модель OpenAI Whisper виконується через Transformers.js на ONNX Runtime Web, а результат не залишає сторінку. Нічого не завантажується на сервер, не ставиться в чергу й не зберігається.

Застосунок зібраний як самостійний мікрозастосунок у static/utility-apps/whisper-transcriber. Оболонка CAD AutoScript вбудовує його в iframe того самого origin, тож транскрайбер розвивається у власному репозиторії, але користується спільним каталогом, статтею, реакціями, коментарями та шаром доступу цього сайту.

Перший запуск: завантаження моделі

Під час першого натискання Start Transcription браузер завантажує ваги багатомовної моделі Whisper Tiny із Hugging Face Hub і кешує їх. Це єдиний мережевий трафік утиліти, і він не містить вашого аудіо — лише файли моделі.

Скільки саме — залежить від того, який рушій запуститься; бейдж угорі утиліти завжди показує величину для вашого пристрою заздалегідь:

РушійВагиТиповий пристрій
WASM~41 МБТелефони та планшети, а також браузери без WebGPU
WebGPU~77 МБДесктопні браузери з підтримкою GPU
  • Наступні запуски беруть модель із кешу й узагалі не потребують мережі.
  • Очищення даних сайту, режим анонімного перегляду або брак місця у сховищі браузера можуть витіснити кеш і спричинити повторне завантаження.
  • Ревізія моделі закріплена конкретним комітом, тож щоразу завантажується та сама версія.

Коли це знадобиться

  • Оформлення протоколу наради, дзвінка з постачальником або розбору проєкту за записом.
  • Перетворення відеообходів та інспекцій на текст, у якому можна шукати.
  • Надиктовування переліків зауважень і спостережень QA замість набору тексту на об'єкті.
  • Підготовка субтитрів SRT або WebVTT для внутрішніх навчальних відео та передавання справ.
  • Розшифровка матеріалів, які не можна вивантажувати у сторонній сервіс.

Порядок роботи

  1. Перетягніть аудіо- або відеофайл у зону завантаження чи натисніть Record Audio і зупиніть запис, коли завершите.
  2. Дочекайтеся, доки рядок статусу повідомить про готовність медіа — там видно тривалість і те, чи буде застосовано віконний конвеєр.
  3. За потреби змініть мову, таймкоди та рушій, якщо типові значення не пасують запису.
  4. Натисніть Start Transcription. На першому запуску прогрес показує завантаження моделі, далі одразу починається розпізнавання.
  5. Правте транскрипт на місці — поле редаговане, і вивантаження беруть текст саме з нього.
  6. Скопіюйте текст або вивантажте TXT, SRT чи WebVTT.
  7. Натисніть Clear File, щоб вивантажити з пам'яті медіа, транскрипт і завантажену модель.

Налаштування

НалаштуванняВаріантиНа що впливає
ModelWhisper Tiny (багатомовна)Ваги для розпізнавання. Показаний розмір — той, який реально завантажить ваш пристрій.
LanguageAutomatic Detection, English Only, Russian OnlyAutomatic визначає мову самостійно; явний вибір надійніший на коротких і шумних записах.
TimestampsShow Timestamps, Text OnlyТаймкоди дають список сегментів, потрібний для експорту SRT і WebVTT.
Engine RuntimeAuto (GPU/WASM), WASM Only, WebGPU PreferredAuto бере GPU на десктопі та WASM на телефонах. WASM повільніший, але працює всюди, і утиліта сама відкочується на нього, коли шлях через GPU недоступний.

Довгі записи

Короткі фрагменти декодуються за один прохід. Довге медіа спершу аналізується, а потім проганяється конвеєром моно-вікон: у пам'яті одночасно перебуває лише одне вікно, а модель лишається завантаженою між ними. На десктопі вікна по 30 секунд із перекриттям у 5, на телефонах — 15 і 3, що вдвічі знижує пік пам'яті. Транскрипт наповнюється вікно за вікном, а Cancel зупиняє роботу, не стираючи вже отриманий текст.

На телефоні

Утиліта працює в мобільних браузерах, і частина налаштувань виставляється за вас: рушієм за замовчуванням іде WASM, завантажується менша модель на 41 МБ, а аудіо ріжеться на коротші вікна. Пам'ятати варто про дві речі.

  • Тримайте вкладку на передньому плані. Утиліта просить систему не гасити екран, але це не завадить їй вивантажити сторінку, якщо ви перемкнетеся на інший застосунок. Довгій розшифровці потрібна відкрита вкладка.
  • Буде повільніше за ноутбук. Це справжній вивід моделі на вашому пристрої, а в телефона ресурсів просто менше.

Приватність

  • Аудіо, відео, імена файлів, текст транскрипту та ваші правки лишаються на сторінці. Вони не надсилаються ні до CAD AutoScript, ні в аналітику, ні до будь-якого API розшифровки.
  • Єдині вихідні запити — закріплені файли моделі з Hugging Face Hub. Жодних шрифтів, скриптів і трекерів зі сторонніх адрес не завантажується, і збірка перевіряється на це автоматично перед публікацією.
  • Мікрофон вмикається лише після натискання Record Audio, і це єдина утиліта сайту, якій узагалі надано дозвіл на мікрофон.
  • Clear File звільняє потік мікрофона, аудіобуфери та завантажену модель. Закриття вкладки робить те саме.
  • Нічого не записується у ваш акаунт, історія транскриптів не ведеться — збережіть або вивантажте потрібне до того, як залишите сторінку.

Вимоги та обмеження

  • Актуальна версія Chromium, Firefox або Safari з підтримкою WebAssembly — на десктопі чи телефоні. WebGPU необов'язковий і лише пришвидшує роботу.
  • 41 МБ вільного кешу браузера під модель (77 МБ на шляху через WebGPU) плюс робоча пам'ять, пропорційна довжині запису.
  • Whisper Tiny обирає швидкість коштом точності: технічні терміни, номери позицій та власні назви потрібно вичитувати.
  • Сильний акцент, накладання голосів і шум на об'єкті погіршують результат — мікрофон ближче до мовця допомагає більше за будь-які налаштування.
  • Розділення за мовцями, потокова розшифровка в реальному часі та більші моделі Whisper до цієї версії не входять.
  • ⚠️ Транскрипт — чорновий матеріал. Звірте його із записом, перш ніж цитувати у звіті, протоколі чи будь-якому договірному документі.

Суміжні інструменти

Зворотний зв'язок і повідомлення про помилки

  • Створити issue на GitHub
  • Напишіть нам із зазначенням слага whisper-transcriber, щоб ми могли відтворити проблему.
LinkedInGitHub