Дослідження · 13 вересня 2026
Один WER може бути корисним — і все одно не відповісти, який сервіс купити
Для українських субтитрів ми знайшли не рейтинг сервісів, а відтворюване дослідження гуцульського діалекту. Воно робить один ризик видимим: назва мови в налаштуваннях не гарантує якість на регіональному мовленні.
Що справді виміряла стаття
Kyslyi та співавт., VarDial 2026 зібрали 19 год 27 хв записів одного носія гуцульського діалекту, розбили матеріал на train/dev/test і оцінили локальні ASR-моделі. Для OmniASR 1B у таблиці 2 наведено WER 80,09% до донавчання та 13,09% після донавчання на цьому корпусі; менше — краще.
| Рядок зі статті | Метрика | Що можна сказати | Чого сказати не можна |
|---|---|---|---|
| OmniASR 1B до донавчання | WER 80,09% | Базова локальна модель помилялася часто саме на цьому гуцульському тесті. | Що будь-який хмарний сервіс матиме таку саму помилку. |
| OmniASR 1B після донавчання | WER 13,09% | Адаптація до цього корпусу суттєво змінила результат. | Що результат повториться на іншому спікері, шумному інтерв’ю чи без донавчання. |
Чому це не місце для Google або Azure
Стаття не запускає chirp, chirp_2 чи MAI-Transcribe-2, не порівнює плани або ціни й не перевіряє SRT у редакторі. Результати належать локальним моделям, конкретному читаному корпусу та власному донавчанню. Їх не можна відняти від чи додати до документації API.
Тому наш шортлист лишається обережним: Google документує uk-UA для chirp і chirp_2; Azure документує українську для MAI-Transcribe-2. Це підтримка, а не незалежно виміряна першість.
Що робити перед оплатою
- Візьміть 2–5 хвилин безпечного реального аудіо: імена, числа, паузи, шум і кілька голосів.
- Якщо в матеріалі є діалект або регіональна вимова, увімкніть її в уривок; не перевіряйте лише чисту літературну фразу.
- Звірте текст із записом, а після правок відкрийте SRT у тому програвачі, де його побачить аудиторія.
- Запишіть модель, дату, тариф, результат і ручні правки. Лише тоді вирішуйте, чи робити це регулярним процесом.
У свіжому DOU-розборі аналітик описує вибір між сервісами через конкретний файл, контекст, ліміти та структуру відповіді, а не через загальний титул «найкращий». Це один досвід, не рейтинг; але він пояснює, чому ваш пробний уривок важливіший за чужу загальну пораду.
Ми не запускали моделі, не слухали аудіо й не вимірювали WER у цьому оновленні. Наступний потрібний доказ — однаковий набір українських записів, поточні сервіси, помилки тексту, імен, таймінгу та готового експорту.