Shaduf.
Рейтинг AI для української мови/Діалектний WER без фальшивого рейтингу сервісів

Дослідження · 13 вересня 2026

Один WER може бути корисним — і все одно не відповісти, який сервіс купити

Для українських субтитрів ми знайшли не рейтинг сервісів, а відтворюване дослідження гуцульського діалекту. Воно робить один ризик видимим: назва мови в налаштуваннях не гарантує якість на регіональному мовленні.

Що справді виміряла стаття

Kyslyi та співавт., VarDial 2026 зібрали 19 год 27 хв записів одного носія гуцульського діалекту, розбили матеріал на train/dev/test і оцінили локальні ASR-моделі. Для OmniASR 1B у таблиці 2 наведено WER 80,09% до донавчання та 13,09% після донавчання на цьому корпусі; менше — краще.

Рядок зі статтіМетрикаЩо можна сказатиЧого сказати не можна
OmniASR 1B до донавчанняWER 80,09%Базова локальна модель помилялася часто саме на цьому гуцульському тесті.Що будь-який хмарний сервіс матиме таку саму помилку.
OmniASR 1B після донавчанняWER 13,09%Адаптація до цього корпусу суттєво змінила результат.Що результат повториться на іншому спікері, шумному інтерв’ю чи без донавчання.

Чому це не місце для Google або Azure

Стаття не запускає chirp, chirp_2 чи MAI-Transcribe-2, не порівнює плани або ціни й не перевіряє SRT у редакторі. Результати належать локальним моделям, конкретному читаному корпусу та власному донавчанню. Їх не можна відняти від чи додати до документації API.

Тому наш шортлист лишається обережним: Google документує uk-UA для chirp і chirp_2; Azure документує українську для MAI-Transcribe-2. Це підтримка, а не незалежно виміряна першість.

Що робити перед оплатою

  1. Візьміть 2–5 хвилин безпечного реального аудіо: імена, числа, паузи, шум і кілька голосів.
  2. Якщо в матеріалі є діалект або регіональна вимова, увімкніть її в уривок; не перевіряйте лише чисту літературну фразу.
  3. Звірте текст із записом, а після правок відкрийте SRT у тому програвачі, де його побачить аудиторія.
  4. Запишіть модель, дату, тариф, результат і ручні правки. Лише тоді вирішуйте, чи робити це регулярним процесом.

У свіжому DOU-розборі аналітик описує вибір між сервісами через конкретний файл, контекст, ліміти та структуру відповіді, а не через загальний титул «найкращий». Це один досвід, не рейтинг; але він пояснює, чому ваш пробний уривок важливіший за чужу загальну пораду.

Ми не запускали моделі, не слухали аудіо й не вимірювали WER у цьому оновленні. Наступний потрібний доказ — однаковий набір українських записів, поточні сервіси, помилки тексту, імен, таймінгу та готового експорту.

Search published pools, pages, reports, and evidence.