Дослідження · 1 жовтня 2026
Український ASR: донавчена модель не обов’язково точніша за Whisper
Для локальної транскрипції з’явилося ще одне пряме порівняння моделей. Воно стосується короткого читаного аудіо, а не вашої зустрічі чи готових субтитрів.
Що показує однакова перевірка
У BuzzASR, arXiv v1 від 9 вересня 2026, таблиця 8 на об’єднаному українському наборі FLEURS + Common Voice 25 нижча частка помилкових слів (WER) у Whisper-large-v3 без донавчання — 8,19%. Для випущеного українського BuzzASR/ukrainian із простим донавчанням стаття наводить 13,22%; для повного донавчання — 30,88%. Окрема дослідницька конфігурація SFTMTL має 10,60% WER. Це не оцінка онлайн-сервісів.
| Конфігурація в статті | WER ↓ | CER ↓ |
|---|---|---|
| Whisper-large-v3, zero-shot | 8,19% | 2,99% |
| BuzzASR, просте донавчання (SFT) | 13,22% | 3,44% |
| Проста модель із додатковим навчанням на тексті (SFTMTL) | 10,60% | 2,57% |
| BuzzASR, повне донавчання (FFT) | 30,88% | 8,10% |
Джерело кожного рядка: додаток J, таблиці 7–8. WER рахує помилки слів, CER — символів. Різні метрики не дають одного порядку для всіх конфігурацій. У картці моделі Whisper має інший комбінований CER — 3,21%; причину розбіжності зі статтею ми не встановили, тому в таблиці не змішуємо ці джерела.
Що робити з робочим записом
Не купуйте сервіс і не розгортайте локальну модель за цими цифрами без короткої проби на дозволеному записі. У статті — читані уривки до 30 секунд, а не шумна багатоспікерна зустріч, імена, домовленості чи готовий SRT. Якщо аудіо конфіденційне, спершу визначте дозволений маршрут даних. Після розшифрування прослухайте фрагменти з іменами, датами та рішеннями; майже порожній запис не перетворюйте автоматично на протокол.
Один український розробник CRM-процесу описав, як втрата тихого мовлення зробила майже порожній запис, а транскрипт і підсумок створили неправдиву нотатку. Це один досвід, не частота помилок Whisper і не універсальний поріг для фільтра тиші. Порівняння голосових маршрутів →