Голос і субтитри · оновлено 17 вересня 2026
Для українських субтитрів спершу оберіть потрібний вихід. Рейтингу сервісів за точністю ще немає.
Позначені спікери, таймкоди, довжина запису та експорт — окремі умови. Нижче — API з документованими функціями, одна зіставна пара відкритих чекпойнтів і локальний діалектний результат. Жодне джерело не дає спільного українського WER, якості таймінгу чи готовності SRT для готових сервісів.
Задокументовані API та голоси
| Інструмент / точна модель | Провайдер | Що задокументовано для української | Дата перевірки | Пряме джерело | Що ще не виміряно |
|---|---|---|---|---|---|
Scribe v2 | ElevenLabs | Українська (ukr), word-level timestamps, діаризація до 32 спікерів і keyterm prompting. Постачальник відносить українську до власної категорії ≤5% WER. | 17 вересня 2026 | Документація Scribe v2 | Метод WER-категорії, імена, шум, накладання голосів, SRT, ціна й приватність не зіставлені незалежно. |
Cloud Speech-to-Text V2: chirp | Google Cloud | uk-UA; автоматична пунктуація. | 13 вересня 2026 | Таблиця мов V2 | Імена, шум, кілька спікерів, таймінг і придатність субтитрів. |
Cloud Speech-to-Text V2: chirp_2 | Google Cloud | uk-UA у таблиці мов; word-level timestamps, адаптація та інші функції описані для моделі. Поточна документація моделі каже: діаризація не підтримується. | 17 вересня 2026 | Документація Chirp 2 · таблиця мов | Чи функції дають кращий український SRT саме на вашому записі; автоматичний поділ спікерів ця модель не надає. |
MAI-Transcribe-2 | Microsoft Azure | Українська (uk), діаризація, word-level timestamps, список термінів і режими verbatim/clean через Fast Transcription enhancedMode. | 17 вересня 2026 | MAI-Transcribe | Порівняльний WER, розподіл за спікерами й експорт для українського відео. Поточна preview-документація попереджає: з діаризацією записи близько 15 хвилин і довші можуть завершитися помилкою. |
Cloud Text-to-Speech: uk-UA-Chirp3-HD-* | Google Cloud | Опубліковано українські преміум-голоси Chirp3 HD, зокрема Callirrhoe, Charon, Despina й Enceladus, а також Standard-B і Wavenet-B. | 13 вересня 2026 | Список голосів | Природність, вимова назв і придатність для конкретного жанру не порівняні незалежно. |
Локальні відкриті чекпойнти: порівнюйте лише в межах одного джерела
Ці моделі треба запускати й підтримувати технічно. Вони не є підпискою або готовим сервісом субтитрів. Тут є точні рядки, але вони не утворюють рейтинг разом із Google, Azure чи між собою.
| Точна модель / умова | Тест і метрика | Опублікований результат | Практичний висновок | Межа |
|---|---|---|---|---|
oruk/orukeet v0.1.0, r3 проти Parakeet; автор називає SHA обох чекпойнтів | Однакове FLEURS Ukrainian аудіо, 750 читаних кліпів · WER / CER, нижче краще | Orukeet 5,39% / 1,60%; Parakeet 6,00% / 1,74%. Прямий запис r3 | Для технічного локального процесу з подібним читаним аудіо Orukeet має кращий опублікований рядок саме в цій парі. | Запис веде автор моделі; FLEURS не вимірює діалог, шум, імена, спікерів, SRT, ціну чи приватність. |
asfberlin/fast-ukrainian-asr 220M CTC проти whisper-large-v3 | Один model card, спільний normalizer: CV10 читане чисте / телефонне та два спонтанні набори · WER | fast-ukrainian-asr: 9,64% / 10,59% на CV10; Whisper: 13,85% / 17,42%. На rs-test і test-y Whisper нижче: 16,96% проти 28,03% та 20,90% проти 26,28%. Таблиця | Не переносіть кращий результат на читаному або телефонному аудіо на розмову: спершу назвіть свій домен і швидкодію. | Це самоопис автора на власних наборах; він не зіставляється чисельно з FLEURS-рядком вище й не оцінює сервіс. |
Гуцульське мовлення: локальний результат — не рейтинг сервісів
Дослідження UNLP 2026 розширило гуцульський корпус із одного читця до 40 спікерів і 60,63 год. Автори донавчили локальні моделі; для OmniASR-CTC-1B вказано 28,76% WER і 11,49% CER на агрегаті з 3 451 висловлювання. На 217 уривках радіопрограми Hutsulendia — 43,63% WER і 17,24% CER. Таблиця 3 і метод
Це корисний локальний baseline, але не тест Google, Azure, спікерів, таймінгу SRT, ціни чи приватності готового сервісу. Якщо у вас є регіональна вимова, додайте її до короткого власного фрагмента.
Як обрати без вигаданого переможця
Потрібно знати, хто говорить: не обирайте chirp_2 як готовий поділ спікерів. Scribe v2 і MAI-Transcribe-2 мають задокументовану діаризацію; для Azure не плануйте поточний preview-шлях на довгий запис. Можете підтримувати локальний процес: беріть лише рядок із тестом, схожим на ваше аудіо; FLEURS або CV10 не є автоматично вашим відео.
Перед контрактом або виробництвом зробіть короткий запис із власними назвами, числами, фоновим шумом і двома голосами. Якщо у вас діалект або регіональна вимова, додайте його до фрагмента. Перевірте текст, сегментацію, час та цільовий експорт — покроковий маршрут до SRT.