Shaduf.

Голос і субтитри · оновлено 17 вересня 2026

Для українських субтитрів спершу оберіть потрібний вихід. Рейтингу сервісів за точністю ще немає.

Позначені спікери, таймкоди, довжина запису та експорт — окремі умови. Нижче — API з документованими функціями, одна зіставна пара відкритих чекпойнтів і локальний діалектний результат. Жодне джерело не дає спільного українського WER, якості таймінгу чи готовності SRT для готових сервісів.

Задокументовані API та голоси

Інструмент / точна модельПровайдерЩо задокументовано для українськоїДата перевіркиПряме джерелоЩо ще не виміряно
Scribe v2ElevenLabsУкраїнська (ukr), word-level timestamps, діаризація до 32 спікерів і keyterm prompting. Постачальник відносить українську до власної категорії ≤5% WER.17 вересня 2026Документація Scribe v2Метод WER-категорії, імена, шум, накладання голосів, SRT, ціна й приватність не зіставлені незалежно.
Cloud Speech-to-Text V2: chirpGoogle Clouduk-UA; автоматична пунктуація.13 вересня 2026Таблиця мов V2Імена, шум, кілька спікерів, таймінг і придатність субтитрів.
Cloud Speech-to-Text V2: chirp_2Google Clouduk-UA у таблиці мов; word-level timestamps, адаптація та інші функції описані для моделі. Поточна документація моделі каже: діаризація не підтримується.17 вересня 2026Документація Chirp 2 · таблиця мовЧи функції дають кращий український SRT саме на вашому записі; автоматичний поділ спікерів ця модель не надає.
MAI-Transcribe-2Microsoft AzureУкраїнська (uk), діаризація, word-level timestamps, список термінів і режими verbatim/clean через Fast Transcription enhancedMode.17 вересня 2026MAI-TranscribeПорівняльний WER, розподіл за спікерами й експорт для українського відео. Поточна preview-документація попереджає: з діаризацією записи близько 15 хвилин і довші можуть завершитися помилкою.
Cloud Text-to-Speech: uk-UA-Chirp3-HD-*Google CloudОпубліковано українські преміум-голоси Chirp3 HD, зокрема Callirrhoe, Charon, Despina й Enceladus, а також Standard-B і Wavenet-B.13 вересня 2026Список голосівПриродність, вимова назв і придатність для конкретного жанру не порівняні незалежно.

Локальні відкриті чекпойнти: порівнюйте лише в межах одного джерела

Ці моделі треба запускати й підтримувати технічно. Вони не є підпискою або готовим сервісом субтитрів. Тут є точні рядки, але вони не утворюють рейтинг разом із Google, Azure чи між собою.

Точна модель / умоваТест і метрикаОпублікований результатПрактичний висновокМежа
oruk/orukeet v0.1.0, r3 проти Parakeet; автор називає SHA обох чекпойнтівОднакове FLEURS Ukrainian аудіо, 750 читаних кліпів · WER / CER, нижче кращеOrukeet 5,39% / 1,60%; Parakeet 6,00% / 1,74%. Прямий запис r3Для технічного локального процесу з подібним читаним аудіо Orukeet має кращий опублікований рядок саме в цій парі.Запис веде автор моделі; FLEURS не вимірює діалог, шум, імена, спікерів, SRT, ціну чи приватність.
asfberlin/fast-ukrainian-asr 220M CTC проти whisper-large-v3Один model card, спільний normalizer: CV10 читане чисте / телефонне та два спонтанні набори · WERfast-ukrainian-asr: 9,64% / 10,59% на CV10; Whisper: 13,85% / 17,42%. На rs-test і test-y Whisper нижче: 16,96% проти 28,03% та 20,90% проти 26,28%. ТаблицяНе переносіть кращий результат на читаному або телефонному аудіо на розмову: спершу назвіть свій домен і швидкодію.Це самоопис автора на власних наборах; він не зіставляється чисельно з FLEURS-рядком вище й не оцінює сервіс.

Гуцульське мовлення: локальний результат — не рейтинг сервісів

Дослідження UNLP 2026 розширило гуцульський корпус із одного читця до 40 спікерів і 60,63 год. Автори донавчили локальні моделі; для OmniASR-CTC-1B вказано 28,76% WER і 11,49% CER на агрегаті з 3 451 висловлювання. На 217 уривках радіопрограми Hutsulendia — 43,63% WER і 17,24% CER. Таблиця 3 і метод

Це корисний локальний baseline, але не тест Google, Azure, спікерів, таймінгу SRT, ціни чи приватності готового сервісу. Якщо у вас є регіональна вимова, додайте її до короткого власного фрагмента.

Як обрати без вигаданого переможця

Потрібно знати, хто говорить: не обирайте chirp_2 як готовий поділ спікерів. Scribe v2 і MAI-Transcribe-2 мають задокументовану діаризацію; для Azure не плануйте поточний preview-шлях на довгий запис. Можете підтримувати локальний процес: беріть лише рядок із тестом, схожим на ваше аудіо; FLEURS або CV10 не є автоматично вашим відео.

Перед контрактом або виробництвом зробіть короткий запис із власними назвами, числами, фоновим шумом і двома голосами. Якщо у вас діалект або регіональна вимова, додайте його до фрагмента. Перевірте текст, сегментацію, час та цільовий експорт — покроковий маршрут до SRT.

Search published pools, pages, reports, and evidence.