Shaduf.
Рейтинг AI для української мови/Вичитка — це не ELO: новий GEC-тест і суворіший гуцульський ASR-орієнтир

Звіт · 15 вересня 2026

Вичитка — це не ELO: новий GEC-тест і суворіший гуцульський ASR-орієнтир

Питання: Який AI найкраще працює українською?

Відповідь цього звіту: для чернетки лишається модельний ELO UkrQualBench. Для вичитки вже написаного тексту корисніший окремий результат: Gemini 3.1-Pro з конкретним українським minimal-edits промптом має F0.5 69,22 на UNLP-2023 GEC-only. Для гуцульського мовлення новий багатоспікерний локальний результат показує, чому готовий API не можна назвати переможцем без вашого запису.

Що додано для вичитки

Karpo та Chernodub перевірили 11 комерційних LLM і одну українську відкриту модель на GEC-only тесті. Найкращий API-рядок — Gemini 3.1-Pro, Ukrainian minimal-edits + few-shot + optimized-v2: precision 70,77, recall 63,63, F0.5 69,22. Це конфігурація моделі й промпта; вона не говорить, що ця сама модель видна у вашій підписці або не зіпсує імена, цифри та стиль у документі.

Стаття також показує межу: детальні інструкції зменшують зайві правки в пунктуації, відмінку й роді, але можуть пропускати рідкісні категорії та надмірно нормалізувати діалог, синоніми або допустимі мовні варіанти. Тому новий маршрут просить порівнювати версію до й після, а не довіряти «покращенню» автоматично.

Що змінилося для регіонального мовлення

Orlovskyi та ін. розширили гуцульський ASR-корпус до 40 спікерів і 60,63 год. Донавчена OmniASR-CTC-1B отримала 28,76% WER та 11,49% CER на агрегаті з 3 451 висловлювання, але 43,63% WER і 17,24% CER на Hutsulendia radio. Це корисний локальний baseline, а не тест Google, Azure, спікерів, таймінгу SRT, ціни чи приватності готового сервісу.

Чому перекладацький бал не закриває вибір

У іншому дослідженні UNLP GPT-5.2, DeepL та Lapa перемагали в нейронних метриках на літературному корпусі, а оцінка літературності без джерельного тексту віддала верхні місця людським перекладам. Це один корпус, але він вимагає лишити художньому та брендовому перекладу людське читання української версії.

Що лишається невідомим

Не знайдено незалежного зіставлення готових українських сервісів субтитрів, цілісності таблиць або багатокрокового збереження контексту. Ми не запускали моделі, не завантажували документи, не слухали аудіо й не вимірювали власні результати.

Search published pools, pages, reports, and evidence.