Звіт · 13 вересня 2026
Моделі в рядках: ELO генерації, граматичний тест і шортлисти сервісів
Питання: Який AI найкраще працює українською?
Відповідь цього звіту: для української генерації тексту найсильніший доступний прямий сигнал — claude-opus-5 з ELO 1785,1 у відкритій таблиці UkrQualBench за серпень 2026. Для експертного тесту норми української окремо лідирує gpt-oss-120b — 55,2% XM з українським 5-shot промптом. Це різні вимірювання й не назви готових підписок.
Що додано
- 25 прямих рядків UkrQualBench: точний ідентифікатор, маршрут провайдера, ELO, дата пакета та посилання поруч із кожним результатом.
- 13 зіставних рядків Таблиці 2 UNLP 2026, відсортованих лише за XM fs5 з українським промптом.
- Один перевірений рядок відкритого Ukrainian LLM Leaderboard із FLORES, LongFLORES і SQuAD метриками.
- Названі голосові моделі
chirp,chirp_2,MAI-Transcribe-2та українські Chirp3 HD voices; окремий шортлист Gemini, ChatGPT і Copilot для таблиць.
Мінімальна таблиця висновку
| Задача | Лідер або шортлист | Метрика / доказ | Джерело |
|---|---|---|---|
| Парна генерація українського тексту | claude-opus-5 | ELO 1785,1; пакет «серпень 2026» | UkrQualBench |
| Граматика, лексика, правопис | gpt-oss-120b | XM fs5 uk 55,2%; максимум статті 59,6% в іншому setting | UNLP 2026 |
| Транскрипція API | chirp_2; MAI-Transcribe-2 | Документовані українська та різні функції, без порівняльного WER | Google · Azure |
| Таблиця | Gemini у Sheets; ChatGPT для Excel/Sheets; Copilot у Excel | Документована українська та/або нативний workflow, без тесту цілісності | Google · OpenAI · Microsoft |
Що залишається невідомим
У видимих нам джерелах немає незалежного зіставлення готових підписок для клієнтських текстів, немає українського head-to-head для точності субтитрів і немає тесту збереження формул, дат, гривень та експорту. Також UkrQualBench не показує для кожного рядка точний час запуску й immutable API snapshot. Через це ми не називаємо його місце рекомендацією купити конкретний сервіс.