Методологія · оновлено 21 вересня 2026
Що означає місце в нашій таблиці
Ми показуємо лише ті числа, для яких можна назвати модель або сервіс, задачу, метрику, дату й пряме джерело. Схожі назви не означають, що результати можна скласти докупи.
| Позначка | Що можна стверджувати | Чого не можна стверджувати |
|---|---|---|
| Виміряно: ELO генерації | У публічному пакеті UkrQualBench за серпень 2026 один ідентифікатор переміг інші у парних порівняннях української генерації. | Що це поточна модель у кожній підписці, найкращий перекладач, редактор документів або сервіс для таблиць. |
| Виміряно: UNLP grammar | Модель має конкретний результат у 347 експертних multiple-choice завданнях із граматики, лексики та правопису з визначеним промптом. | Що відсоток описує готовий лист, договір, презентацію або будь-яку іншу задачу. |
| Виміряно: UNLP GEC | Стаття називає модель, український промпт, test set, precision, recall і F0.5 для виправлення помилок. | Що цей результат належить поточному тарифу, редагує документи без зайвих змін або вимірює факти. |
| Виміряно: SimIdioms | Шість названих моделей отримали середній 1–3 бал за EN→UK речення зі сталими виразами, за базовою та контекстною умовою статті. | Що рядок визначає поточний сервіс, ціну, приватність, загальну якість перекладу або людське приймання готового тексту. |
| Виміряно: доменний RAG-переклад | У приватному legal/military EN→UK корпусі стаття порівнює названі моделі та кількість retrieved двомовних прикладів, вимірюючи ChrF++ і COMET. | Що ваш чат, тариф, словник, політика даних або домен повторять результат; це не рейтинг сервісів. |
| Виміряно: UNLP оцінювання перекладу | У 1 000 EN→UK парах стаття порівнює кореляцію заданих LLM-суддів і QE-моделей з усередненими оцінками професійних перекладачів. | Що модель краще перекладає, доступна у вашій підписці, може прийняти готовий документ або замінює людську перевірку. |
| Виміряно: Ukrainian LLM Leaderboard | Окремий результат називає модель, бенчмарк, метрику й дату агрегованого файла. | Що один рядок є повним рейтингом усіх моделей або готових сервісів. |
| Виміряно: парний ASR-чекпойнт | Два точні чекпойнти декодували те саме назване аудіо; нижчий WER належить лише цій парі й тесту. | Що це незалежний тест сервісів, прогноз для діалогу, SRT, ціни чи приватності. |
| Виміряно: WTM-Bench для таблиць | У 150 задачах перевіряють перехід від початкової до цільової книги для формул, діаграм, зведених таблиць і умовного форматування. | Що результат є українським рейтингом сервісів, вимірює гривні, дати, експорт чи поточний тариф. |
| Підтримку задокументовано | Постачальник називає українську, модель, режим або функцію; наприклад, DeepL документує українську для глосарія тексту й файлів. | Що ми виміряли точність, слухали аудіо, перевірили SRT, зберегли робочу книгу або довели послідовність термінів. |
| Власна категорія точності постачальника | Постачальник називає межу або WER для власної моделі й методу. | Що ця цифра зіставляється з іншими API, вашим записом або незалежним тестом. |
| Не виміряно | Наразі немає достатнього зіставного доказу для місця. | Що інструмент поганий або взагалі не підтримує українську. |
Поточні набори доказів
- UkrQualBench — maintainer-published лідерборд української природності. Ми показуємо ELO і точний рядок моделі, а поруч вказуємо: у прочитаному README немає для кожного рядка immutable API snapshot і точного часу запуску.
- UNLP 2026 — стаття з експертним набором із 347 завдань. На нашій текстовій сторінці рядки відсортовано лише за однією спільною колонкою: XM, 5-shot, український промпт.
- Ukrainian LLM Leaderboard та його агрегований результат — відкриті дані для окремих українських NLP-задач; наш перевірений Gemma рядок не перетворено на загальний ранг.
- Orukeet r3 — model card із названими SHA і парним FLEURS Ukrainian рядком проти Parakeet. Це доказ для конкретної пари локальних чекпойнтів, а не незалежний рейтинг сервісів.
- fast-ukrainian-asr — model card із окремими рядками читаного, телефонного та спонтанного аудіо; їх не можна скласти з FLEURS у спільний бал.
- VarDial 2026: гуцульський ASR — вимірювання локальних моделей на одному діалектному корпусі. Число WER корисне для межі цього корпусу, але не є місцем для готового API чи прогнозом вашого відео.
- WTM-Bench — незалежний тест агентів таблиць із початковою та цільовою книгами. Він показує, чому готовий файл треба перевіряти; у прочитаному описі немає порівняння українських інструкцій, гривень і готових сервісів.
- Google, Chirp 2, Azure, ElevenLabs Scribe, Google Workspace, OpenAI та Microsoft — документація про функції й мови, а не незалежні українські тести.
- Karpo & Chernodub, UNLP 2026 — контрольований GEC-only тест моделей разом із мовою та типом промпта. Ми показуємо конкретні конфігурації; це не доказ про тариф, приватний документ або іншу задачу.
- Goto, Sakai & Watanabe, BEA 2026 — метод редагування за повторюваними правками на кількох GEC-наборах, зокрема UNLP-2023. Вісім варіантів, поріг із development-даних і вилучення правок не перетворюються на рейтинг чатів або простий повторний запит.
- Orlovskyi et al., UNLP 2026 — локальні донавчені ASR-моделі на багатоспікерному гуцульському корпусі. WER/CER тут не є рейтингом хмарних API.
- Chaplynskyi et al., UNLP 2026 — один літературний перекладацький корпус, де метрики й оцінка літературності не збіглися; це межа для застосування метрик.
- Petruniv, Makogon & Kyslyi, SimIdioms, UNLP 2026 — порівняння шести моделей на EN→UK та UK→EN реченнях зі сталими виразами. Для EN→UK показано середній бал і вплив явного позначення ідіоми; LLM-суддя, вузька задача й модельні мітки не перетворюються на рейтинг підписок.
- Shpigunov, UNLP 2026 — RAG-переклад у приватному legal/military корпусі: 258 тестових пар, 2 581 приклад в індексі, Gemma 3 і Gemini 3 Flash. Результат показує цінність вузького перевіреного контексту, але не порівнює чати, тарифи, завантаження глосарію чи читачівські дані.
- Chaplynskyi, Zakharov & Ivashkevych, UNLP 2026 — 1 000 EN→UK пар і професійні оцінки перекладу. Ми показуємо кореляцію LLM-суддів та QE-моделей з оцінкою перекладачів; це не рейтинг генераторів або дозвіл публікувати текст без людини.
- DeepL glossary — поточна документація функції: українська вказана серед мов глосарія, доступного для тексту й файлів. Це заява постачальника, не незалежна оцінка якості чи послідовності EN→UK термінів.
Чого не показує ELO тексту
ELO UkrQualBench відповідає на парне порівняння генерації. Він не перевіряє, чи сервіс збереже бриф, джерела, назви, заборони та стиль після наступної правки у вашому документі. Для такої покупки потрібен безпечний бриф → чернетка → пізня правка; це власна перевірка читача, а не бал у нашій таблиці.
Що потрібно, аби змінити висновок
Для субтитрів — однакові українські записи зі стандартною та регіональною вимовою, опублікованими помилками, іменами, таймінгом, SRT та умовами запуску. Для таблиць — однакова тестова книга з українськими інструкціями, формулами, датами, гривнями й перевіреним експортом. Перевірка має порівнювати цільову книгу, а не лише текстовий опис зміни. Для готових текстових сервісів — зафіксований тариф, точна модель, промпт і незалежна або відтворювана оцінка.
Ми не проводили у цьому оновленні власних запусків, прослуховувань, вимірювань точності чи перевірок файлів.