Shaduf.

Методологія · оновлено 21 вересня 2026

Що означає місце в нашій таблиці

Ми показуємо лише ті числа, для яких можна назвати модель або сервіс, задачу, метрику, дату й пряме джерело. Схожі назви не означають, що результати можна скласти докупи.

ПозначкаЩо можна стверджуватиЧого не можна стверджувати
Виміряно: ELO генераціїУ публічному пакеті UkrQualBench за серпень 2026 один ідентифікатор переміг інші у парних порівняннях української генерації.Що це поточна модель у кожній підписці, найкращий перекладач, редактор документів або сервіс для таблиць.
Виміряно: UNLP grammarМодель має конкретний результат у 347 експертних multiple-choice завданнях із граматики, лексики та правопису з визначеним промптом.Що відсоток описує готовий лист, договір, презентацію або будь-яку іншу задачу.
Виміряно: UNLP GECСтаття називає модель, український промпт, test set, precision, recall і F0.5 для виправлення помилок.Що цей результат належить поточному тарифу, редагує документи без зайвих змін або вимірює факти.
Виміряно: SimIdiomsШість названих моделей отримали середній 1–3 бал за EN→UK речення зі сталими виразами, за базовою та контекстною умовою статті.Що рядок визначає поточний сервіс, ціну, приватність, загальну якість перекладу або людське приймання готового тексту.
Виміряно: доменний RAG-перекладУ приватному legal/military EN→UK корпусі стаття порівнює названі моделі та кількість retrieved двомовних прикладів, вимірюючи ChrF++ і COMET.Що ваш чат, тариф, словник, політика даних або домен повторять результат; це не рейтинг сервісів.
Виміряно: UNLP оцінювання перекладуУ 1 000 EN→UK парах стаття порівнює кореляцію заданих LLM-суддів і QE-моделей з усередненими оцінками професійних перекладачів.Що модель краще перекладає, доступна у вашій підписці, може прийняти готовий документ або замінює людську перевірку.
Виміряно: Ukrainian LLM LeaderboardОкремий результат називає модель, бенчмарк, метрику й дату агрегованого файла.Що один рядок є повним рейтингом усіх моделей або готових сервісів.
Виміряно: парний ASR-чекпойнтДва точні чекпойнти декодували те саме назване аудіо; нижчий WER належить лише цій парі й тесту.Що це незалежний тест сервісів, прогноз для діалогу, SRT, ціни чи приватності.
Виміряно: WTM-Bench для таблицьУ 150 задачах перевіряють перехід від початкової до цільової книги для формул, діаграм, зведених таблиць і умовного форматування.Що результат є українським рейтингом сервісів, вимірює гривні, дати, експорт чи поточний тариф.
Підтримку задокументованоПостачальник називає українську, модель, режим або функцію; наприклад, DeepL документує українську для глосарія тексту й файлів.Що ми виміряли точність, слухали аудіо, перевірили SRT, зберегли робочу книгу або довели послідовність термінів.
Власна категорія точності постачальникаПостачальник називає межу або WER для власної моделі й методу.Що ця цифра зіставляється з іншими API, вашим записом або незалежним тестом.
Не виміряноНаразі немає достатнього зіставного доказу для місця.Що інструмент поганий або взагалі не підтримує українську.

Поточні набори доказів

  • UkrQualBench — maintainer-published лідерборд української природності. Ми показуємо ELO і точний рядок моделі, а поруч вказуємо: у прочитаному README немає для кожного рядка immutable API snapshot і точного часу запуску.
  • UNLP 2026 — стаття з експертним набором із 347 завдань. На нашій текстовій сторінці рядки відсортовано лише за однією спільною колонкою: XM, 5-shot, український промпт.
  • Ukrainian LLM Leaderboard та його агрегований результат — відкриті дані для окремих українських NLP-задач; наш перевірений Gemma рядок не перетворено на загальний ранг.
  • Orukeet r3 — model card із названими SHA і парним FLEURS Ukrainian рядком проти Parakeet. Це доказ для конкретної пари локальних чекпойнтів, а не незалежний рейтинг сервісів.
  • fast-ukrainian-asr — model card із окремими рядками читаного, телефонного та спонтанного аудіо; їх не можна скласти з FLEURS у спільний бал.
  • VarDial 2026: гуцульський ASR — вимірювання локальних моделей на одному діалектному корпусі. Число WER корисне для межі цього корпусу, але не є місцем для готового API чи прогнозом вашого відео.
  • WTM-Bench — незалежний тест агентів таблиць із початковою та цільовою книгами. Він показує, чому готовий файл треба перевіряти; у прочитаному описі немає порівняння українських інструкцій, гривень і готових сервісів.
  • Google, Chirp 2, Azure, ElevenLabs Scribe, Google Workspace, OpenAI та Microsoft — документація про функції й мови, а не незалежні українські тести.
  • Karpo & Chernodub, UNLP 2026 — контрольований GEC-only тест моделей разом із мовою та типом промпта. Ми показуємо конкретні конфігурації; це не доказ про тариф, приватний документ або іншу задачу.
  • Goto, Sakai & Watanabe, BEA 2026 — метод редагування за повторюваними правками на кількох GEC-наборах, зокрема UNLP-2023. Вісім варіантів, поріг із development-даних і вилучення правок не перетворюються на рейтинг чатів або простий повторний запит.
  • Orlovskyi et al., UNLP 2026 — локальні донавчені ASR-моделі на багатоспікерному гуцульському корпусі. WER/CER тут не є рейтингом хмарних API.
  • Chaplynskyi et al., UNLP 2026 — один літературний перекладацький корпус, де метрики й оцінка літературності не збіглися; це межа для застосування метрик.
  • Petruniv, Makogon & Kyslyi, SimIdioms, UNLP 2026 — порівняння шести моделей на EN→UK та UK→EN реченнях зі сталими виразами. Для EN→UK показано середній бал і вплив явного позначення ідіоми; LLM-суддя, вузька задача й модельні мітки не перетворюються на рейтинг підписок.
  • Shpigunov, UNLP 2026 — RAG-переклад у приватному legal/military корпусі: 258 тестових пар, 2 581 приклад в індексі, Gemma 3 і Gemini 3 Flash. Результат показує цінність вузького перевіреного контексту, але не порівнює чати, тарифи, завантаження глосарію чи читачівські дані.
  • Chaplynskyi, Zakharov & Ivashkevych, UNLP 2026 — 1 000 EN→UK пар і професійні оцінки перекладу. Ми показуємо кореляцію LLM-суддів та QE-моделей з оцінкою перекладачів; це не рейтинг генераторів або дозвіл публікувати текст без людини.
  • DeepL glossary — поточна документація функції: українська вказана серед мов глосарія, доступного для тексту й файлів. Це заява постачальника, не незалежна оцінка якості чи послідовності EN→UK термінів.

Чого не показує ELO тексту

ELO UkrQualBench відповідає на парне порівняння генерації. Він не перевіряє, чи сервіс збереже бриф, джерела, назви, заборони та стиль після наступної правки у вашому документі. Для такої покупки потрібен безпечний бриф → чернетка → пізня правка; це власна перевірка читача, а не бал у нашій таблиці.

Що потрібно, аби змінити висновок

Для субтитрів — однакові українські записи зі стандартною та регіональною вимовою, опублікованими помилками, іменами, таймінгом, SRT та умовами запуску. Для таблиць — однакова тестова книга з українськими інструкціями, формулами, датами, гривнями й перевіреним експортом. Перевірка має порівнювати цільову книгу, а не лише текстовий опис зміни. Для готових текстових сервісів — зафіксований тариф, точна модель, промпт і незалежна або відтворювана оцінка.

Ми не проводили у цьому оновленні власних запусків, прослуховувань, вимірювань точності чи перевірок файлів.

Search published pools, pages, reports, and evidence.