Текст і документи · оновлено 21 вересня 2026
Український текст: показники й робочі умови відповідають на різні питання
Швидкий вибір: для першої чернетки дивіться ELO claude-opus-5 у UkrQualBench. Для виправлення вже написаного тексту не переносіть цей ELO: окремий GEC-тест ставить найвище конкретну конфігурацію Gemini 3.1-Pro з українським minimal-edits промптом. Для англійських речень зі сталими виразами тепер є ще одна вузька таблиця: SimIdioms ставить Gemini 2.5 Flash першим за своїм середнім EN→UK балом. Додано й окреме зіставлення інструментів оцінки перекладу та документований український глосарійний маршрут. Жодна цифра не є рейтингом тарифів, чат-інтерфейсів або документних процесів.
1. Генерація українського тексту: UkrQualBench
Таблицю відсортовано за спаданням ELO. У репозиторії вона позначена «серпень 2026»; ELO утворено у швейцарському турнірі парних порівнянь генерації. «Провайдер/маршрут» — лише те, що видно з ідентифікатора; він не доводить, який snapshot отримує людина в поточній підписці.
| Місце | Модель: точний ідентифікатор у джерелі | Провайдер / маршрут | Задача й метрика | Бал | Дата | Джерело і межа |
|---|---|---|---|---|---|---|
| 1 | claude-opus-5 | Anthropic за назвою | Парна генерація · ELO | 1785,1 | Серпень 2026 | UkrQualBench · немає показаного immutable API snapshot. |
| 2 | gemini-3.5-flash | Google за назвою | Парна генерація · ELO | 1712,2 | Серпень 2026 | UkrQualBench · не тарифний рейтинг. |
| 3 | gemini-3.1-flash-lite-preview | Google за назвою | Парна генерація · ELO | 1696,2 | Серпень 2026 | UkrQualBench · preview в ідентифікаторі. |
| 4 | gemini-3.7-flash | Google за назвою | Парна генерація · ELO | 1683,6 | Серпень 2026 | UkrQualBench · модельний, не сервісний результат. |
| 5 | gemini-3-flash-preview | Google за назвою | Парна генерація · ELO | 1680,5 | Серпень 2026 | UkrQualBench · preview в ідентифікаторі. |
| 6 | gemini-3-pro-preview | Google за назвою | Парна генерація · ELO | 1593,0 | Серпень 2026 | UkrQualBench · preview в ідентифікаторі. |
| 7 | openrouter:google/gemma-4-31b-it | OpenRouter → Google | Парна генерація · ELO | 1582,9 | Серпень 2026 | UkrQualBench · маршрут не рівний локальному checkpoint. |
| 8 | gpt-5.2 | OpenAI за назвою | Парна генерація · ELO | 1572,5 | Серпень 2026 | UkrQualBench · немає дати snapshot у рядку. |
| 9 | claude-opus-4-5 | Anthropic за назвою | Парна генерація · ELO | 1565,7 | Серпень 2026 | UkrQualBench · не вимірює роботу з файлом. |
| 10 | claude-fable-5 | Anthropic за назвою | Парна генерація · ELO | 1553,7 | Серпень 2026 | UkrQualBench · рядок джерела, не порада купити. |
| 11 | claude-sonnet-4-5 | Anthropic за назвою | Парна генерація · ELO | 1553,3 | Серпень 2026 | UkrQualBench · не рейтинг ціни. |
| 12 | openrouter:deepseek/deepseek-v4-flash | OpenRouter → DeepSeek | Парна генерація · ELO | 1543,9 | Серпень 2026 | UkrQualBench · маршрут з джерела. |
| 13 | gpt-5.5 | OpenAI за назвою | Парна генерація · ELO | 1518,7 | Серпень 2026 | UkrQualBench · не показує поточний тариф. |
| 14 | gpt-5.6-sol | OpenAI за назвою | Парна генерація · ELO | 1505,1 | Серпень 2026 | UkrQualBench · не універсальний бал. |
| 15 | mamaylm-gemma-3-12b-it-v1.0 | MamayLM | Парна генерація · ELO | 1503,1 | Серпень 2026 | UkrQualBench · у джерелі вказано квантування Q4_K_S. |
| 16 | google/gemma-4-26b-a4b | Google / локальний маршрут | Парна генерація · ELO | 1491,2 | Серпень 2026 | UkrQualBench · модельний ідентифікатор. |
| 17 | claude-opus-4-7 | Anthropic за назвою | Парна генерація · ELO | 1470,9 | Серпень 2026 | UkrQualBench · не вимірює ваш тон. |
| 18 | google/gemma-3-27b-it-fast | Google / маршрут | Парна генерація · ELO | 1421,8 | Серпень 2026 | UkrQualBench · модельний ідентифікатор. |
| 19 | openrouter:meta/muse-glimmer-30b | OpenRouter → Meta | Парна генерація · ELO | 1412,5 | Серпень 2026 | UkrQualBench · маршрут з джерела. |
| 20 | lapa-v0.1.2-instruct | Lapa LLM | Парна генерація · ELO | 1392,7 | Серпень 2026 | UkrQualBench · у джерелі вказано Q4_K_S. |
| 21 | gpt-5-nano | OpenAI за назвою | Парна генерація · ELO | 1343,8 | Серпень 2026 | UkrQualBench · не рейтинг вартості. |
| 22 | openai/gpt-oss-20b | OpenAI | Парна генерація · ELO | 1304,6 | Серпень 2026 | UkrQualBench · інший розмір, ніж UNLP gpt-oss-120b. |
| 23 | claude-sonnet-5 | Anthropic за назвою | Парна генерація · ELO | 1261,2 | Серпень 2026 | UkrQualBench · не загальний бал. |
| 24 | Qwen/Qwen3-32B-fast | Qwen | Парна генерація · ELO | 1236,3 | Серпень 2026 | UkrQualBench · ідентифікатор збережено дослівно. |
| 25 | claude-haiku-4-5 | Anthropic за назвою | Парна генерація · ELO | 1115,5 | Серпень 2026 | UkrQualBench · не пояснює різницю тарифів. |
У тому самому джерелі є інші метрики: multiple-choice, виправлення помилок, токени на слово, русизми й позитивні маркери. Вони не зведені тут у новий «супербал»: ELO відповідає лише на питання парного вибору генерації.
2. Норма мови: UNLP 2026
Це інший тест: 347 експертно укладених завдань із граматики, лексики та правопису. Рядки нижче відсортовано за Extractive Match (XM), 5-shot, український промпт — однаковою колонкою Таблиці 2. IT — instruction-tuned, PT — pretrained, RSN — reasoning, як у статті.
| Місце | Тестована модель / варіант | Провайдер або проєкт | Задача й метрика | Бал | Дата | Джерело і межа |
|---|---|---|---|---|---|---|
| 1 | gpt-oss-120b | OpenAI | UNLP: норма української · XM fs5 uk | 55,2% | Травень 2026 | UNLP, Таблиця 2 · не сервісна оцінка. |
| 2 | mistral-medium-2508 | Mistral AI | UNLP: норма української · XM fs5 uk | 49,1% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 3 | Lapa 12B IT | Lapa LLM | UNLP: норма української · XM fs5 uk | 41,1% | Травень 2026 | UNLP, Таблиця 2 · українсько-адаптована модель. |
| 4 | mistral-small-2506 | Mistral AI | UNLP: норма української · XM fs5 uk | 41,0% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 5 | Lapa 12B PT | Lapa LLM | UNLP: норма української · XM fs5 uk | 38,6% | Травень 2026 | UNLP, Таблиця 2 · PT, не готовий чат-сервіс. |
| 6 | MamayLM 12B IT | MamayLM / INSAIT | UNLP: норма української · XM fs5 uk | 38,1% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 7 | Gemma 3 12B IT | UNLP: норма української · XM fs5 uk | 37,0% | Травень 2026 | UNLP, Таблиця 2 · не оцінка вашого документа. | |
| 8 | MamayLM 4B IT | MamayLM / INSAIT | UNLP: норма української · XM fs5 uk | 34,4% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 9 | Qwen3-8B (RSN) | Qwen | UNLP: норма української · XM fs5 uk | 34,3% | Травень 2026 | UNLP, Таблиця 2 · reasoning має окрему межу формату. |
| 10 | Gemma 3 4B IT | UNLP: норма української · XM fs5 uk | 32,9% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. | |
| 11 | Llama 3.1 8B IT | Meta | UNLP: норма української · XM fs5 uk | 29,6% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 12 | Phi-4-Mini IT | Microsoft | UNLP: норма української · XM fs5 uk | 27,2% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
| 13 | Gemma 3 1B IT | UNLP: норма української · XM fs5 uk | 22,1% | Травень 2026 | UNLP, Таблиця 2 · fixed test setting. |
Важлива межа: XM зараховує відповідь після rule-based вилучення. У цій же статті gpt-oss-120b має максимум 59,6% у нульовому English-prompt Exact Match, але це інша колонка, тому її не змішано з рейтингом вище.
3. Вичитка без переписування: GEC-дослідження UNLP 2026
Це не ELO генерації й не рейтинг підписок. Karpo та Chernodub перевірили API-доступні моделі на UNLP-2023 GEC-only: виправлення граматики й правопису. Нижче — найкращий результат для кожної названої моделі серед перевірених у статті конфігурацій, відсортований за F0.5. Ранг описує пару «модель + промпт», тому не ізолює модель від інструкції.
| Місце | Модель / точна конфігурація | Промпт у дослідженні | Метрика | Дата | Джерело і межа |
|---|---|---|---|---|---|
| 1 | Gemini 3.1-Pro | UA minimal-edits + few-shot + optimized-v2 | F0.5 69,22 · P 70,77 · R 63,63 | Травень 2026 | UNLP, Таблиця 3 · оптимізований промпт, не тариф. |
| 2 | Gemini 3-Flash | UA minimal-edits + few-shot + optimized-v2 | F0.5 68,43 · P 69,98 · R 62,87 | Травень 2026 | UNLP, Таблиця 3 · той самий тип тесту. |
| 3 | Claude Opus 4.6 | UA minimal-edits + few-shot | F0.5 63,73 · P 68,54 · R 49,75 | Травень 2026 | UNLP, Таблиці 2–3 · optimized-v1 тут погіршив результат. |
| 4 | Gemini 3.1-Pro | UA minimal-edits + few-shot | F0.5 63,68 · P 63,76 · R 63,35 | Травень 2026 | UNLP, Таблиця 2 · без optimized-v2. |
| 5 | GPT-5.4 | UA minimal-edits + few-shot + optimized-v1 | F0.5 61,07 · P 63,94 · R 51,75 | Травень 2026 | UNLP, Таблиця 3 · конкретний варіант інструкції. |
| 6 | Claude Sonnet 4.6 | UA minimal-edits + zero-shot | F0.5 59,06 · P 62,44 · R 48,55 | Травень 2026 | UNLP, Таблиці 2–3 · few-shot не дав кращого результату. |
Що зробити у своєму пробному завданні: попросіть виправити лише граматику, правопис і пунктуацію; не змінювати імена, терміни, цитати, числа, форматування, стиль і коректні варіанти; повернути текст без пояснення. Це адаптована перевірка для вашого документа, не дослівний промпт статті й не обіцянка її бала.
Де ризик лишається: найкраща конфігурація добре зменшила зайві правки в пунктуації, відмінку й роді, але в статті пропускає деякі рідкісні категорії та все одно має хибні «покращення» діалогу, синонімів і мовних варіантів. Зіставляйте версію до й після, а не надсилайте виправлений текст автоматично.
Чому вісім відповідей не є порадою для чату
Goto, Sakai і Watanabe (BEA 2026) перевірили метод на GEC-наборах, серед яких є український UNLP-2023: він генерує вісім варіантів, виділяє окремі правки й залишає ті, що повторюються за порогом, підібраним на development-даних. На українському наборі автори повідомляють поліпшення порівняно з greedy і MBR декодуванням.
Це пояснює, чому гладше формулювання не слід приймати за правильнішу правку. Але метод потребує кількох згенерованих варіантів, вилучення правок і калібрування; він не порівнює підписки, не називає найкращий чат і не є рецептом «запусти вісім разів».
Для клієнтського тексту зробіть менше, але прозоріше: попросіть лише граматику, правопис і пунктуацію, порівняйте версію до й після, відхиліть стилістичне переписування або зміну без названої помилки. Це перевірка читача, не наш запуск.
4. Переклад ідіом англійська→українська: SimIdioms
Тут є справді зіставна таблиця, але вона відповідає лише на вузьке питання: як шість названих у статті моделей перекладають речення зі сталими виразами з англійської українською. Рядки відсортовано за спаданням середнього бала 1–3 із Таблиці 4, усередненого за базовою та контекстною умовою статті. Бал 3 означає збережений образний зміст і природний сталий відповідник; 2 — зміст збережено, але вислів буквальний; 1 — зміст втрачено або суттєво спотворено.
| Місце | Модель, як названа у статті | Середній бал EN→UK | Зміна, коли джерельну ідіому названо в промпті | Метод, дата й джерело | Межа |
|---|---|---|---|---|---|
| 1 | Gemini 2.5 Flash | 2,42 / 3 | +0,161 | UNLP 2026, травень · SimIdioms, табл. 4–5 | Ідіоми, умови статті й LLM-суддя; не поточна підписка. |
| 2= | Claude Haiku 4.5 | 2,09 / 3 | +0,094 | UNLP 2026, травень · SimIdioms, табл. 4–5 | Не загальна якість перекладу чи клієнтського документа. |
| 2= | Gemma 3 12B | 2,09 / 3 | +0,133 | UNLP 2026, травень · SimIdioms, табл. 4–5 | У статті це модельний рядок, не готовий сервіс. |
| 4 | LapaLM | 1,98 / 3 | +0,000 | UNLP 2026, травень · SimIdioms, табл. 4–5 | Не робить висновку про інші перекладацькі задачі. |
| 5 | Qwen3-30B-A3B | 1,80 / 3 | +0,024 | UNLP 2026, травень · SimIdioms, табл. 4–5 | Промпт і модельний доступ статті не дорівнюють вашому плану. |
| 6 | Tiny Aya Global | 1,68 / 3 | −0,009 | UNLP 2026, травень · SimIdioms, табл. 4–5 | Не вимірює ціну, приватність або людське приймання готового тексту. |
Що можна обрати: якщо ваш доступ справді дає Gemini 2.5 Flash і в англійському джерелі є важлива ідіома, це найкращий із шести рядків саме цього тесту. Назвіть вислів у запиті й попросіть природний український відповідник, а не буквальний переклад. У статті це додало Gemini 0,161 бала, але не допомогло однаково всім моделям.
Що не можна обрати: «найкращий перекладач» для будь-якого тексту. SimIdioms охоплює 33 565 EN→UK перекладів із ідіомами; суддею був Gemini 2.5 Flash. На перевірці 100 EN→UK прикладів його оцінка збіглася з одним людським оцінювачем у 78% випадків. Це корисна перевірка методу, але не замінює редактора для вашої публікації.
5. Художній переклад: не вибирайте за метрикою без читання українського тексту
У дослідженні UNLP на семи людських перекладах «Animal Farm» і результатах GPT-5.2, DeepL та Lapa всі три ШІ-системи очолили сім нейронних метрик. Але без англійського оригіналу літературний LLM-суддя поставив усі три нижче за людей; 1 034 парні людські оцінки не повторили порядок метрик. Джерело й метод
Це один літературний корпус, не вирок кожному робочому перекладу. Він дає практичне правило: для художнього, брендового або авторського тексту перевіряйте не лише зміст, а й голос, лексику, частки та небажану одноманітність у готовій українській версії.
6. Фаховий EN→UK переклад: перевірені приклади можуть важити більше за загальний бал
Shpigunov, UNLP 2026 перевірив Gemma 3 4B, 12B і 27B та Gemini 3 Flash на 258 англо-українських парах із приватного юридично-військовому корпусу. Для пошуку схожих прикладів автор використав індекс із 2 581 двомовної пари, а в запит додавав 0, 3, 5, 10 або 25 знайдених прикладів. У статті додавання таких прикладів статистично значуще підвищило ChrF++ і COMET для всіх тестованих моделей.
| Конкретний результат | Що він означає | Джерело й межа |
|---|---|---|
| Gemma 3 4B: +0,076 COMET за k=3 | Навіть невелика кількість підібраних доменних прикладів допомогла в умовах статті. | UNLP 2026 · не порівнює підписки, завантаження файлів або ваш словник. |
| Gemma 3 4B: k=25 проти k=10 | Після надлишкового контексту показник став нижчим на 9,72 ChrF++ і 0,007 COMET. | Той самий приватний корпус · це не правило «десять прикладів» для кожної моделі чи задачі. |
Що можна зробити: для повторюваного тексту підготуйте погоджений глосарій або кілька вичитаних пар «джерело — переклад», якщо політика даних це дозволяє. Попросіть зберегти ці терміни й перевірте готовий український текст проти цієї опори. Чого не можна обрати: «найкращий чат для фахового перекладу». Тут немає ChatGPT, Claude, відкритої бази, вашого домену або тесту конфіденційності.
7. Оцінка EN→UK перекладу: корисний сигнал для перевірки, не дозвіл публікувати
Chaplynskyi, Zakharov і Ivashkevych (UNLP 2026) попросили вісім професійних перекладачів оцінити 1 000 пар «англійський оригінал — український переклад» із OPUS. Три моделі й три спеціалізовані QE-моделі отримали ті самі пари. Нижче — не якість перекладу, а кореляція Спірмена r з усередненою цілісною оцінкою перекладачів у методі статті.
| Інструмент у статті | Роль | N | r з оцінкою перекладачів | Що це не доводить |
|---|---|---|---|---|
Gemini 3 Flash | LLM-суддя, rubric prompt 0–100 | 999 | 0,821 | Не підтверджує якість генерації, поточний вебсервіс або ваш документ. |
GPT-5.4 | LLM-суддя, rubric prompt 0–100 | 1 000 | 0,814 | Не є дозволом прийняти переклад без звірки з оригіналом. |
Gemma 3 27B | LLM-суддя, rubric prompt 0–100 | 1 000 | 0,722 | Та сама вузька задача й умови промпта. |
Gemma 3 27B (QE) | спеціалізована QE-модель | 710 | 0,747 | Інша baseline-конфігурація, не місце серед перекладачів. |
COMETKiwi-XXL | спеціалізована QE-модель | 710 | 0,740 | Не показує, чи термін, сума й тон правильні у вашому тексті. |
xCOMET | спеціалізована QE-модель | 710 | 0,735 | Не порівнює підписки, ціни, приватність або людське приймання готового документа. |
Практичний висновок: такий бал може допомогти розставити чергу на перевірку, але не замінює рішення. У статті експерти теж ставали поблажливішими впродовж сесії, а автори окремо залишили відкритим питання, чи зможуть LLM-судді повністю замінити людину. Для важливого тексту звірте з оригіналом зміст, імена, числа, погоджені терміни й те, як український текст читається адресатові.
8. Повторювані EN→UK терміни: названий маршрут у DeepL, але не виміряний переможець
Документація DeepL називає українську серед мов глосарія та вказує, що глосарій працює для тексту й файлів. У безкоштовному режимі записи зберігаються лише у браузері; у вказаних платних облікових планах — в обліковому записі. Це дає конкретний шлях для погодженого списку термінів, коли ваша політика даних це дозволяє.
Передайте лише дозволений список, зробіть невеликий безпечний пробний переклад і звірте всі зафіксовані терміни у готовому українському тексті. Ми не знайшли тут незалежного EN→UK тесту послідовності термінів, порівняння тарифів або доказу для вашого файлу, тож DeepL не отримує місця в рейтингу.
9. Переклад і QA: один перевірений рядок Ukrainian LLM Leaderboard
Відкритий Ukrainian LLM Leaderboard охоплює переклад, резюме, QA, міркування, математику й інструкції. У цій редакції ми перевірили один конкретний агрегований файл, а не вигадували місця між різними файлами.
| Модель / checkpoint | Провайдер | Тест | Метрика й бал | Дата результату | Пряме джерело |
|---|---|---|---|---|---|
google/gemma-4-26B-A4B-it | FLORES en→uk | BLEU 32,02; chrF 60,77 | Агрегація 4 травня 2026; базовий файл 24 квітня | Агрегований JSON | |
google/gemma-4-26B-A4B-it | LongFLORES en→uk | BLEU 30,35; chrF 61,87 | Агрегація 4 травня 2026; базовий файл 24 квітня | Агрегований JSON | |
google/gemma-4-26B-A4B-it | SQuAD uk | best F1 72,04 | Агрегація 4 травня 2026; базовий файл 24 квітня | Агрегований JSON |
Ці рядки не порівнюйте з ELO UkrQualBench або відсотком UNLP: завдання та метрики інші. Для вибору перекладу шукайте ті самі модельні файли й одну й ту саму метрику для всіх кандидатів.
Що лишається вам
- Звірити факти, імена, суми й посилання.
- Вичитати відмінки, терміни, кальки та тон для конкретного адресата.
- Не називати тестований у травні або серпні ідентифікатор назвою теперішньої підписки без окремого підтвердження.