Shaduf.

Текст і документи · оновлено 21 вересня 2026

Український текст: показники й робочі умови відповідають на різні питання

Швидкий вибір: для першої чернетки дивіться ELO claude-opus-5 у UkrQualBench. Для виправлення вже написаного тексту не переносіть цей ELO: окремий GEC-тест ставить найвище конкретну конфігурацію Gemini 3.1-Pro з українським minimal-edits промптом. Для англійських речень зі сталими виразами тепер є ще одна вузька таблиця: SimIdioms ставить Gemini 2.5 Flash першим за своїм середнім EN→UK балом. Додано й окреме зіставлення інструментів оцінки перекладу та документований український глосарійний маршрут. Жодна цифра не є рейтингом тарифів, чат-інтерфейсів або документних процесів.

1. Генерація українського тексту: UkrQualBench

Таблицю відсортовано за спаданням ELO. У репозиторії вона позначена «серпень 2026»; ELO утворено у швейцарському турнірі парних порівнянь генерації. «Провайдер/маршрут» — лише те, що видно з ідентифікатора; він не доводить, який snapshot отримує людина в поточній підписці.

МісцеМодель: точний ідентифікатор у джереліПровайдер / маршрутЗадача й метрикаБалДатаДжерело і межа
1claude-opus-5Anthropic за назвоюПарна генерація · ELO1785,1Серпень 2026UkrQualBench · немає показаного immutable API snapshot.
2gemini-3.5-flashGoogle за назвоюПарна генерація · ELO1712,2Серпень 2026UkrQualBench · не тарифний рейтинг.
3gemini-3.1-flash-lite-previewGoogle за назвоюПарна генерація · ELO1696,2Серпень 2026UkrQualBench · preview в ідентифікаторі.
4gemini-3.7-flashGoogle за назвоюПарна генерація · ELO1683,6Серпень 2026UkrQualBench · модельний, не сервісний результат.
5gemini-3-flash-previewGoogle за назвоюПарна генерація · ELO1680,5Серпень 2026UkrQualBench · preview в ідентифікаторі.
6gemini-3-pro-previewGoogle за назвоюПарна генерація · ELO1593,0Серпень 2026UkrQualBench · preview в ідентифікаторі.
7openrouter:google/gemma-4-31b-itOpenRouter → GoogleПарна генерація · ELO1582,9Серпень 2026UkrQualBench · маршрут не рівний локальному checkpoint.
8gpt-5.2OpenAI за назвоюПарна генерація · ELO1572,5Серпень 2026UkrQualBench · немає дати snapshot у рядку.
9claude-opus-4-5Anthropic за назвоюПарна генерація · ELO1565,7Серпень 2026UkrQualBench · не вимірює роботу з файлом.
10claude-fable-5Anthropic за назвоюПарна генерація · ELO1553,7Серпень 2026UkrQualBench · рядок джерела, не порада купити.
11claude-sonnet-4-5Anthropic за назвоюПарна генерація · ELO1553,3Серпень 2026UkrQualBench · не рейтинг ціни.
12openrouter:deepseek/deepseek-v4-flashOpenRouter → DeepSeekПарна генерація · ELO1543,9Серпень 2026UkrQualBench · маршрут з джерела.
13gpt-5.5OpenAI за назвоюПарна генерація · ELO1518,7Серпень 2026UkrQualBench · не показує поточний тариф.
14gpt-5.6-solOpenAI за назвоюПарна генерація · ELO1505,1Серпень 2026UkrQualBench · не універсальний бал.
15mamaylm-gemma-3-12b-it-v1.0MamayLMПарна генерація · ELO1503,1Серпень 2026UkrQualBench · у джерелі вказано квантування Q4_K_S.
16google/gemma-4-26b-a4bGoogle / локальний маршрутПарна генерація · ELO1491,2Серпень 2026UkrQualBench · модельний ідентифікатор.
17claude-opus-4-7Anthropic за назвоюПарна генерація · ELO1470,9Серпень 2026UkrQualBench · не вимірює ваш тон.
18google/gemma-3-27b-it-fastGoogle / маршрутПарна генерація · ELO1421,8Серпень 2026UkrQualBench · модельний ідентифікатор.
19openrouter:meta/muse-glimmer-30bOpenRouter → MetaПарна генерація · ELO1412,5Серпень 2026UkrQualBench · маршрут з джерела.
20lapa-v0.1.2-instructLapa LLMПарна генерація · ELO1392,7Серпень 2026UkrQualBench · у джерелі вказано Q4_K_S.
21gpt-5-nanoOpenAI за назвоюПарна генерація · ELO1343,8Серпень 2026UkrQualBench · не рейтинг вартості.
22openai/gpt-oss-20bOpenAIПарна генерація · ELO1304,6Серпень 2026UkrQualBench · інший розмір, ніж UNLP gpt-oss-120b.
23claude-sonnet-5Anthropic за назвоюПарна генерація · ELO1261,2Серпень 2026UkrQualBench · не загальний бал.
24Qwen/Qwen3-32B-fastQwenПарна генерація · ELO1236,3Серпень 2026UkrQualBench · ідентифікатор збережено дослівно.
25claude-haiku-4-5Anthropic за назвоюПарна генерація · ELO1115,5Серпень 2026UkrQualBench · не пояснює різницю тарифів.

У тому самому джерелі є інші метрики: multiple-choice, виправлення помилок, токени на слово, русизми й позитивні маркери. Вони не зведені тут у новий «супербал»: ELO відповідає лише на питання парного вибору генерації.

2. Норма мови: UNLP 2026

Це інший тест: 347 експертно укладених завдань із граматики, лексики та правопису. Рядки нижче відсортовано за Extractive Match (XM), 5-shot, український промпт — однаковою колонкою Таблиці 2. IT — instruction-tuned, PT — pretrained, RSN — reasoning, як у статті.

МісцеТестована модель / варіантПровайдер або проєктЗадача й метрикаБалДатаДжерело і межа
1gpt-oss-120bOpenAIUNLP: норма української · XM fs5 uk55,2%Травень 2026UNLP, Таблиця 2 · не сервісна оцінка.
2mistral-medium-2508Mistral AIUNLP: норма української · XM fs5 uk49,1%Травень 2026UNLP, Таблиця 2 · fixed test setting.
3Lapa 12B ITLapa LLMUNLP: норма української · XM fs5 uk41,1%Травень 2026UNLP, Таблиця 2 · українсько-адаптована модель.
4mistral-small-2506Mistral AIUNLP: норма української · XM fs5 uk41,0%Травень 2026UNLP, Таблиця 2 · fixed test setting.
5Lapa 12B PTLapa LLMUNLP: норма української · XM fs5 uk38,6%Травень 2026UNLP, Таблиця 2 · PT, не готовий чат-сервіс.
6MamayLM 12B ITMamayLM / INSAITUNLP: норма української · XM fs5 uk38,1%Травень 2026UNLP, Таблиця 2 · fixed test setting.
7Gemma 3 12B ITGoogleUNLP: норма української · XM fs5 uk37,0%Травень 2026UNLP, Таблиця 2 · не оцінка вашого документа.
8MamayLM 4B ITMamayLM / INSAITUNLP: норма української · XM fs5 uk34,4%Травень 2026UNLP, Таблиця 2 · fixed test setting.
9Qwen3-8B (RSN)QwenUNLP: норма української · XM fs5 uk34,3%Травень 2026UNLP, Таблиця 2 · reasoning має окрему межу формату.
10Gemma 3 4B ITGoogleUNLP: норма української · XM fs5 uk32,9%Травень 2026UNLP, Таблиця 2 · fixed test setting.
11Llama 3.1 8B ITMetaUNLP: норма української · XM fs5 uk29,6%Травень 2026UNLP, Таблиця 2 · fixed test setting.
12Phi-4-Mini ITMicrosoftUNLP: норма української · XM fs5 uk27,2%Травень 2026UNLP, Таблиця 2 · fixed test setting.
13Gemma 3 1B ITGoogleUNLP: норма української · XM fs5 uk22,1%Травень 2026UNLP, Таблиця 2 · fixed test setting.

Важлива межа: XM зараховує відповідь після rule-based вилучення. У цій же статті gpt-oss-120b має максимум 59,6% у нульовому English-prompt Exact Match, але це інша колонка, тому її не змішано з рейтингом вище.

3. Вичитка без переписування: GEC-дослідження UNLP 2026

Це не ELO генерації й не рейтинг підписок. Karpo та Chernodub перевірили API-доступні моделі на UNLP-2023 GEC-only: виправлення граматики й правопису. Нижче — найкращий результат для кожної названої моделі серед перевірених у статті конфігурацій, відсортований за F0.5. Ранг описує пару «модель + промпт», тому не ізолює модель від інструкції.

МісцеМодель / точна конфігураціяПромпт у дослідженніМетрикаДатаДжерело і межа
1Gemini 3.1-ProUA minimal-edits + few-shot + optimized-v2F0.5 69,22 · P 70,77 · R 63,63Травень 2026UNLP, Таблиця 3 · оптимізований промпт, не тариф.
2Gemini 3-FlashUA minimal-edits + few-shot + optimized-v2F0.5 68,43 · P 69,98 · R 62,87Травень 2026UNLP, Таблиця 3 · той самий тип тесту.
3Claude Opus 4.6UA minimal-edits + few-shotF0.5 63,73 · P 68,54 · R 49,75Травень 2026UNLP, Таблиці 2–3 · optimized-v1 тут погіршив результат.
4Gemini 3.1-ProUA minimal-edits + few-shotF0.5 63,68 · P 63,76 · R 63,35Травень 2026UNLP, Таблиця 2 · без optimized-v2.
5GPT-5.4UA minimal-edits + few-shot + optimized-v1F0.5 61,07 · P 63,94 · R 51,75Травень 2026UNLP, Таблиця 3 · конкретний варіант інструкції.
6Claude Sonnet 4.6UA minimal-edits + zero-shotF0.5 59,06 · P 62,44 · R 48,55Травень 2026UNLP, Таблиці 2–3 · few-shot не дав кращого результату.

Що зробити у своєму пробному завданні: попросіть виправити лише граматику, правопис і пунктуацію; не змінювати імена, терміни, цитати, числа, форматування, стиль і коректні варіанти; повернути текст без пояснення. Це адаптована перевірка для вашого документа, не дослівний промпт статті й не обіцянка її бала.

Де ризик лишається: найкраща конфігурація добре зменшила зайві правки в пунктуації, відмінку й роді, але в статті пропускає деякі рідкісні категорії та все одно має хибні «покращення» діалогу, синонімів і мовних варіантів. Зіставляйте версію до й після, а не надсилайте виправлений текст автоматично.

Чому вісім відповідей не є порадою для чату

Goto, Sakai і Watanabe (BEA 2026) перевірили метод на GEC-наборах, серед яких є український UNLP-2023: він генерує вісім варіантів, виділяє окремі правки й залишає ті, що повторюються за порогом, підібраним на development-даних. На українському наборі автори повідомляють поліпшення порівняно з greedy і MBR декодуванням.

Це пояснює, чому гладше формулювання не слід приймати за правильнішу правку. Але метод потребує кількох згенерованих варіантів, вилучення правок і калібрування; він не порівнює підписки, не називає найкращий чат і не є рецептом «запусти вісім разів».

Для клієнтського тексту зробіть менше, але прозоріше: попросіть лише граматику, правопис і пунктуацію, порівняйте версію до й після, відхиліть стилістичне переписування або зміну без названої помилки. Це перевірка читача, не наш запуск.

4. Переклад ідіом англійська→українська: SimIdioms

Тут є справді зіставна таблиця, але вона відповідає лише на вузьке питання: як шість названих у статті моделей перекладають речення зі сталими виразами з англійської українською. Рядки відсортовано за спаданням середнього бала 1–3 із Таблиці 4, усередненого за базовою та контекстною умовою статті. Бал 3 означає збережений образний зміст і природний сталий відповідник; 2 — зміст збережено, але вислів буквальний; 1 — зміст втрачено або суттєво спотворено.

МісцеМодель, як названа у статтіСередній бал EN→UKЗміна, коли джерельну ідіому названо в промптіМетод, дата й джерелоМежа
1Gemini 2.5 Flash2,42 / 3+0,161UNLP 2026, травень · SimIdioms, табл. 4–5Ідіоми, умови статті й LLM-суддя; не поточна підписка.
2=Claude Haiku 4.52,09 / 3+0,094UNLP 2026, травень · SimIdioms, табл. 4–5Не загальна якість перекладу чи клієнтського документа.
2=Gemma 3 12B2,09 / 3+0,133UNLP 2026, травень · SimIdioms, табл. 4–5У статті це модельний рядок, не готовий сервіс.
4LapaLM1,98 / 3+0,000UNLP 2026, травень · SimIdioms, табл. 4–5Не робить висновку про інші перекладацькі задачі.
5Qwen3-30B-A3B1,80 / 3+0,024UNLP 2026, травень · SimIdioms, табл. 4–5Промпт і модельний доступ статті не дорівнюють вашому плану.
6Tiny Aya Global1,68 / 3−0,009UNLP 2026, травень · SimIdioms, табл. 4–5Не вимірює ціну, приватність або людське приймання готового тексту.

Що можна обрати: якщо ваш доступ справді дає Gemini 2.5 Flash і в англійському джерелі є важлива ідіома, це найкращий із шести рядків саме цього тесту. Назвіть вислів у запиті й попросіть природний український відповідник, а не буквальний переклад. У статті це додало Gemini 0,161 бала, але не допомогло однаково всім моделям.

Що не можна обрати: «найкращий перекладач» для будь-якого тексту. SimIdioms охоплює 33 565 EN→UK перекладів із ідіомами; суддею був Gemini 2.5 Flash. На перевірці 100 EN→UK прикладів його оцінка збіглася з одним людським оцінювачем у 78% випадків. Це корисна перевірка методу, але не замінює редактора для вашої публікації.

5. Художній переклад: не вибирайте за метрикою без читання українського тексту

У дослідженні UNLP на семи людських перекладах «Animal Farm» і результатах GPT-5.2, DeepL та Lapa всі три ШІ-системи очолили сім нейронних метрик. Але без англійського оригіналу літературний LLM-суддя поставив усі три нижче за людей; 1 034 парні людські оцінки не повторили порядок метрик. Джерело й метод

Це один літературний корпус, не вирок кожному робочому перекладу. Він дає практичне правило: для художнього, брендового або авторського тексту перевіряйте не лише зміст, а й голос, лексику, частки та небажану одноманітність у готовій українській версії.

6. Фаховий EN→UK переклад: перевірені приклади можуть важити більше за загальний бал

Shpigunov, UNLP 2026 перевірив Gemma 3 4B, 12B і 27B та Gemini 3 Flash на 258 англо-українських парах із приватного юридично-військовому корпусу. Для пошуку схожих прикладів автор використав індекс із 2 581 двомовної пари, а в запит додавав 0, 3, 5, 10 або 25 знайдених прикладів. У статті додавання таких прикладів статистично значуще підвищило ChrF++ і COMET для всіх тестованих моделей.

Конкретний результатЩо він означаєДжерело й межа
Gemma 3 4B: +0,076 COMET за k=3Навіть невелика кількість підібраних доменних прикладів допомогла в умовах статті.UNLP 2026 · не порівнює підписки, завантаження файлів або ваш словник.
Gemma 3 4B: k=25 проти k=10Після надлишкового контексту показник став нижчим на 9,72 ChrF++ і 0,007 COMET.Той самий приватний корпус · це не правило «десять прикладів» для кожної моделі чи задачі.

Що можна зробити: для повторюваного тексту підготуйте погоджений глосарій або кілька вичитаних пар «джерело — переклад», якщо політика даних це дозволяє. Попросіть зберегти ці терміни й перевірте готовий український текст проти цієї опори. Чого не можна обрати: «найкращий чат для фахового перекладу». Тут немає ChatGPT, Claude, відкритої бази, вашого домену або тесту конфіденційності.

7. Оцінка EN→UK перекладу: корисний сигнал для перевірки, не дозвіл публікувати

Chaplynskyi, Zakharov і Ivashkevych (UNLP 2026) попросили вісім професійних перекладачів оцінити 1 000 пар «англійський оригінал — український переклад» із OPUS. Три моделі й три спеціалізовані QE-моделі отримали ті самі пари. Нижче — не якість перекладу, а кореляція Спірмена r з усередненою цілісною оцінкою перекладачів у методі статті.

Інструмент у статтіРольNr з оцінкою перекладачівЩо це не доводить
Gemini 3 FlashLLM-суддя, rubric prompt 0–1009990,821Не підтверджує якість генерації, поточний вебсервіс або ваш документ.
GPT-5.4LLM-суддя, rubric prompt 0–1001 0000,814Не є дозволом прийняти переклад без звірки з оригіналом.
Gemma 3 27BLLM-суддя, rubric prompt 0–1001 0000,722Та сама вузька задача й умови промпта.
Gemma 3 27B (QE)спеціалізована QE-модель7100,747Інша baseline-конфігурація, не місце серед перекладачів.
COMETKiwi-XXLспеціалізована QE-модель7100,740Не показує, чи термін, сума й тон правильні у вашому тексті.
xCOMETспеціалізована QE-модель7100,735Не порівнює підписки, ціни, приватність або людське приймання готового документа.

Практичний висновок: такий бал може допомогти розставити чергу на перевірку, але не замінює рішення. У статті експерти теж ставали поблажливішими впродовж сесії, а автори окремо залишили відкритим питання, чи зможуть LLM-судді повністю замінити людину. Для важливого тексту звірте з оригіналом зміст, імена, числа, погоджені терміни й те, як український текст читається адресатові.

8. Повторювані EN→UK терміни: названий маршрут у DeepL, але не виміряний переможець

Документація DeepL називає українську серед мов глосарія та вказує, що глосарій працює для тексту й файлів. У безкоштовному режимі записи зберігаються лише у браузері; у вказаних платних облікових планах — в обліковому записі. Це дає конкретний шлях для погодженого списку термінів, коли ваша політика даних це дозволяє.

Передайте лише дозволений список, зробіть невеликий безпечний пробний переклад і звірте всі зафіксовані терміни у готовому українському тексті. Ми не знайшли тут незалежного EN→UK тесту послідовності термінів, порівняння тарифів або доказу для вашого файлу, тож DeepL не отримує місця в рейтингу.

9. Переклад і QA: один перевірений рядок Ukrainian LLM Leaderboard

Відкритий Ukrainian LLM Leaderboard охоплює переклад, резюме, QA, міркування, математику й інструкції. У цій редакції ми перевірили один конкретний агрегований файл, а не вигадували місця між різними файлами.

Модель / checkpointПровайдерТестМетрика й балДата результатуПряме джерело
google/gemma-4-26B-A4B-itGoogleFLORES en→ukBLEU 32,02; chrF 60,77Агрегація 4 травня 2026; базовий файл 24 квітняАгрегований JSON
google/gemma-4-26B-A4B-itGoogleLongFLORES en→ukBLEU 30,35; chrF 61,87Агрегація 4 травня 2026; базовий файл 24 квітняАгрегований JSON
google/gemma-4-26B-A4B-itGoogleSQuAD ukbest F1 72,04Агрегація 4 травня 2026; базовий файл 24 квітняАгрегований JSON

Ці рядки не порівнюйте з ELO UkrQualBench або відсотком UNLP: завдання та метрики інші. Для вибору перекладу шукайте ті самі модельні файли й одну й ту саму метрику для всіх кандидатів.

Що лишається вам

  • Звірити факти, імена, суми й посилання.
  • Вичитати відмінки, терміни, кальки та тон для конкретного адресата.
  • Не називати тестований у травні або серпні ідентифікатор назвою теперішньої підписки без окремого підтвердження.

Search published pools, pages, reports, and evidence.