Shaduf.Research preview
Рейтинг AI для української мови/96% для судових рішень — не прогноз вашої справи

6 жовтня 2026 · Рейтинг ШІ для української мови

96% для судових рішень — не прогноз вашої справи

Коротко: Nemotron Super 3 має 96,0% точності для класифікації результату вже ухваленого рішення в одному тесті. Для прогнозу результату за описом фактів інше завдання значно важче: найвищий zero-shot macro-F1 у UA-Legal-Bench — 40,6% у Llama 3.3 70B. Це не підстава покладатися на ШІ у юридичному рішенні.

Що виміряно

Автор узяв українські рішення ЄДРСР за 2024 рік і перевірив одинадцять моделей через AWS Bedrock. Для наведених семи моделей завданням було передбачити один із шести результатів за фрагментом фактів без резолютивної частини. Нижче — таблиця 3 статті; показник macro-F1 дає вагу кожному класу, а не лише найчастішому.

UA-Legal-Bench, травень 2026: прогноз результату справи за фактами, 800 рішень ЄДРСР; macro-F1, вищий кращий. Впорядковано за zero-shot, без прикладів у запиті.
Модель у AWS BedrockБез прикладівЗ 3 прикладамиПряме джерело
Llama 3.3 70B40,6%36,6%Таблиця 3
Amazon Nova Pro39,4%43,8%Таблиця 3
Mistral Large 335,4%39,2%Таблиця 3
Qwen3 235B34,7%34,3%Таблиця 3
Llama 4 Maverick32,5%38,9%Таблиця 3
Qwen3 32B31,4%27,3%Таблиця 3
NVIDIA Nemotron Super 322,7%26,9%Таблиця 3

Amazon Nova Pro має найвищий результат із трьома прикладами — 43,8%, але це інша умова запиту. Nemotron Super 3 має 62,3% звичайної точності на цьому завданні, проте лише 22,7% macro-F1 без прикладів: за даними авторської перевірки модель часто обирає найпоширеніший результат і зовсім не впізнає один із рідших класів. У 50 випадках автоматично витягнуті мітки результату збіглися з оцінкою LLM-судді лише у 70%; це не незалежна людська перевірка.

Чому інша стаття називає 96%

У другому препринті того самого автора, таблиця 4 Nemotron Super 3 має 96,0% точності для класифікації результату в 273 уже наявних рішеннях. Там модель бачить текст рішення, а 84,2% перевіреної вибірки належать до одного класу. У UA-Legal-Bench результат приховано, вибірка інша, а для зіставлення класів застосовано macro-F1. Ці числа не можна ставити в один рейтинг і називати суперечністю.

Що робити з пошуком практики

Якщо задача — знайти правову позицію, перевіряйте конкретне рішення й чинність норми, а не «прогнозуйте» справу за модельним балом. Верховний Суд описує пошук за правовими позиціями, оглядами та дайджестами з переходом до джерела. НААУ нагадує про ризик вигаданих рішень, помилкових цитат і передання конфіденційних матеріалів зовнішньому сервісу. Для дозволеного пілота юридичного ШІ спершу визначте, які дані можна завантажувати, потім відкрийте кожне джерело, звірте цитату, редакцію норми і роботу, що лишилася юристу. Ми не тестували сервіси й не надаємо правового висновку.

Search published pools, pages, reports, and evidence.