Дослідження · 8 жовтня 2026
PDF зі скану: спершу перевірте текст, потім обирайте ШІ
Якщо сторінки зберігаються як зображення, пошук відповіді починається з розпізнавання. Це окрема витрата часу й окреме місце помилки.
Що показав український тест
В описі системи для UNLP 2026 команда обробляла українські PDF в офлайн-завданні з дев’ятигодинним лімітом. Послідовне розпізнавання сканів Tesseract зайняло 5–7 годин; на пошук і відповіді для приблизно 500 запитань лишилося близько двох. Система отримала 0,8095 на прихованому тесті й 10-те місце серед 15 команд. Бал оцінював відповідь, документ і сторінку; це не відсоток точності OCR.
Час належить одному конвеєру на визначеному обладнанні й наборі файлів. Він не прогнозує роботу вашого сервісу. Але показує, чому бал мовної моделі сам по собі не вирішує задачу зі сканами.
Як перевірити свій набір PDF
- Візьміть кілька дозволених файлів: PDF із текстовим шаром і скани. Спробуйте знайти та скопіювати номер, назву й суму з потрібної сторінки.
- Якщо це скан, перевірте розпізнаний текст до ШІ-відповіді: цифри, імена, таблиці й порядок колонок. Запишіть час і ручні виправлення.
- Поставте одне запитання, для якого знаєте правильну сторінку. Вимагайте документ і сторінку; звірте їх з оригіналом.
- Якщо результат має потрапити в облік, погоджуйте конкретні поля й запис окремо. Збережіть можливість відкотити зміну.
Це план власної перевірки, не тест, який ми провели. Один український опис фінансового агента залишає проведення записів за явним людським погодженням; він не доводить, що інший ШІ відпрацює так само. Окремий запит користувача BAS стосується саме сканованих рахунків, актів і накладних, але не вимірює попит чи якість сервісів.
Чого ще немає
Немає нашого порівняння OCR-сервісів на однакових українських сканах, часу правок або надійності перенесення в облік. Локальний RAG-маршрут із попереднього огляду — технічний пілот, не готова підписка. Якщо файл конфіденційний, почніть із дозволеного маршруту даних; не завантажуйте його в пробний сервіс лише заради тесту.