ПІДТРИМУВАНИЙ ШТУЧНИМ ІНТЕЛЕКТОМ ПРОЦЕС НАПІВАВТОМАТИЧНОГО ФОРМУВАННЯ HTR-КОРПУСІВ З ІСТОРИЧНИХ ДОКУМЕНТІВ

Автор(и)

DOI:

https://doi.org/10.31891/csit-2026-3-1

Ключові слова:

розпізнавання рукописного тексту, аннотація даних, історичні документи, глибоке навчання, рукописний корпус, аннотація за допомогою ШІ, ефективність аннотування, згорткові рекурентні нейронні мережі

Анотація

У статті представлено вдосконалений програмний застосунок для напівавтоматичного анотування рукописних слів з історичних документів із використанням моделі глибокого навчання CRNN. Запропонований підхід передбачає безпосередню інтеграцію модуля штучного інтелекту в процес анотування, завдяки чому для кожного зображення автоматично генерується попередня транскрипція. Реалізовано концепцію Human-in-the-Loop, відповідно до якої прогноз моделі використовується як рекомендація, що може бути прийнята, виправлена або повністю замінена анотатором. Такий підхід забезпечує збереження експертного контролю над кінцевою анотацією та водночас зменшує обсяг повторюваного ручного введення даних.

Програмний застосунок забезпечує автоматичне впорядкування зображень відповідно до метаданих, структуроване збереження транскрипцій та інформації про документи, нормалізацію тексту, виявлення вже опрацьованих зразків, а також можливість продовження перерваних сеансів анотування. Модуль прогнозування на основі штучного інтелекту безпосередньо інтегрований у графічний інтерфейс, що дає змогу анотатору переглядати та редагувати згенеровану транскрипцію без необхідності переходу між окремими програмними засобами.

Модель CRNN було навчено на спеціально сформованому корпусі, що містить 2763 сегментовані зображення рукописних слів із різноманітними графічними та лінгвістичними характеристиками. Під час навчання застосовано методи аугментації зображень, оптимізатор AdamW, функцію втрат CTC, обмеження градієнта (Gradient Clipping), адаптивне зменшення швидкості навчання та механізм ранньої зупинки (Early Stopping). Основну увагу в дослідженні зосереджено на оцінюванні ефективності процесу анотування та визначенні впливу прогнозів, сформованих штучним інтелектом, на продуктивність користувача.

Експериментальні результати засвідчили, що середній час опрацювання одного слова зменшився з 8,4 с за ручної транскрипції до 4,7 с за наявності прогнозу, сформованого штучним інтелектом. Це відповідає збільшенню швидкості опрацювання у 1,79 раза та скороченню часу обробки на 44,0 %. Продуктивність анотатора зросла з 7,1 до 12,8 слова за хвилину. Отримані результати підтверджують практичну ефективність інтеграції HTR-прогнозування в експертний процес анотування та свідчать про потенціал запропонованого підходу для прискорення формування навчальних корпусів для систем розпізнавання історичних рукописних текстів зі збереженням експертної перевірки кінцевих анотацій.

Біографія автора

Христина ЛІП’ЯНІНА-ГОНЧАРЕНКО, Західноукраїнський національний університет

Доктор технічних наук, доцент, кафедра інформаційно-обчислювальних систем і управління

##submission.downloads##

Опубліковано

2026-09-30

Як цитувати

ІВАСЕЧКО, А., & ЛІП’ЯНІНА-ГОНЧАРЕНКО, Х. (2026). ПІДТРИМУВАНИЙ ШТУЧНИМ ІНТЕЛЕКТОМ ПРОЦЕС НАПІВАВТОМАТИЧНОГО ФОРМУВАННЯ HTR-КОРПУСІВ З ІСТОРИЧНИХ ДОКУМЕНТІВ. Computer Systems and Information Technologies, (3), 8–16. https://doi.org/10.31891/csit-2026-3-1