ГАЛЮЦИНАЦІЙНО-СТІЙКЕ ФОРМУВАННЯ UAV-ДАТАСЕТУ ДЛЯ ISR
DOI:
https://doi.org/10.31891/csit-2026-3-22Ключові слова:
автономні безпілотні літальні апарати (БПЛА), cхема анотування, grounded-summary режим, публічний аеробенчмарк, open-vocabulary детекція, локальне безпечне розгортанняАнотація
У статті досліджено галюцинаційно-стійке анотування БПЛА-подібних зображень у публікаційно-безпечній постановці та розглянуто його як задачу вимірювання, надійності й розгортання, а не як коротку демонстрацію на основі промптового інжинірингу. Запропонована схема поєднує нормалізацію онтології, маскування текстових накладок, режим обґрунтованих підсумків, безпечну обробку медіа з Unicode, контроль профілів підказок і структуровану фіксацію результатів, що дає змогу спільно аудіювати мітки, підрахунки та текстові описи. Для усунення розриву між зручними мультимодальними демонстраціями та науково придатним доказом робота поєднує архівний аудит 7 історичних кадрів військового типу з публічним проксі-бенчмарком обсягом 350 аерознімків і кадрів із наборів AerialMPT, DLR-MVDA та DLR-ACD. Виконаний публічний тест містить 274,581 еталонних об'єктів, що переводить емпіричну основу роботи від вузького пілотного дослідження до оцінювання на сотнях прикладів. Локальна базова лінія YOLO-World завершила обробку всіх 350 публічних зразків із середньою затримкою 0.1807 с на зображення, але суттєво недооцінювала щільні сцени: середня абсолютна помилка підрахунку становила 143.889 для AerialMPT, 297.300 для повнорозмірних сцен DLR-MVDA та 6848.242 для DLR-ACD. Для узгодженого хмарно-локального порівняння в роботі введено щільний фрагментний тест DLR-MVDA із 10 похідними кропами 1024x1024 та 315 розміченими транспортними засобами. Трипрофільне дослідження абляції Gemini Robotics-ER показало, що конструкція підказок матеріально змінює якість результату: загальний профіль завершив усі фрагменти, але сильно переоцінював кількість об'єктів, обмежений ISR-профіль зменшив похибку, але втратив один запит, а найкращий профіль, coarse-to-fine, досяг MAE 5.300, MAPE 10.161% та завершення 10 / 10. Додаткове відеодослідження на основі публічно доступних тактичних кадрів ізолює контроль тексту: вільна умова дала вихід за межі замкненої онтології у 21 з 21 непорожніх підсумків, тоді як узгоджена обґрунтована умова зменшила це значення до 0 з 20 та скоротила затримку з 491.070 с до 272.711 с. Архівний аудит додатково виявив непідтримувані формулювання про підрозділ, статус або намір у 4 із 7 історичних кадрів (57.1%) та чотири сирі варіанти міток (mil targets, military target, military targets, vehicle) для однієї концепції броньованої платформи. Отже, внеском статті є експериментально обґрунтований підхід до галюцинаційно-стійкого формування БПЛА-датасетів, у якому спільно оцінюються семантичний контроль, якість підрахунку, чутливість до профілю підказок та надійність виконання.
##submission.downloads##
Опубліковано
Як цитувати
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Yehor TERESHCHENKO, Mika HÄMÄLÄINEN

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.
