РИЗИК-ЧУТЛИВЕ Q-НАВЧАННЯ В ДВОАГЕНТНІЙ МАРКОВСЬКІЙ МОДЕЛІ ПРОТИБОРСТВА «АТАКА–ЗАХИСТ»
DOI:
https://doi.org/10.31891/csit-2026-3-4Ключові слова:
навчання з підкріпленням, машинне навчання, марківська модель, ризик-чутливе Q-навчання, час до компрометації, тестування безпеки, кібербезпека, кібератака, кіберзахист, штучний інтелектАнотація
Запропоновано ризик-чутливий метод формування політики тестування безпеки вебзастосунків на основі ентропійно-ризикового Q-навчання в двоагентній марковській моделі протиборства «атака–захист». Дослідження зумовлене необхідністю виявляти короткі критичні траєкторії компрометації в умовах часткової спостережуваності, шумового оцінювання оборонних атрибутів і стохастичної зміни захисного профілю середовища. На відміну від ризик-нейтральних підходів, запропонований метод використовує щільну винагороду, орієнтовану на час до компрометації TTC, та післяепізодне оцінювання хвостових втрат за умовним хвостовим ризиком на рівні довіри 0.95 (CVaR0.95), де параметр ризик-чутливості β ентропійно-ризикового оператора визначає ступінь ризико-аверсивності політики. Введено два режими модельно-симуляційного середовища – контрольований Env1 і стохастичний Env2, які використовуються для аналізу стійкості політики за різного рівня інформаційної невизначеності. Для статистичної параметризації середовищ використано набори даних ToN-IoT і CIC-IDS2017. Агрегація семантично пов’язаних кроків атаки MAL-графа до рівня вебкомпонентів зменшує розмірність вектора станів у 8–12 разів, що забезпечує обчислювальну керованість навчання ризик-чутливої політики. Отримані результати показують, що запропонований метод забезпечує найменший середній час до компрометації серед усіх порівнюваних підходів. У середовищі Env2 значення TTC зменшилося з 36.9±1.5 до 27.9±1.1 кроку для ToN-IoT і з 39.7±1.7 до 31.4±1.3 кроку для CIC-IDS2017, показник CVaR0.95 нормованих хвостових втрат знизився приблизно на 31 %, а кількість епізодів до збіжності політики скоротилася приблизно на 35.4%. Найефективніший режим досягається за β ≈ -0.6. Практичне значення полягає в можливості застосування методу для автоматизованого тестування на проникнення та оцінювання стійкості механізмів захисту вебзастосунків.
##submission.downloads##
Опубліковано
Як цитувати
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Andrii PRYTULA, Leonid KUPERSHTEIN

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.
