ХИБНІ КОРЕЛЯЦІЇ В ПОЯСНЮВАНОМУ ШІ: ВИЯВЛЕННЯ, КІЛЬКІСНА ОЦІНКА ТА УСУНЕННЯ

Автор(и)

  • Олександр ВЕРБИЦЬКИЙ Національний університет кораблебудування імені адмірала Макарова https://orcid.org/0009-0000-6848-8880

DOI:

https://doi.org/10.31891/csit-2026-3-17

Ключові слова:

пояснюваний ШІ, хибні кореляції, групова стійкість, контрфактичні пояснення, обрізання атрибуцій

Анотація

Сучасні методи пояснюваного ШІ (ХАІ) широко використовуються для аудиту глибоких нейронних мереж, проте дедалі більше досліджень показують, що самі пояснення можуть бути «захопленими» хибними кореляціями - статистичними скороченнями між непричинними ознаками (фон зображення, демографічні атрибути, текстові артефакти) та цільовою міткою. Як наслідок, post-hoc атрибуції залишаються впевнено помилковими на меншинних підгрупах, а точність найгіршої групи різко падає за зсуву розподілу. У роботі запропоновано уніфікований фреймворк, що розглядає вірність пояснення та групову стійкість як єдину задачу.

Мета. Основною метою дослідження є розробка строгої кількісної методології для виявлення внутрішніх каналів моделі, які кодують хибні, а не причинні ознаки, вимірювання стійкості пояснення до зсуву хибного атрибута та усунення цієї вади без анотацій підгруп у тренувальній вибірці.

Методика. Методологія зосереджена на фреймворку оптимізації групової функції втрат із обмеженнями, що шукає мінімальну підмножину каналів , видалення якої усуває залежність від хибного атрибута, зберігаючи впевненість цільового класу вище порога . Процедура Spurious-Aware Attribution Pruning (SAAP) поєднує атрибуції integrated-gradients, групово-зумовлене ранжування та контрфактичне маскування. Введено дві нові метрики: Spurious Robustness Score (SRS) та Counterfactual Validity (CV). Валідація виконана на Waterbirds та CelebA-blond із бекбонами ResNet-50 і ViT-B/16.

Результати. SAAP локалізує хибне представлення лише в 11-14 каналах на концепт (0,5-0,7% каналів останнього блоку ResNet-50;  для блоку 11 ViT-B/16). На Waterbirds точність найгіршої групи зростає на 28,1 в.п. для ResNet-50 () та на 24,9 в.п. для ViT-B/16 (). На CelebA-blond приріст становить 38,5 в.п. для ResNet-50 () та 35,5 в.п. для ViT-B/16 () ціною лише 3-4 в.п. середньої точності. CV підвищується з 0,45-0,55 до 0,79-0,83, що свідчить: пояснення, яке залишилося, відстежує причинний сигнал, а не хибне скорочення.

Наукова новизна. По-перше, роботу формалізовано як задачу мінімізації групової функції втрат із обмеженнями, що допускає ефективний жадібний пошук. По-друге, введено SRS і CV - дві взаємодоповнювальні, незалежні від типу атрибуції метрики, що кількісно оцінюють стійкість пояснення після контрфактичного втручання на хибний атрибут. По-третє, продемонстровано наскрізний конвеєр (виявлення  пом'якшення  аудит), який не потребує групових міток під час тренування та узагальнюється на CNN- і трансформерні бекбони.

Практична значимість. Метод робить «чорні скриньки» моделей зору аудитовними на рівні окремого концепту, що критично для медичного ШІ, автономного водіння та модерації контенту, де помилки за рахунок скорочень несорозмірно впливають на меншинні підгрупи. SRS і CV можна вбудувати в MLOps-ворота якості для виявлення регресій вірності пояснення до розгортання моделі.

##submission.downloads##

Опубліковано

2026-09-30

Як цитувати

ВЕРБИЦЬКИЙ, О. (2026). ХИБНІ КОРЕЛЯЦІЇ В ПОЯСНЮВАНОМУ ШІ: ВИЯВЛЕННЯ, КІЛЬКІСНА ОЦІНКА ТА УСУНЕННЯ. Computer Systems and Information Technologies, (3), 167–174. https://doi.org/10.31891/csit-2026-3-17