СЕМАНТИЧНІ ВЕКТОРНІ ПОДАННЯ ЯК КАНАЛ ГЕНЕРАЦІЇ КАНДИДАТІВ ДЛЯ САНКЦІЙНОГО СКРИНІНГУ ІМЕН

Автор(и)

DOI:

https://doi.org/10.31891/csit-2026-3-2

Ключові слова:

санкційний скринінг, ототожнення сутностей, зіставлення імен, генерація кандидатів, семантичний пошук, векторний пошук, векторні подання тексту, повнота пошуку, фінансовий моніторинг

Анотація

Санкційний скринінг імен є задачею ідентифікації у відкритій множині з асиметричною ціною помилок: пропуск особи, унесеної до переліку, має значно тяжчі наслідки, ніж додаткове сповіщення, яке буде перевірено вручну. У роботі оцінено дві сучасні комерційні моделі векторного подання тексту — OpenAI text-embedding-3-large та Google gemini-embedding-001 — як канал генерації кандидатів за фіксованим зрізом переліку фізичних осіб OFAC SDN (7 426 записів; індексовано лише основні поля імені та прізвища, псевдоніми не індексовано). Побудовано контрольований стрес-тест, у якому ті самі 150 підсанкційних осіб подано в чотирьох режимах транслітерації слов'янських імен — пряме латинське написання, романізація за стандартом ICAO, транслітерація за французькою традицією та перетворення російської форми на українську з подальшою офіційною українською романізацією — на двох рівнях повноти імені, проти простих і навмисно складних несанкційних схожих імен, за трьох розмірностей векторів (768–3072). Модель Gemini переважала в кожному нетривіальному режимі, і її перевага зростала зі збільшенням транслітераційної відстані, сягаючи 34,6 відсоткового пункту за показником повноти Recall@1 на двокомпонентних російсько-українських формах (95 % довірчий інтервал 27,1–42,1; точний критерій Мак-Немара p ≈ 1×10⁻¹⁶); систематичних втрат аж до 768 вимірів не виявлено, тоді як якість моделі OpenAI знижувалася і зі зростанням транслітераційної відстані, і зі зменшенням розмірності вектора. Максимальна косинусна подібність не відокремлює транслітеровані істинні відповідники від складних схожих імен: для OpenAI в найважчому режимі істинні відповідники отримували нижчі оцінки, ніж хибні (площа під ROC-кривою 0,318; довірчий інтервал 0,251–0,385). За однакового бюджету кандидатів об'єднання переліків двох моделей не дало виграшу порівняно зі збільшенням глибини пошуку однією сильнішою моделлю (99,36 %), а одну з підсанкційних осіб знайдено лише на 60-й позиції попри відмінність прізвища в один символ. Отже, семантична подібність є корисним каналом генерації кандидатів, але не є надійним правилом прийняття рішення про збіг; одержані висновки стосуються цього зрізу переліку, цих запитів і цих версій програмних інтерфейсів і не є гарантією відсутності пропусків.

##submission.downloads##

Опубліковано

2026-09-30

Як цитувати

ПАВЛЕНКО, Є., & ГНАТУШЕНКО, В. (2026). СЕМАНТИЧНІ ВЕКТОРНІ ПОДАННЯ ЯК КАНАЛ ГЕНЕРАЦІЇ КАНДИДАТІВ ДЛЯ САНКЦІЙНОГО СКРИНІНГУ ІМЕН. Computer Systems and Information Technologies, (3), 17–28. https://doi.org/10.31891/csit-2026-3-2