Proceedings of the International scientific and practical conference ―Science at the Frontier of Progress‖ (June 8-10, 2026) / Publisher website: www.naukainfo.com. – Paris, France, 2026. - 178 p.

71 DOI: https://doi.org/10.64828/conf-131-2026-6 УДК 004.8 Пекуровський Гліб Валерійович кандидат технічних наук, доцент кафедри технічного захисту інформації Національний університет «Київський авіаційний інститут» м. Київ, Україна ПОРІВНЯЛЬНИЙ АНАЛІЗ СТІЙКОСТІ МОДЕЛЕЙ МАШИННОГО НАВЧАННЯ ДО ЗСУВУ КОНЦЕПЦІЇ НА НАБОРАХ ДАНИХ NSL-KDD ТА UNSW-NB15 Анотація. У роботі проводиться порівняльний аналіз моделей стійкості машинного навчання у задачі виявлення мережевих вторгнень в умовах зсуву концепції. Розглянуто три моделі: логістична регресія, випадковий ліс та нейронна мережа у вигляді багатошарового перцептрону. Дослідження проводяться на двох наборах даних: NSL-KDD та UNSW-NB15, що дозволяє оцінити узагальнюваність моделей. Запропоновано метрику індексу стабільності, яка оцінює зменшення якості моделей внаслідок зсуву концепції. Ключові слова: штучний інтелект, машинне навчання, логістична регресія, випадковий ліс, нейронна мережа, система виявлення вторгнень. Оцінювання стійкості моделей машинного навчання до зсуву концепції є актуальною проблемою у сфері побудови інтелектуальних систем виявлення вторгнень. Переважна більшість сучасних досліджень проводиться в статичних умовах, де навчальна та тестова вибірки мають однаковий розподіл [1, с. 2-3]. Поза увагою дослідників часто залишається питання міждоменної узагальнюваності, тобто здатності моделей зберігати якість класифікації на різних наборах даних в умовах змін розподілу. Метою даної роботи є порівняльний аналіз поведінки трьох моделей машинного навчання на двох наборах даних різної складності при трьох контрольованих сценаріях зсуву концепції. У дослідженні розглядаються логістична регресія, випадковий ліс та багатошаровий перцептрон як репрезентативні представники лінійних, ансамблевих та нейромережевих підходів відповідно. Набір даних NSL-KDD [2] використовується як контрольоване середовище з помірним рівнем шуму, тоді як UNSW-NB15 [3] є більш реалістичним і складним набором даних мережевого трафіку. Сценарії зсуву концепції охоплюють: дисбаланс класів, шум ознак та контрольне перемішування даних. Оцінювання здійснюється за метриками F1-міри та запропонованим індексом стабільності SI, що визначається відношенням F1-міри після зсуву концепції до F1-міри у базовому стані. Мінімальні отримані значення індексу стабільності за типом зсуву для обох наборів даних подано в табл. 1. Таблиця 1. Мінімальні значення індексу стабільності (SI) для досліджуваних моделей та наборів даних Модель NSL-KDD (SI мін.) UNSW-NB15 (SI мін.) Логістична регресія 0,923 (шум ознак) 0,811 (шум ознак) Випадковий ліс 0,762 (шум ознак) 0,788 (дисбаланс) Нейронна мережа 0,949 (шум ознак) 0,806 (дисбаланс) Результати показують, що на наборі даних NSL-KDD усі моделі демонструють високу базову якість (F1 = 0,94–0,99), а сценарій перемішування не призводить до жодної деградації (SI = 1,000), що підтверджує нейтральний характер цього типу зсуву щодо статистичних властивостей даних. Найбільш критичним сценарієм для NSL-KDD є шум ознак: SI випадкового лісу падає до 0,762, тоді як нейронна мережа зберігає SI = 0,949, що вказує на більш рівномірне узагальнення багатошарового перцептрону завдяки нелінійному просторові ознак. На наборі даних UNSW-NB15 спостерігається значно ширший діапазон деградації. Дисбаланс класів стає більш критичним сценарієм: SI випадкового лісу та нейронної мережі опускається до 0,788 та 0,806 відповідно, що суттєво нижче за значення на NSL-KDD. Шум ознак також викликає

RkJQdWJsaXNoZXIy MTAxMzIwNA==