Proceedings of the International scientific and practical conference ―Science at the Turning Point of History‖ (May 25-27, 2026) / Publisher website: www.naukainfo.com. – Lviv, Ukraine, 2026. - 362 p.

172 Cosine_similarity = u ∗ v ||u|| ∗ ||v|| (1) Для балансування системи було оптимізовано критичні параметри індексу: максимальну кількість зв'язків вершини зафіксовано на рівні M = 16, а глибину оцінки сусідів при побудові графа — efConstruction = 64. Результати дослідження та їх обговорення Експериментальне тестування проводилося на базі обсягом 1*10 6 математичних ембедингів під керуванням процесора Intel Xeon (8 ядер, 2.5 ГГц) та 32 ГБ RAM. Під час експериментів порівнювалися часові показники лінійного перебору (FLAT) та оптимізованого графового підходу (HNSW) за умов різної наповненості бази даних N (табл. 1). Таблиця 1. Порівняльні характеристики FLAT та HNSW індексів у Milvus Обсяг бази даних N Затримка індексу FLAT (мс) Затримка індексу HNSW (мс) Показник точності HNSW (Recall@10) 100 000 15.0 2.2 0.985 500 000 75.0 3.8 0.962 1 000 000 150.0 4.5 0.951 Отримані дані підтверджують, що час пошуку FLAT зростає суворо лінійно і при 1 млн. записів становить 150 мс. Натомість індекс HNSW демонструє логарифмічну складність O(d*N). При максимальному навантаженні графовий алгоритм обробляє запит всього за 4.5 мс , забезпечуючи прискорення пошуку у ~33.3 рази . Метрика Recall@10 на мільйонному датасеті утримується на рівні 0.951. Для первинного відбору джерел плагіату у СПУР втрата менше ніж 5% релевантних результатів є некритичною і повністю компенсується швидкістю роботи системи. Оцінка додаткових витрат RAM для збереження графів зв'язків розраховується як RAM додатково ≈ N * M * 8байт. Для нашого випадку це

RkJQdWJsaXNoZXIy MTAxMzIwNA==