Proceedings of the International scientific and practical conference ―Science at the Turning Point of History‖ (May 25-27, 2026) / Publisher website: www.naukainfo.com. – Lviv, Ukraine, 2026. - 362 p.
171 Стрімке розширення цифрових репозиторіїв та STEM-публікацій створює нові виклики для систем контролю академічної доброчесності. Традиційні текстові антиплагіатні інструменти виявляються неефективними при аналізі математичного контенту, оскільки недобросовісні автори часто використовують методи синтаксичного маскування (обфускації): змінюють назви внутрішніх змінних, переставляють операнди або замінюють оператори на еквівалентні тотожності [1, 2]. Сучасні Data Science підходи дозволяють уникнути поверхневих змін тексту через перетворення формул у дерева розмітки символів (SLT) або абстрактні синтаксичні дерева (AST) з подальшою генерацією щільних векторів за допомогою глибоких трансформерних моделей (наприклад, MathBERT, де розмірність d = 768) [4]. Проте при масштабуванні бази даних до мільйонів записів точне порівняння векторів методом лінійного сканування (індекс FLAT) вимагає колосальних обчислювальних ресурсів. Його часова складність O(N *d) унеможливлює роботу систем підтримки ухвалення рішень (СПУР) у реальному часі. Тому виникає гостра інженерна потреба у впровадженні методів наближеного пошуку найближчих сусідів (ANN). Метою дослідження є мінімізація часової затримки (Latency) при пошуку релевантних формул у великих масивах даних без суттєвої втрати точності (Recall) шляхом розробки та оптимізації підсистеми векторного індексування. Методи та матеріали Для реалізації сублинійного пошуку було спроектовано архітектуру на базі векторної СКБД Milvus , оптимізованої для роботи з Big Data. Пайплайн обробки контенту включає екстракцію математичних блоків із LaTeX/MathML, їх структурний парсинг, генерацію ембедингів і побудову ієрархічного графа за алгоритмом HNSW (Hierarchical Navigable Small World) [3]. Математична ідея HNSW базується на багатошаровій структурі графів, де верхні розріджені рівні забезпечують швидку грубу навігацію на великі відстані, а нижній нульовий шар містить усі вектори для точного пошуку. Порівняння векторів здійснюється за критерієм косинусної близькості:
Made with FlippingBook
RkJQdWJsaXNoZXIy MTAxMzIwNA==