ПОРІВНЯННЯ МЕТОДІВ МАШИННОГО НАВЧАННЯ ДЛЯ ВИЗНАЧЕННЯ ФЕЙКОВИХ НОВИН

Автор(и)

DOI:

https://doi.org/10.36994/2788-5518-2024-01-07-06

Ключові слова:

класифікація текстових новин, моделі машинного навчання, попередня обробка даних, ефективність моделей машинного навчання

Анотація

У статті досліджено ефективність різних моделей машинного навчання для класифікації фейкових текстових новин. Розглянуто такі моделі: наївний Баєс, модель k-найближчих сусідів (kNN), модель опорних векторів (SVM) та модель випадкового лісу. Особливу увагу приділено впливу попередньої обробки даних, зокрема оверсемплінгу та використанню різних векторизаторів, на продуктивність моделей. У контексті наївного Баєса досліджується ефект згладжування на результати класифікації, визначаючи оптимальні параметри для поліпшення точності моделі. Для моделі kNN аналізується вплив кількості сусідів (k) на точність моделі, що дає змогу визначити найбільш відповідний параметр для даного завдання. Для моделі опорних векторів (SVM) випробувано різні перетворення, такі як лінійне, радіально-базисне функціональне (РБФ) та сигмоїдальне, із метою оцінки їхнього впливу на класифікацію текстових новин. Для випадкового лісу проведено аналіз того, як кількість дерев впливає на загальну ефективність моделі, що дає змогу знайти баланс між точністю та швидкістю навчання. Також розглянуто вплив різних методів векторизації тексту, таких як TF-IDF та CountVectorizer, на продуктивність моделей. Зокрема, проведено аналіз, як оверсемплінг впливає на точність моделей, даючи змогу краще справлятися з дисбалансом класів у даних. Результати дослідження надають важливу інформацію про оптимальні налаштування та підходи до попередньої обробки даних для поліпшення точності класифікації новин на достовірність. Отримані висновки можуть бути корисними для дослідників та практиків у галузі обробки природної мови та машинного навчання, які займаються розробленням систем для виявлення фейкових новин. Робота також підкреслює важливість ретельного вибору моделей та їхніх параметрів залежно від специфіки даних та поставлених завдань.

Посилання

Ahmed H. Aliwy, Esraa H. Abdul Ameer. Comparative Study of Five Text Classification Algorithms with their Improvements. International Journal of Applied Engineering Research Vol. 12, 2017, Number 14, ISSN 0973-4562. pp. 4309-4319

Jason D.M. Rennie. Improving Multi-class Text Classification with Naive Bayes. Massachusetts institute of technology – artificial intelligence laboratory. 2001.

Songbo Tan. An effective refinement strategy for KNN text classifier. Institute of Computing Technology, Chinese Academy of Sciences. 2006.

Simon Tong, Daphne Koller. Support Vector Machine Active Learning with Applications to Text Classification. Computer Science Department Stanford University. 2001.

Набір даних фейкових та достовірних українських новин. URL: https://www.kaggle.com/datasets/zepopo/ukrainianfake-and-true-news

Набір стоп-слів української мови. URL: https://github.com/skupriienko/Ukrainian-Stopwords/blob/master/stopwords_ua.txt

##submission.downloads##

Опубліковано

2024-11-04

Як цитувати

Джоші, А., & Павленко, В. І. (2024). ПОРІВНЯННЯ МЕТОДІВ МАШИННОГО НАВЧАННЯ ДЛЯ ВИЗНАЧЕННЯ ФЕЙКОВИХ НОВИН. Інфокомунікаційні та комп’ютерні технології, 1(07), 46-55. https://doi.org/10.36994/2788-5518-2024-01-07-06

Статті цього автора (авторів), які найбільше читають