РАЗРАБОТКА МОДЕЛИ ИСКУССТВЕННОГО ИНТЕЛЛЕКТА ДЛЯ ВЫЯВЛЕНИЯ ТОКСИЧНОГО (ВРЕДОНОСНОГО) КОНТЕНТА В ТЕКСТАХ
Получена: 2026-05-30
Опубликована: 2026-06-06
Аннотация
В данной статье рассматривается проблема автоматического выявления токсичного и вредоносного контента в текстах. Распространение токсичного контента в социальных сетях и на онлайн-платформах оказывает негативное влияние не только на пользователей, но и на общество в целом. В исследовании предлагается гибридная архитектура искусственного интеллекта, объединяющая трансформеры на основе BERT с двунаправленными сетями LSTM. Предлагаемая модель была обучена на смешанном корпусе узбекских и русских текстов, собранных на узбекских платформах социальных сетей. Эксперименты показали, что модель достигла точности 94,7 %, полноты 93,2 % и F1-меры 94,0 %. Кроме того, в статье анализируются подготовка набора данных, метрики оценки модели и возможности её внедрения в режиме реального времени.
Ключевые слова
Список литературы
-
Nobata, C., Tetreault, J., Thomas, A., Mehdad, Y., & Chang, Y. (2016). Abusive Language Detection in Online User Content. Proceedings of WWW 2016, 145–153.
-
Davidson, T., Warmsley, D., Macy, M., & Weber, I. (2017). Automated Hate Speech Detection and the Problem of Offensive Language. Proceedings of ICWSM 2017, 512–515.
-
Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Proceedings of NAACL-HLT 2019, 4171–4186.
-
Zhang, Y., Wallace, B. (2018). A Sensitivity Analysis of (and Practitioners' Guide to) Convolutional Neural Networks for Sentence Classification. Proceedings of IJCNLP, 253–263.
-
Zampieri, M., Malmasi, S., Nakov, P., Rosenthal, S. (2019). Predicting the Type and Target of Offensive Posts in Social Media. Proceedings of NAACL-HLT 2019, 1415–1420.
-
Kovačević, A., Dragović, I., Kosmajac, D. (2021). Offensive Language Detection in Serbian Texts Using Fine-Tuned BERT. Applied Sciences, 11(12), 5611.
-
Mulki, H., Zaghouani, W. (2021). HabiRemoved: Hate Speech and Offensive Language Detection for Arabic. ACL Anthology Workshop Proceedings.
-
Mamatov, A., Yusupov, K., Tursunov, O. (2020). Developing Word Embeddings for Uzbek Language Processing. Uzbek Journal of Information Technologies, 4(2), 31–44.
-
Yusupov, B., Khoroshevsky, V. (2022). Social Media Text Analysis for Uzbek Language: Challenges and Opportunities. Proc. TürkLang 2022, 88–97.
-
Shokh, A., Yulchiev, D. (2023). Code-Switching in Uzbek Digital Communication: Linguistic Patterns and Computational Challenges. Central Asian Computational Linguistics Conference, 14–22.
Об авторах
Лицензия

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.