Development of Ukrainian-language corpus of aggressive texts of network discourse

Альтернативна назва
Розроблення українськомовного корпусу мережевих текстів з агресивами
Вантажиться...
Ескіз
Дата
2025
Науковий керівник
Укладач
Редактор
Назва журналу
ISSN
2307-8332
E-ISSN
Назва тому
Видавець
Одеський національний університет імені І. І. Мечникова
Анотація
The study of network discourse as a space for the deployment of aggressive communicative behavior requires the use of automated data analysis methods. This requires large arrays of texts, but Ukrainian-language corpora of texts suitable for studying aggression in network discourse are not publicly available. The investigation highlights the process of developing a Ukrainian-language corpus of aggressive texts within the project on the study of verbal aggression in network discourse. The choice of text source for the corpus is substantiated, a self-developed application for collecting comments using web-scraping is proposed, the procedure of processing the received texts is outlined, including cleaning, setting language and polarity, additional cleaning, tokenization and lematization, removal of stop words. The source of the texts is the Internet portal Censor.Net. The application was developed in the Python programming language with the Beautiful Soup module, regular expressions were used to clean texts, the langdetect library was used to set the language, polarization was determined using the polyglot tool, the simplemma library was used for tokenization and lematization, and nltk was used to identify bigrams. For the additional stage of lemmatization, a dictionary with frequent tokens (frequency> = 5) and their lemmas was created. The obtained Ukrainian-language corpus of aggressive texts of network discourse includes 16,769 comments, 188,825 tokens, of which 39,975 are unique, 168,702 unique bigrams, in the corpus the author’s nickname, comment text, language and polarity are additionally indicated. Dictionaries of tokens and bigrams indicate their frequency. The size of the corpus is not fixed, the corpus will continue to be supplemented with comments. The corpus, dictionaries and applications for their creation are available in the public access.
Дослідження мережевого дискурсу як простору розгортання агресивної комунікативної поведінки потребує застосування автоматизованих методів аналізу даних. Це вимагає великих масивів текстів, проте українськомовні корпуси текстів, придатні для вивчення агресії в мережевому дискурсі, у відкритому доступі відсутні. У дослідженні висвітлено процес створення українськомовного корпусу текстів з маркерами агресії у межах проєкту з вивчення вербальної агресії в мережевому дискурсі. Обґрунтовано вибір джерела текстів для корпусу, запропоновано розроблений автором застосунок для збирання коментарів за допомогою вебскрейпінгу, окреслено процедуру опрацювання отриманих текстів, що включає очищення, визначення мови та полярності, додаткове очищення, токенізацію та лематизацію, вилучення стоп-слів. Джерелом текстів є інтернет-портал Censor.Net. Застосунок розроблено мовою програмування Python із використанням модуля Beautiful Soup, для очищення текстів застосовано регулярні вирази, для визначення мови — бібліотеку langdetect, полярність визначено за допомогою інструменту polyglot, для токенізації та лематизації використано бібліотеку simplemma, а для виокремлення біграм — nltk. Для додаткового етапу лематизації створено словник частотних токенів (частота ≥ 5) та їхніх лем. Отриманий українськомовний корпус текстів мережевого дискурсу, що містять маркери агресії, містить 16 769 коментарів, 188 825 токенів, із яких 39 975 є унікальними, а також 168 702 унікальні біграми; у корпусі додатково зазначено нікнейм автора, текст коментаря, мову та полярність. Словники токенів і біграм містять інформацію про їхню частотність. Обсяг корпусу не є фіксованим, його й надалі буде поповнювано новими коментарями. Корпус, словники та застосунки для їх створення доступні у відкритому доступі.
Опис
Ключові слова
verbal aggression, network discourse, text corpus, Ukrainian language, application for creating text corpus, computational linguistics, вербальна агресія, мережевий дискурс, корпус текстів, українська мова, застосунок для створення корпусу текстів, комп’ютерна лінгвістика
Бібліографічний опис
Malysheva M. Development of Ukrainian-language corpus of aggressive texts of network discourse. Вісник Одеського національного університету. Філологія. 2025. Т. 30, вип. 2(32). С. 7–14.
УДК
811.161.2’42:004.912