ГИБРИДНАЯ ДИСКУРСИВНО-ОРИЕНТИРОВАННАЯ АРХИТЕКТУРА ДЛЯ АНАЛИЗА МНОГОЯЗЫЧНОГО ПОЛИТИЧЕСКОГО ДИСКУРСА

Авторы: Сайранбекова А., Бекманова Г., Францони В.,Тулешов Е.А.
МРНТИ 20.53.15, 20.53.21, 25.23.35

Аннотация. Политическая коммуникация переместилась на социальные платформы, где мнения выражаются в виде коротких сообщений с переключением языковых кодов и высокой риторической насыщенностью. Традиционные системы анализа тональности, разработанные преимущественно для отзывов о товарах и услугах, плохо переносятся на политическую сферу, поскольку политическая полярность тесно связана с позицией автора (stance), иронией и дискурсивной структурой текста. В данной статье рассматриваются основные семейства методов анализа тональности — лексикон-ориентированные, классические методы машинного обучения, глубокие нейронные сети и подходы на основе трансформеров, а также предлагается PoliSent — гибридная дискурсивно-ориентированная архитектура для анализа политической тональности в интернете. PoliSent объединяет три взаимодополняющих источника информации: многоязычные контекстные эмбеддинги, формируемые энкодером XLM-RoBERTa, специализированный политический лексикон (PoliLex) с учетом модификаторов тональности и отрицаний, а также модуль графового внимания, работающий на основе синтаксических зависимостей Universal Dependencies. Для объединения этих признаков используется обучаемый механизм шлюзования (gating mechanism), а многозадачная функция потерь обеспечивает совместное прогнозирование тональности, политической позиции и риторической тактики. Для оценки эффективности модели был создан корпус PoliWeb-CA, содержащий 18 500 политических сообщений на казахском и русском языках, собранных из микроблогов, каналов обмена сообщениями и комментариев к новостям. Модель PoliSent достигла значения Macro-F1, равного 0,904, и коэффициента корреляции Мэттьюса (MCC), равного 0,857, превзойдя дообученную модель KazRoBERTa на 4,6 пункта по метрике Macro-F1 и значительно опередив все лексиконные, классические и глубокие базовые модели (p < 0,01, парный бутстреп-анализ). Исследование абляции показало, что каждый архитектурный компонент вносит существенный вклад в итоговую производительность, при этом модуль внимания на графе зависимостей и лексическое расширение совместно обеспечивают улучшение на 5,8 пункта по сравнению с контекстным базовым представлением.
Полученные результаты демонстрируют, что явное использование лингвистической структуры сохраняет свою ценность даже в эпоху крупных предварительно обученных языковых моделей, особенно для малоресурсных и морфологически богатых политических текстов.

Ключевые слова: анализ тональности, политический дискурс, анализ мнений, обработка естественного языка, трансформерные модели, графовые сети внимания, определение позиции, малоресурсные языки, казахский язык, многоязычная обработка естественного языка.