Гибридный метод извлечения ключевых слов из русскоязычных научно-технических текстов на основе синтаксического анализа и многофакторного ранжирования
Ключевые слова:
Извлечение ключевых слов, Обработка естественного языка, Деревья зависимостей, Научно-технические текстыАннотация
Статья посвящена разработке гибридного метода автоматического извлечения ключевых слов из русскоязычных научно-технических текстов. Предложенный метод объединяет морфосинтаксический анализ, генерацию кандидатов на основе обхода дерева синтаксических зависимостей и многофакторное ранжирование с использованием комбинации статистических (TF-IDF, C-value), графовых (TextRank) и позиционных признаков. Экспериментальная оценка на корпусе из 16818 русскоязычных научных статей из КиберЛенинки показала, что предложенный метод превосходит базовые алгоритмы (TF-IDF, RAKE, YAKE, TextRank) по метрикам F1@10 (улучшение на 2.3% – 0,268 против 0,262 у ближайшего конкурента TextRank), MAP (улучшение на 6.9% – 0,217 против 0,203) и семантическому покрытию текста (улучшение на 32.5% – 0,559 против 0,422). Особенно значительное преимущество достигается при извлечении многословных терминологических словосочетаний благодаря учету синтаксических связей между компонентами.Загрузки
Опубликован
2026-07-07
Выпуск
Раздел
******************************