Автоматизация построения словаря на материале массива несловарных словоформ
Электронный научный архив УРФУ
Информация об архиве | Просмотр оригиналаПоле | Значение | |
Заглавие |
Автоматизация построения словаря на материале массива несловарных словоформ
Automatic enlargement of a dictionary: from the set of unknown word forms to the lemmatized list |
|
Автор |
Ляшевская, О. Н.
Сичинава, Д. В. Кобрицов, Б. П. |
|
Тематика |
ИНФОРМАЦИОННЫЙ ПОИСК В ИНТЕРНЕТЕ
ПОИСК ИНФОРМАЦИИИ В ИНТЕРНЕТЕ СБОРНИКИ СТАТЕЙ |
|
Описание |
Несловарные формы — единицы текста, отсутствующие в словаре программы морфологического анализа — представляют проблему как для автоматического парсинга текста, так и для создания словарей, основанных на текстовых корпусах. Алгоритм их лемматизации объединяет несловарные словоформы в кластеры, которым сопоставляется информация о части речи, исходной форме и других грамматических характеристиках лексемы. Процедура кластеризации включает порождение множества гипотез для каждой словоформы в соответствии с моделью русского словоизменения А. А. Зализняка и выбор в качестве наиболее вероятной той, которая чаще всего повторяется в разборах других словоформ массива. Оценка эффективности алгоритма проводилась на материале словника Национального корпуса русского языка и набора данных «База словоформ Яндекса».
Text tokens that are not represented in the dictionary of a morphological parser pose a problem both for the automatic analysis of texts and for the compiling of corpora-based dictionaries. We evaluate an algorithm according to which unknown word forms are grouped in clusters and associated with part of speech, base form and other grammatical information. The clusterization procedure consists in generation of multiple hypotheses for each word form in compliance with A. A. Zahzmak’s Russian derivational model and weighting up the frequency of hypotheses throughout the whole domain. The evaluation of the algorithm efficiency is set up on the concordance of the Russian National Corpus and the dataset 'Yandex bank of word forms'. |
|
Дата |
2008-11-18T06:41:27Z
2008-11-18T06:41:27Z 2007 |
|
Тип |
Article
Journal article (info:eu-repo/semantics/article) Published version (info:eu-repo/semantics/publishedVersion) |
|
Идентификатор |
Ляшевская, О. Н. Автоматизация построения словаря на материале массива несловарных словоформ / О. Н. Ляшевская, Д. В. Сичинава, Б. П. Кобрицов // Интернет-математика 2007 : сб. работ участников конкурса науч. проектов по информ. поиску / [отв. ред. П. И. Браславский]. — Екатеринбург : Изд-во Урал. ун-та, 2007. — С. 118–125.
978-5-7525-1788-5 http://elar.urfu.ru/handle/10995/1340 |
|
Язык |
ru
|
|
Связанные ресурсы |
Интернет-математика 2007. — Екатеринбург, 2007
|
|
Формат |
228865 bytes
application/pdf |
|
Издатель |
Изд-во Урал. ун-та
|
|