Просмотреть запись

Автоматизация построения словаря на материале массива несловарных словоформ

Электронный научный архив УРФУ

Информация об архиве | Просмотр оригинала


Поле	Значение

Заглавие	Автоматизация построения словаря на материале массива несловарных словоформ Automatic enlargement of a dictionary: from the set of unknown word forms to the lemmatized list

Автор	Ляшевская, О. Н. Сичинава, Д. В. Кобрицов, Б. П.

Тематика	ИНФОРМАЦИОННЫЙ ПОИСК В ИНТЕРНЕТЕ ПОИСК ИНФОРМАЦИИИ В ИНТЕРНЕТЕ СБОРНИКИ СТАТЕЙ

Описание	Несловарные формы — единицы текста, отсутствующие в словаре программы морфологического анализа — представляют проблему как для автоматического парсинга текста, так и для создания словарей, основанных на текстовых корпусах. Алгоритм их лемматизации объединяет несловарные словоформы в кластеры, которым сопоставляется информация о части речи, исходной форме и других грамматических характеристиках лексемы. Процедура кластеризации включает порождение множества гипотез для каждой словоформы в соответствии с моделью русского словоизменения А. А. Зализняка и выбор в качестве наиболее вероятной той, которая чаще всего повторяется в разборах других словоформ массива. Оценка эффективности алгоритма проводилась на материале словника Национального корпуса русского языка и набора данных «База словоформ Яндекса». Text tokens that are not represented in the dictionary of a morphological parser pose a problem both for the automatic analysis of texts and for the compiling of corpora-based dictionaries. We evaluate an algorithm according to which unknown word forms are grouped in clusters and associated with part of speech, base form and other grammatical information. The clusterization procedure consists in generation of multiple hypotheses for each word form in compliance with A. A. Zahzmak’s Russian derivational model and weighting up the frequency of hypotheses throughout the whole domain. The evaluation of the algorithm efficiency is set up on the concordance of the Russian National Corpus and the dataset 'Yandex bank of word forms'.

Дата	2008-11-18T06:41:27Z 2008-11-18T06:41:27Z 2007

Тип	Article Journal article (info:eu-repo/semantics/article) Published version (info:eu-repo/semantics/publishedVersion)

Идентификатор	Ляшевская, О. Н. Автоматизация построения словаря на материале массива несловарных словоформ / О. Н. Ляшевская, Д. В. Сичинава, Б. П. Кобрицов // Интернет-математика 2007 : сб. работ участников конкурса науч. проектов по информ. поиску / [отв. ред. П. И. Браславский]. — Екатеринбург : Изд-во Урал. ун-та, 2007. — С. 118–125. 978-5-7525-1788-5 http://elar.urfu.ru/handle/10995/1340

Язык	ru

Связанные ресурсы	Интернет-математика 2007. — Екатеринбург, 2007

Формат	228865 bytes application/pdf

Издатель	Изд-во Урал. ун-та

Just another harvester

Просмотреть запись

Автоматизация построения словаря на материале массива несловарных словоформ

Электронный научный архив УРФУ