Разработка сервиса обработки естественного языка с целью поиска и классификации объектов в тексте
Актуальность задачи извлечения именованных сущностей (Named Entity Recognition, NER) была в нынешнем её виде осознана научным и бизнес-сообществом к середине 1990-х годов в контексте её актуальности для более общей задачи извлечения структурированной информации из неструктурированных текстов в процессе автоматической обработки естественного языка, что мыслилось как фундамент для алгоритмов интеллектуального поиска информации и создания общемировой базы знаний на основе сведений из сети Интернет (Semantic Web). Задача извлечения именованных сущностей из неструктурированных текстов поставлена впервые в 1995 году на конференции MUC-6 (Message Understanding Conference), где и был утверждён термин. Впервые именованная сущность была определена как понятие, близкое к “жёсткому обозначению” С. Крипке (Kripke, Saul (1971). "Identity and Necessity". In M.K. Munitz (ed.). Identity and Individuation. New York: New York University Press. pp. 135–64.). Задача включает непосредственно извлечение и классификацию по типу объекта. В академических исследованиях предпринимались попытки создания универсальных классификаторов именованных сущностей вместимостью до 200 классов с внутренней иерархией (Sekine's Extended Named Entity Hierarchy, режим доступа: https://nlp.cs.nyu.edu/ene/). Коммерческие решения имеют, как правило, собственные варианты классификации именованных сущностей (инфообъектов), адаптированные для круга задач, решаемых коммерческой организацией, и оперативно пополняемые. На MUC-7 были впервые определены метрики эффективности: точность (precision), полнота (recal)l, F-мера как гармоническое среднее двух предыдущих показателей (Elaine Marsh, Dennis Perzanowski, "MUC-7 Evaluation of IE Technology: Overview of Results", 29 April 1998, режим доступа: https://www-nlpir.nist.gov/related_projects/muc/proceedings/muc_7_proceedings/marsh_slides.pdf). С тех пор, как среди академических изысканий, так и среди коммерческих решений, в том числе, для русского языка, сложилось три основных подхода к извлечению именованных сущностей: l подход на правилах (Kapetanios, Epaminondas; Tatar, Doina; Sacarea, Christian (2013-11-14), режим доступа: https://books.google.ru/books id=YXv6AQAAQBAJ&pg=PA298&redir_esc=y#v=onepage&q&f=false); l подход на базе статистических моделей с основой в виде векторных представлений слов - эмбеддингов (word2vec), впервые представленный в работе Mikolov, Tomas; Sutskever, Ilya; Chen, Kai; Corrado, Greg & Dean, Jeffrey (2013), Distributed Representations of Words and Phrases and their Compositionality,(режим доступа: https://arxiv.org/abs/1310.4546). Предложенный подход породил оживленную дискуссию, в том числе, в русскоязычном сообществе специалистов по обработке естественного языка (см. материалы международной конференции по компьютерной лингвистике и интеллектуальным технологиям Диалог с 2013 по 2021 г.г., а также процедуры и итоги соревнований по извлечению именованных сущностей Dialogue Evaluation, режим доступа: http://www.dialog-21.ru/evaluation/2016/ner/); l гибридные алгоритмы с привлечением специализированных словарей, семантических и синтаксических анализаторов, анализаторов тематической принадлежности на основе условных случайных полей, Conditional Random Fields (см. там же). Характеризуя подходы в целом, можно отметить, что решения на правилах, использующие дополнительные словари и справочники, характеризуются, как правило, высокой точностью, но недостаточной полнотой, разработки на основе статистических моделей и машинного обучения существенно превосходят решения на правилах в полноте, однако в массе дают меньшую точность. В свете сказанного естественно стремление исследователей и разработчиков оптимизировать полноту и точность за счёт использования гибридных алгоритмов. Коммерческие решения, в том числе рассматриваемые далее в обзоре аналогов, имеют гибридные алгоритмы, сочетающие в себе поиск по шаблонам с последующей идентификацией по справочникам для ограниченного набора классов и выделение именованных сущностей с использованием статистических моделей и методов машинного обучения. В машинном обучении сейчас наиболее распространено использование разновидностей предобученных языковых моделей из семейства BERT и надстройки в виде легкой CRF-модели. Регулярно разрабатываются новые предобученные модели на разных корпусах, позволяющие улучшить качество работы алгоритма на текстах разной специфики на несколько процентных пунктов. State-of-the-Art-решением на сегодняшний момент является коммерческое решение DeepPavlov BERT NER, но данная модель имеет свои ограничения по качеству при работе с новостными текстами и ограничивается 18 классами, а также требует больших вычислительных мощностей. В решении Seldon используется гибридный алгоритм, который сочетает в себе использование подхода на правилах с привлечением специализированных словарей автоматической обработки текста и модели, которая сочетает каскад свёрточных и рекуррентных слоёв с использованием условных случайных полей (CRF). Предварительно тексты подаваемые на обработку алгоритму проходят этап предобработки, включающий сегментацию, токенизацию и нормализацию. Для повышения полноты и точности работы алгоритма регулярно проходят итерации дообучения на новых размеченных данных. Достоинства выбранного подхода заключаются в том, что в рамках его: 1. Достигнута максимальная полнота без потери точности за счёт того, что нивелируются все традиционные проблемы NER, а именно: l неверное определение границ извлекаемой сущности (недобор или перебор токенов, неправильное разграничение нескольких наименований идущих подряд); l неверная классификация извлеченной сущности; l наличие значительного числа неоднозначно классифицируемых наименований, где для корректной отнесённости к классу требуются дополнительные средства разрешения неоднозначности. 2. Одновременно с непосредственным извлечением сущностей решается задача связывания именованных сущностей (Named Entity Linking, NEL), даже при наличии ошибок в написании,
Производитель: ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "СЕЛДОН НОВОСТИ"
Ссылка
Направление
IT
