Экспертные заключения: 0
Консультации: 0

Средства интеллектуального анализа больших массивов текстов

Научной проблемой, решению которой посвящён проект, является отсутствие эффективных методов и технологий кросс-языкового патентного поиска и анализа, которые могли бы использоваться в системах и сервисах патентной аналитики, в условиях постоянно увеличивающихся объёмов данных.
Для решения указанной проблемы будет разработан новый метод и технология кросс-языкового эксплоративного поиска патентов, в основе которого многофакторная оценка сходства текстов, предложенная ранее и развиваемая коллективом исполнителей, а также применены методы дистрибутивной семантики, использующие преобразования элементов текста в векторные представления композициональных элементов текстов (compositional word embeddings) - концептов. Этот подход позволяет устанавливать соответствия между
фразеологическими единицами представляющие одни и тех же понятия в разных языках. Предполагается, что такой подход окажется более перспективным и результативным, нежели известные подходы, основанные на использовании тезаурусов или словарей, с помощью которых выполняется прямой перевод с одного языка на другой.
Применимость разработанных методов и технологий в реальных приложениях (на больших объёмах данных) будет обоснована применением технологий инвертированных индексов, что обеспечит высокое быстродействие и поддержку больших объёмов данных.
В совокупности предлагаемые решения будут обладать качеством (полнотой, точностью и производными характеристиками), превосходящим мировые аналоги в данной области.
Для контроля качества результатов поиска (полнота/точность) будет применяться автоматическая оценка тематической однородности.

Ссылка

На страницу проекта

Направление

Другое