Экспертные заключения: 0
Консультации: 0

Развитие технологии обнаружения переводных заимствований, основанной на методах анализа больших текстовых данных

«Антиплагиат» является первой компанией, разработавшейрешение для обнаружения заимствований на русском языке. За 13 лет, прошедшие состарта проекта, компания сформировала в России рынок соответствующих систем иявляется его безусловным лидером. Услуги компании постоянно предоставляются 1000+ компаниям и 4+ миллионам частных пользователей. Ежегодно Антиплагиатпроверяет более 35 миллионов документов, пиковая суточная нагрузка превышает300 тысяч документов. В базе поиска находятся более 400 миллионов различныхдокументов.Лидерская позиция требует, как постоянного совершенствованиядействующего продукта, так и создания новых решений, отвечающих перспективнымтребованиям рынка анализа больших объемов текстовых данных. При этом компанияобладает хорошей рыночной экспертизой, которая позволяет предсказыватьпотребности пользователей, а также огромным массивом данных, который можетиспользоваться для проведения вычислительных экспериментов.Одним из вызовов, стоящих перед компанией является созданиеэффективных механизмов обнаружения переводных заимствований. Исследованияпоказывают, что переводные заимствования становятся все более популярнымспособом скрыть попытки некорректного использования чужого текста. Такой типзаимствований встречается в студенческих и диссертационных работах.Следует отметить, что в отличие от поиска заимствований врамках одного языка, поиск переводных заимствований – это чрезвычайнонаукоемкая задача, не имеющая в настоящий момент решения, которое удовлетворялобы требованиям промышленного применения.Настоящий проект направлен на разработку технологиидетектирования текстов, содержащих переводные заимствования для пар языкованглийский-русский, русский-языки стран СНГ (казахский, украинский,белорусский, киргизский), английский-языки стран СНГ. Решение указаннойпроблемы предлагается строить на рекуррентных сетях глубокого обучения (deeplearning) – искусственных нейронных сетях особого вида, позволяющих представитьфрагмент текста произвольной длины в векторном пространстве большойразмерности. Для оптимизации параметров сети применяются технологии обучениябез учителя и технологии частичного обучения.Проект соответствует направлению «Внедрение технологии«глубокого обучения» для решения задач поиска, распознавания и управления»дорожной карты «Нейронет» Национальной технологической инициативы. Реализацияпроекта будет способствовать преодолению технологических барьеров в нахожденииглубинной семантической структуры текста, описывающей структурную и ролевуюмодель текстового описания и способности сгенерировать аннотацию по связномутексту с различной степенью детализации.

Производитель: АКЦИОНЕРНОЕ ОБЩЕСТВО "АНТИПЛАГИАТ"

Ссылка

На страницу проекта

Направление

IT