Классификатор Текстов «CENSOR»
Наша область которой мы занимаемся - это неструктурированные данные.
*Неструктурированные данные – это данные, которые трудно анализировать, особенно при помощи традиционных программ.
Предметная область.
Анализ усложняется по следующим причинам:
✓ Данные представлены в форме текста с датами, цифрами, фактами, расположенными в произвольной форме.
✓ Данные не соответствуют заранее определённой модели данных.
Приложение может быть использовано модераторами интернет-ресурсов:
✓ Форумов
✓ Фандомов
✓ Онлайн-магазинов
Область применения: проверка соответствия сюжета заданной теме, обнаружения провокаций, оскорблений, нарушений речевых и стилистических норм.
Проблема.
В сегменте сетевой литературы существует серьёзная проблема. Если за качеством печатных книг следят редакторы издательств, то за качеством сетевой литературы следить некому – на большинстве литературных ресурсов отсутствуют редакторы и модераторы, поскольку владельцам ресурсов невыгодно держать отдельный редакторский штат.
В свою очередь большая часть читающей молодёжи предпочитает печатным книгам электронные ресурсы. Низкое качество литературы формирует у них неправильное представление о русской литературной традиции, русском языке в целом и литературной речи в частности.
Решение.
Для решения задач были применены нейронное сети. Все поставленные задачи сводятся к задаче классификации – определение принадлежности входных данных какой-либо категории из числа заданных.
Работа с приложением возможна в двух режимах Первый – анализ текста при помощи ранее созданного анализатора. Для этого необходимо открыть анализатор выбрав место его хранения, ввести интересующий текст и запустить его анализ, после чего ознакомится с результатами.
Второй – создание анализатора, который состоит из настройки элементов анализатора, ввода обучающих данных, обучения и сохранения результатов обучения.
При реализации приложения использовались две основные архитектуры моделей нейронных сетей. Первая LSTM-сеть - искусственная нейронная сеть, содержащая LSTM-модули в дополнение к другим сетевым модулям. LSTM-модуль - это рекуррентный модуль сети, способный запоминать значения как на короткие, так и на длинные промежутки времени.
Вторая используемая архитектура – Transformer, она направлена на решение задач от последовательности к последовательности, и обработку долгосрочных зависимостей. Модели данной архитектуры не требуют обработки последовательностей по порядку. Благодаря чему могут быть распараллелены, в отличие от рекуррентных сетей, и, соответственно, могут быть быстрее обучены.
Так как при реализации использовались объектно-ориентированная и функциональная парадигмы программирования, для демонстрации определённых функций представлена модель структуры приложения. Классы и функции имеют разные стили наименования.
При реализации моделей архитектуры LSTM использовался слой содержащий LSTM-модули, переставляемый библиотекой Тенсорфлов.
Для реализации архитектуры Трансформер, было реализовано два слоя, которые используют плотно связанный слой, многоголовый слой внимания и слой кодирования.
Мы хотим сказать, что на данный момент у нас есть разработанная библиотека выполняющая свои функции. Созданное приложение является по большей части лишь прототипом для демонстрации работы библиотеки. В дальнейшем, нет никаких препятствий тому, чтобы интегрировать данную разработку на веб-сайт или мобильное приложение.
Более подробно с проектом можно ознакомиться в данном документе - https://disk.yandex.ru/d/u_aPF...
