Экспертные заключения: 0
Консультации: 0

Классификатор Текстов «CENSOR»

Наша область которой мы занимаемся - это неструктурированные данные.

*Неструктурированные данные – это данные, которые трудно анализировать, особенно при помощи традиционных программ.

Предметная область. 

Анализ усложняется по следующим причинам:
✓ Данные представлены в форме текста с датами, цифрами, фактами, расположенными в произвольной форме.
✓ Данные не соответствуют заранее определённой модели данных.

Приложение может быть использовано модераторами интернет-ресурсов:
✓ Форумов
✓ Фандомов
✓ Онлайн-магазинов
Область применения: проверка соответствия сюжета заданной теме, обнаружения провокаций, оскорблений, нарушений речевых и стилистических норм.

Проблема.

В сегменте сетевой литературы существует серьёзная проблема. Если за качеством печатных книг следят редакторы издательств, то за качеством сетевой литературы следить некому – на большинстве литературных ресурсов отсутствуют редакторы и модераторы, поскольку владельцам ресурсов невыгодно держать отдельный редакторский штат.

В свою очередь большая часть читающей молодёжи предпочитает печатным книгам электронные ресурсы. Низкое качество литературы формирует у них неправильное представление о русской литературной традиции, русском языке в целом и литературной речи в частности.

Решение. 

Для решения задач были применены нейронное сети. Все поставленные задачи сводятся к задаче классификации – определение принадлежности входных данных какой-либо категории из числа заданных.

Работа с приложением возможна в двух режимах Первый – анализ текста при помощи ранее созданного анализатора. Для этого необходимо открыть анализатор выбрав место его хранения, ввести интересующий текст и запустить его анализ, после чего ознакомится с результатами.

Второй – создание анализатора, который состоит из настройки элементов анализатора, ввода обучающих данных, обучения и сохранения результатов обучения.

При реализации приложения использовались две основные архитектуры моделей нейронных сетей. Первая LSTM-сеть - искусственная нейронная сеть, содержащая LSTM-модули в дополнение к другим сетевым модулям. LSTM-модуль - это рекуррентный модуль сети, способный запоминать значения как на короткие, так и на длинные промежутки времени.

Вторая используемая архитектура – Transformer, она направлена на решение задач от последовательности к последовательности, и обработку долгосрочных зависимостей. Модели данной архитектуры не требуют обработки последовательностей по порядку. Благодаря чему могут быть распараллелены, в отличие от рекуррентных сетей, и, соответственно, могут быть быстрее обучены.

Так как при реализации использовались объектно-ориентированная и функциональная парадигмы программирования, для демонстрации определённых функций представлена модель структуры приложения.  Классы и функции имеют разные стили наименования.

При реализации моделей архитектуры LSTM использовался слой содержащий LSTM-модули, переставляемый библиотекой Тенсорфлов.
Для реализации архитектуры Трансформер, было реализовано два слоя, которые используют плотно связанный слой, многоголовый слой внимания и слой кодирования.

Мы хотим сказать, что на данный момент у нас есть разработанная библиотека выполняющая свои функции. Созданное приложение является по большей части лишь прототипом для демонстрации работы библиотеки. В дальнейшем, нет никаких препятствий тому, чтобы интегрировать данную разработку на веб-сайт или мобильное приложение.

Более подробно с проектом можно ознакомиться в данном документе - https://disk.yandex.ru/d/u_aPF...

Ссылка

На страницу проекта

Направление

IT, Культура и искусство, Медиа и соцсети

Сквозные технологии

Технологии хранения и анализа больших данных