Система распознавания нецензурной лексики в аудио-контенте с использованием искусственного интеллекта
Руководитель проектного обучения: Стародубцев Денис Евгеньевич
Заказчик проекта: Телекоммуникационные компании
Система распознавания нецензурной лексики в аудио-контенте с использованием искусственного интеллекта, автоматически выполняющая поиск и распознавание, и имеющая следующие функции:
- Алгоритмы анализа построения фраз, с целью выявления в них нецензурной лексики, завязанные на обработку речи нейронной сети;
- Анализ аудиофайлов;
- Анализ видеофайлов с проверкой их аудио составляющей;
- Анализ речи, поступающей в реальном времени
- Режим автономной работы (самостоятельный свободный мониторинг добавляемого на сайт контента);
- Составление отчётов по результатам проверки;
Режим, включающий изменение аудио-контента, с целью цензуры нецензурной лексики при её нахождении.
В наше время, аудио-контент присутствует во всех сферах жизни. Также он является неотъемлемой частью и другого вида контента – видео-контента. Телевидение, видео в интернете, радио, музыка - это всё составляет огромный пласт потребительского контента.
Любой контент требует модерации. Особенно это актуально сейчас, когда правительство берёт курс на сохранение традиционных ценностей и морали. В связи с этим требуется ещё более тщательная модерация контента в целом, и контента, который доступен детям, в частности. Недопустимой является ситуация, когда ребёнок, смотря телевизор, видео, или слушая музыку, слышит в них нецензурную лексику. И, в условиях актуальности в глазах правительства целей по сохранению морали, это довольно важный вопрос.
Однако, учитывая насколько огромен пласт аудио-контента, его модерация исключительно с помощью человеческих ресурсов крайне неэффективна.
Поэтому, следует обратить внимание на современные технологии, для создание более работоспособных методов модерации. В особенности на активно развивающуюся сферу искусственного интеллекта.
Использование нейронных сетей в поиске нецензурной лексики в аудио-контенте должно на порядки повысить эффективность его модерации.
Нецензурная лексика может представлять собой достаточно большое множество филологический оборотов, которые невозможно описать шаблонно путем применения какого-либо математического аппарата. В связи с этим, целесообразным является решение о разработке и реализации программного продукта, предназначенного для детектирования оборотов нецензурной речи с применением ИИ.
Для решения сформулированной задачи необходимо:
Использование алгоритмов ИИ, повышающих качество выдаваемой информации при поиске и анализе информации.
К примеру, для разбора текста необходимо использовать NLP алгоритмы, такие как Natasha, Word2Vec для фиксации вектор слов и сверточная нейронная сеть для итогов распознания адекватность датасета.
