Экспертные заключения: 0
Консультации: 0

Система распознавания нецензурной лексики в аудио-контенте с использованием искусственного интеллекта

Руководитель проектного обучения: Стародубцев Денис Евгеньевич

Заказчик проекта: Телекоммуникационные компании

Система распознавания нецензурной лексики в аудио-контенте с использованием искусственного интеллекта, автоматически выполняющая поиск и распознавание, и имеющая следующие функции:

  • Алгоритмы анализа построения фраз, с целью выявления в них нецензурной лексики, завязанные на обработку речи нейронной сети;
  • Анализ аудиофайлов;
  • Анализ видеофайлов с проверкой их аудио составляющей;
  • Анализ речи, поступающей в реальном времени
  • Режим автономной работы (самостоятельный свободный мониторинг добавляемого на сайт контента);
  • Составление отчётов по результатам проверки;

Режим, включающий изменение аудио-контента, с целью цензуры нецензурной лексики при её нахождении.

В наше время, аудио-контент присутствует во всех сферах жизни. Также он является неотъемлемой частью и другого вида контента – видео-контента. Телевидение, видео в интернете, радио, музыка - это всё составляет огромный пласт потребительского контента.

Любой контент требует модерации. Особенно это актуально сейчас, когда правительство берёт курс на сохранение традиционных ценностей и морали. В связи с этим требуется ещё более тщательная модерация контента в целом, и контента, который доступен детям, в частности. Недопустимой является ситуация, когда ребёнок, смотря телевизор, видео, или слушая музыку, слышит в них нецензурную лексику. И, в условиях актуальности в глазах правительства целей по сохранению морали, это довольно важный вопрос.

Однако, учитывая насколько огромен пласт аудио-контента, его модерация исключительно с помощью человеческих ресурсов крайне неэффективна.

Поэтому, следует обратить внимание на современные технологии, для создание более работоспособных методов модерации. В особенности на активно развивающуюся сферу искусственного интеллекта.

Использование нейронных сетей в поиске нецензурной лексики в аудио-контенте должно на порядки повысить эффективность его модерации.

Нецензурная лексика может представлять собой достаточно большое множество филологический оборотов, которые невозможно описать шаблонно путем применения какого-либо математического аппарата. В связи с этим, целесообразным является решение о разработке и реализации программного продукта, предназначенного для детектирования оборотов нецензурной речи с применением ИИ.

Для решения сформулированной задачи необходимо:

Использование алгоритмов ИИ, повышающих качество выдаваемой информации при поиске и анализе информации.

К примеру, для разбора текста необходимо использовать NLP алгоритмы, такие как Natasha, Word2Vec для фиксации вектор слов и сверточная нейронная сеть для итогов распознания адекватность датасета.

Ссылка

На страницу проекта

Направление

IT

Рынки

TechNet

Сквозные технологии

Искусственный интеллект