Интегрум - модуль определение тональности высказывания в неструктурированных текстовых данных
Социальные медиа (социальные сети) становятся ключевым каналам обмена данными между населением планеты: отзывы о сервисах и продукта, рекомендации, мнения, всем этим пользователи интернета делятся в социальных сетях. Поэтому, все компании и органы власти заинтересованы в сборе и обработки этой информации. При анализе же огромного количества данных, которые создаются в социальных сетях необходим инструмент, который будет отделять положительные высказывания от отрицательных и нейтральных для того, чтобы создавать разные типы событий по каждому. Например, гасить распространение негатива и поддерживать распространение положительных отзывов. В рамках реализации проекта будет переработан (разработан заново, с использованием новых способов решений) модуль определения тональности в неструктурированных текстовых данных (сообщениях социальных сетей и средств массовой информации). Новизна заключается в повышении качества оценки тональности текстовых сообщений на русском и английском языках. Модуль определяет три вида тональности текстовых сообщений (позитивную, негативную и нейтральную) относительно заданного объекта тональности как в пределах одного предложения, так и усредненную по всему документу. Средняя точность по трем видам тональности для русского языка должна достигать 90% в ограниченном наборе тем. На текущий момент для определения тональности используются следующие технологии: - TF-IDF (TF — term frequency, IDF — inverse document frequency) для представления всего текста в виде числовых векторов, - SVM (Support Vector Machine) – для анализа числовых векторов и выявления векторов, близких к размеченным, как «позитивные», «негативные» и «нейтральные». Этот метод требует долгого обучения не только для каждой темы, но и для каждого бренда. В данный момент точность определения тональности текущего решения после обучения редко превышает 80%. Для повышения точности весь текст будет разбиваться на набор числовых векторов, в которые будут переведены все слова (каждое слово – отдельный вектор). Это позволит оценивать не только один вектор всего текста, но и каждый вектор из которых состоит текст, а значит и все близкие к каждому вектору другие вектора (т.е. синонимы). Полученный набор векторов будет анализироваться сверточной нейросетью. Это позволит обучать нейросеть не только на наборе прямых совпадений ключевых слов, из которых состоит конкретный текст, но на наборе «пузырей» (bubble) смыслов, в котором каждый «пузырь» формируется набором близких векторов (т.е. синонимов). По результату реализации проекта планируется довести точность определения тональности от 90%.
Производитель: ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ИНТЕГРУМ МЕДИА"
Ссылка
Направление
IT
