Экспертные заключения: 0
Консультации: 0

Разработка и программная реализация алгоритма распознавания речевых эмоций

Цель:

Разработать систему классификации речевых эмоций по параметрам устной речи.

Актуальность: В настоящий момент одной из наиболее актуальных задач в области обработки и распознавания акустических сигналов является улучшение различительной способности признакового описания. Одним из подходов является оптимизация параметров построения признакового описания для решаемой задачи классификации. Оптимизацию параметров алгоритма построения признакового описания можно осуществить с использованием численных методов оптимизации, в частности широко используется генетические алгоритмы. Альтернативный подход, который позволяет улучшить 647 признаковое описание, – агрегация признаков, полученных с использованием различных подходов, однако это ведет к существенному увеличению размерности признакового пространства, в результате чего пространство становится разреженным, что в свою очередь ухудшает точность последующего статистического анализа и распознавания. Чтобы избежать увеличения признакового пространства, проводится редукция признакового пространства, исходя из предположения о том, что многие признаки обладают невысокой информационной ценностью. Такой подход обладает некоторыми очевидными недостатками:

 потеря информации о сигнале, которая может быть значимой для дальнейшего анализа;

 вектора признаков могут быть распределены в пространстве признаков с большим перекрытием кластеров схожих аудио сигналов, что требует использования сложных нелинейных классификаторов

Таким образом, задача разработки и программной реализации алгоритмов распознавания речевых эмоций актуальна.

Задачи:

1. Исследовать применение нейронных сетей к задачам распознавания звука.

2. Провести обзор с уже имеющимися алгоритмами распознавания звука.

3. Исследовать применение вейвлет преобразований в задачах построения нейроннных сетей.

4. Разработать алгоритм распознавания речевых эмоций, основанный на совместном применении вейвлет преобразования и нейронных сетей.

5. Провести программную реализацию предложенного алгоритма и привести сравнительный анализ результата работы алгоритма с имеющимися аналогами.

Ожидаемый результат: Проект позволит последовательно осуществить этапы разработки интеллектуальной системы для распознавания речевых эмоций на основе параллельного применения вейвлет преобразования и нейронной сети.

Прогноз по рынку:

Ключевые игроки на рынке приложений для автоматического распознавания речи:

LumenVox, Nuance Communications, Telisma SA, AT&T Corp, Dolby Fusion Speech, Microsoft Tellme, Raytheon BBN Technologies, Telisma SA.

По объему выручки абсолютным лидером рынка с более чем 1 млрд руб. в год является ЦРТ, в структуре выручки группы компаний более 80% занимает доход от государственных контрактов. Just AI c объемом выручки в 500 млн руб. за 2020 год фокусируется на сегментах NLP/NLU/DM-платформ, No-code/Low-code конструкторов и кастомных голосовых ассистентов.

В категории компаний с выручкой в 200 млн руб. в год представлены Yandex.Cloud (речевые технологии), 3iTech (решения для госсектора, речевые технологии и платформы речевой аналитики) и «АТС Аэро» (решения для госсектора, исходящие телефонные коммуникации). При этом в структуре выручки 3iTech не менее 60% занимает доход от государственных контрактов. В группе компаний с 100 млн руб. годовой выручки отмечены «Наносемантика» (NLP/NLU/DM-платформы), Neuro.net и Zvonobot (исходящие телефонные коммуникации).

Ожидается, что размер мирового рынка «Приложения для автоматического распознавания речи» увеличится в течение прогнозируемого периода в среднем на 22,58% (2028 г.).

Ссылка

На страницу проекта

Направление

IT

Рынки

TechNet, NeuroNet

Сквозные технологии

Технологии машинного обучения и когнитивные технологии