Разработка и программная реализация алгоритма распознавания речевых эмоций
Цель:
Разработать систему классификации речевых эмоций по параметрам устной речи.
Актуальность: В настоящий момент одной из наиболее актуальных задач в области обработки и распознавания акустических сигналов является улучшение различительной способности признакового описания. Одним из подходов является оптимизация параметров построения признакового описания для решаемой задачи классификации. Оптимизацию параметров алгоритма построения признакового описания можно осуществить с использованием численных методов оптимизации, в частности широко используется генетические алгоритмы. Альтернативный подход, который позволяет улучшить 647 признаковое описание, – агрегация признаков, полученных с использованием различных подходов, однако это ведет к существенному увеличению размерности признакового пространства, в результате чего пространство становится разреженным, что в свою очередь ухудшает точность последующего статистического анализа и распознавания. Чтобы избежать увеличения признакового пространства, проводится редукция признакового пространства, исходя из предположения о том, что многие признаки обладают невысокой информационной ценностью. Такой подход обладает некоторыми очевидными недостатками:
потеря информации о сигнале, которая может быть значимой для дальнейшего анализа;
вектора признаков могут быть распределены в пространстве признаков с большим перекрытием кластеров схожих аудио сигналов, что требует использования сложных нелинейных классификаторов
Таким образом, задача разработки и программной реализации алгоритмов распознавания речевых эмоций актуальна.
Задачи:
1. Исследовать применение нейронных сетей к задачам распознавания звука.
2. Провести обзор с уже имеющимися алгоритмами распознавания звука.
3. Исследовать применение вейвлет преобразований в задачах построения нейроннных сетей.
4. Разработать алгоритм распознавания речевых эмоций, основанный на совместном применении вейвлет преобразования и нейронных сетей.
5. Провести программную реализацию предложенного алгоритма и привести сравнительный анализ результата работы алгоритма с имеющимися аналогами.
Ожидаемый результат: Проект позволит последовательно осуществить этапы разработки интеллектуальной системы для распознавания речевых эмоций на основе параллельного применения вейвлет преобразования и нейронной сети.
Прогноз по рынку:
Ключевые игроки на рынке приложений для автоматического распознавания речи:
LumenVox, Nuance Communications, Telisma SA, AT&T Corp, Dolby Fusion Speech, Microsoft Tellme, Raytheon BBN Technologies, Telisma SA.
По объему выручки абсолютным лидером рынка с более чем 1 млрд руб. в год является ЦРТ, в структуре выручки группы компаний более 80% занимает доход от государственных контрактов. Just AI c объемом выручки в 500 млн руб. за 2020 год фокусируется на сегментах NLP/NLU/DM-платформ, No-code/Low-code конструкторов и кастомных голосовых ассистентов.
В категории компаний с выручкой в 200 млн руб. в год представлены Yandex.Cloud (речевые технологии), 3iTech (решения для госсектора, речевые технологии и платформы речевой аналитики) и «АТС Аэро» (решения для госсектора, исходящие телефонные коммуникации). При этом в структуре выручки 3iTech не менее 60% занимает доход от государственных контрактов. В группе компаний с 100 млн руб. годовой выручки отмечены «Наносемантика» (NLP/NLU/DM-платформы), Neuro.net и Zvonobot (исходящие телефонные коммуникации).
Ожидается, что размер мирового рынка «Приложения для автоматического распознавания речи» увеличится в течение прогнозируемого периода в среднем на 22,58% (2028 г.).
