Распознавание речевых событий в промышленной среде
Система распознавания речевых событий для промышленной среды
Описание проекта :
Программно-аппаратный комплекс на базе ИИ, который анализирует звуковой фон на производстве в реальном времени. Система не просто распознает речь, но и идентифицирует неречевые акустические события (удары, скрежет, утечки, сигналы оборудования) для повышения безопасности и автоматизации контроля.
Ключевая ценность:
- Безопасность: Мгновенное оповещение о критических звуках (крики, поломки, утечки газа).
- Контроль: Автоматическая фиксация голосовых команд операторов и нарушений техпроцесса.
- Аналитика: Сбор данных о работе оборудования по его звуковому профилю.
Идея проекта
Создать систему, которая в условиях высокого промышленного шума автоматически выделяет и классифицирует речевые события: команды, аварийные оповещения, ненормативную лексику как маркер стресса/ошибки, а также фиксирует моменты отсутствия речи (тишина там, где должна быть коммуникация). Система должна отличать речь от других звуков (сирены, скрежет, удары) и работать локально на оборудовании цеха без постоянной связи с облаком. Идея — повысить безопасность и контроль коммуникации на производстве, снизив зависимость от ручного прослушивания аудиозаписей.
Связь с НПТЛ
Проект относится к направлениям: 05 средства производства и автоматизации
- Цифровые технологии для промышленности: внедрение ИИ-анализа аудиосигналов в производственные процессы.
- Технологии обработки сигналов и машинного обучения: фильтрация шума, выделение признаков, классификация событий на основе акустических и контекстных признаков.
- Промышленная безопасность и управление рисками: автоматизация контроля соблюдения регламентов, раннего выявления опасных ситуаций по речевым маркерам.
- Индустриальный интернет вещей (IIoT): интеграция с датчиками и системами диспетчеризации для передачи событий в реальном времени.
Цель проекта
Разработать и протестировать прототип системы , способный в условиях промышленного шума (85–105 дБ) распознавать и классифицировать речевые события с точностью не ниже 85% (F1-score) по 5 ключевым классам (команда, тревога, ненормативная лексика, тишина в регламентное время, прочие звуки) и передавать события в систему диспетчеризации в реальном времени (задержка ≤2 с) на локальном оборудовании промышленного класса.
Задачи проекта
- Собрать и разметить датасет из аудиозаписей в реальных промышленных условиях (цех, стройплощадка, склад): не менее 20 часов аудио с разметкой по классам событий и уровнем фонового шума.
- Разработать модуль шумоподавления и предобработки сигнала (фильтрация, нормализация, выделение спектральных признаков), устойчивый к типичным промышленным шумам.
- Обучить и валидировать модель классификации речевых событий на размеченных данных, провести кросс-валидацию по разным типам цехов и шума.
- Реализовать интеграцию с промышленным ПО/диспетчеризацией: формат передачи событий (JSON/MQTT), обработка ошибок и разрывов связи, работа в офлайн-режиме с буферизацией.
- Провести пилотные испытания на 2–3 участках производства, собрать метрики точности, задержек, устойчивости к сбоям и отзывы операторов.
- Подготовить документацию: инструкция по установке и эксплуатации, описание API, отчёт о тестировании и рекомендации по масштабированию.
Ожидаемые результаты
Разработанный аппаратный комплекс.
- Распознавание ограниченного набора команд оператора («Стоп», «Пуск», «Помощь», «Авария») с точностью не ниже 90–95% в шуме до 85–100 дБ.
- Детекция спонтанной речи (крик, призыв о помощи) без предварительного обучения на конкретном дикторе.
- Определение эмоционального состояния говорящего (стресс, паника, агрессия) как дополнительный сигнал тревоги.
- Идентификация типовых промышленных событий: удар, падение предмета, скрежет металла, шипение утечки (пар/газ), нештатная работа подшипника, срабатывание пневмоинструмента, сирена.
