SoundDebug
Образовательная платформа для технического анализа аудиомиксов
Разработка веб-сервиса (с перспективой масштабирования в VST-плагин) для автоматизированного анализа музыкальных треков. Система принимает аудиофайл, выполняет математический DSP-анализ и нейросетевое разделение на стемы для выявления технических ошибок сведения.
Ключевое отличие от существующих решений: система не модифицирует аудиофайл автоматически, а формирует диагностический отчет с указанием локализации ошибок, объяснением их физики и обучающими рекомендациями по устранению.
Цель проекта
Создать систему объективной оценки качества музыкального микса, которая сравнивает загруженный трек с эталонными математическими профилями жанров и предоставляет пользователю образовательный фидбек для самостоятельного исправления технических дефектов.
Функциональные требования (Core Features)
-
Модуль ввода и определения контекста:
- Загрузка аудиофайла (.wav, .mp3).
- Выбор целевого жанра или загрузка собственного референс-трека.
- Загрузка системой соответствующего эталонного профиля (Target Curves) из базы данных.
-
Модуль базового DSP-анализа (Global Scan):
- Вычисление метрик громкости и динамики: LUFS (Integrated), True Peak и др.
- Оценка пространства: проверка моно-совместимости и фазовой корреляции (детекция противофазы в низкочастотном диапазоне).
- Расчет и построение амплитудно-частотной характеристики (АЧХ) общего микса.
-
Модуль ML-анализа (Stem Analysis):
- Разделение исходного аудиофайла на 4 изолированные дорожки (Drums, Bass, Vocals, Other) с помощью модели Demucs.
- Поиск частотных маскировок (конфликтов) между полученными стемами.
-
Модуль генерации отчетов (Health Report):
- Сопоставление полученных DSP и ML-метрик с допустимыми порогами (Thresholds) выбранного жанра.
- Формирование текстовых рекомендаций на основе базы знаний (связка: выявленная аномалия -> описание проблемы -> метод решения).
- Механизм «Художественный замысел» (Warnings System): возможность пользователя игнорировать зафиксированные отклонения (например, намеренный сатурационный перегруз), помечая их как творческое решение.
Технический стек (предположительно на MVP)
- Backend: Python, FastAPI.
- Асинхронная обработка (очереди задач): Celery или ProcessPoolExecutor (необходимо для обработки тяжелых аудиофайлов и ML-выводов).
- DSP-движок: librosa, scipy, numpy (расчет FFT, RMS, спектрограмм).
- ML-движок: PyTorch, модель Demucs v4 (извлечение стемов).
- База данных: PostgreSQL / SQLite (хранение профилей жанров, истории загрузок и отчетов).
Требования к данным
- Эталонные кривые (Target Curves): JSON-датасет с усредненными показателями АЧХ и динамики, сформированный на основе спектрального анализа Топ-50 референсных треков для 3-5 жанров.
- База знаний (Knowledge Base): Текстовый маппинг в формате словаря [код_ошибки] -> [понятное описание] -> [рекомендация/ссылка на урок].
Требования к MVP (Минимально жизнеспособный продукт)
- Реализован эндпоинт загрузки файла и выбора жанра.
- Реализован алгоритм Global Scan (расчет минимум 3 метрик: LUFS, True Peak, Tonal Balance).
- Интегрирована визуализация: наложение графика АЧХ загруженного трека на эталонный график жанра.
- Вывод базового текстового отчета о превышении допустимых значений (клиппинг, сильные отклонения по частотам).
Ссылка
Направление
IT, Образование
Рынки
EduNet, NeuroNet
Сквозные технологии
Искусственный интеллект
