Сервис для генерации синтетических табличных данных с идентичным распределением
Проект - сервис для генерации синтетических табличных данных. Сервис обучается на реальной таблице компании (например, клиентской или транзакционной базе) и создает новый набор данных, где нет ни одной реальной записи, но сохранены статистические свойства оригинала: распределения признаков, корреляции и зависимости между столбцами.
Решаемая проблема: командам разработки, тестирования и ML нужны реалистичные данные, но использовать продовые базы вне защищенного контура рискованно. Это грозит утечками и нарушением требований к персональным данным (152-ФЗ). Тестовые данные, заполненные вручную, не похожи на реальные, а классическая анонимизация (маскирование, удаление полей) искажает статистику, и данные становятся бесполезны для аналитики и обучения моделей.
Ключевая часть продукта - автоматическая проверка результата. К каждому сгенерированному датасету прилагается отчет. Он показывает, насколько синтетика близка к оригиналу по статистическим метрикам и насколько она безопасна: нет ли копий реальных записей и каков риск повторной идентификации.
Целевые клиенты: компании, работающие с чувствительными данными (финтех, банки, ритейл, телеком), и их команды разработки, QA и Data Science. Модель монетизации предполагается в виде подписке.
Текущая стадия: проработка идеи. Проведен первичный анализ рынка, идет подготовка к интервью с экспертами и потенциальными клиентами.
