Экспертные заключения: 0
Консультации: 0

Сервис для генерации синтетических табличных данных с идентичным распределением

Проект - сервис для генерации синтетических табличных данных. Сервис обучается на реальной таблице компании (например, клиентской или транзакционной базе) и создает новый набор данных, где нет ни одной реальной записи, но сохранены статистические свойства оригинала: распределения признаков, корреляции и зависимости между столбцами.

Решаемая проблема: командам разработки, тестирования и ML нужны реалистичные данные, но использовать продовые базы вне защищенного контура рискованно. Это грозит утечками и нарушением требований к персональным данным (152-ФЗ). Тестовые данные, заполненные вручную, не похожи на реальные, а классическая анонимизация (маскирование, удаление полей) искажает статистику, и данные становятся бесполезны для аналитики и обучения моделей.

Ключевая часть продукта - автоматическая проверка результата. К каждому сгенерированному датасету прилагается отчет. Он показывает, насколько синтетика близка к оригиналу по статистическим метрикам и насколько она безопасна: нет ли копий реальных записей и каков риск повторной идентификации.

Целевые клиенты: компании, работающие с чувствительными данными (финтех, банки, ритейл, телеком), и их команды разработки, QA и Data Science. Модель монетизации предполагается в виде подписке.

Текущая стадия: проработка идеи. Проведен первичный анализ рынка, идет подготовка к интервью с экспертами и потенциальными клиентами.

Ссылка

На страницу проекта

Направление

IT

Рынки

TechNet, AutoNet

Сквозные технологии

Искусственный интеллект