ВИЗОР — сервис адаптации визуального контента для слабовидящих
Проект «ВИЗОР» представляет собой программный сервис, предназначенный для помощи слепым, слабовидящим и пожилым людям с возрастным снижением зрения. Идея проекта заключается в создании простого цифрового инструмента с интерфейсом «одной кнопки», который избавляет пользователей от необходимости просить посторонних о помощи при проверке лекарств. В отличие от универсальных систем распознавания текста, считывающих всю информацию с упаковки сплошным потоком (включая инструкцию и рекламу), ВИЗОР фильтрует данные: пользователь загружает фотографию упаковки, а система извлекает только три жизненно важных параметра (название препарата, дозировку и срок годности) и озвучивает их одной понятной фразой. Это позволяет людям безопасно принимать нужные медикаменты без риска ошибки и потери независимости.Проект напрямую связан с задачами Национальных проектов технологического лидерства (НПТЛ). Он относится к направлению № 8 «Новые технологии сбережения здоровья», так как разрабатываемый продукт попадает под номенклатуру п. 7.2.2008 «Специальные устройства для чтения "говорящих книг", для оптической коррекции слабовидения» (согласно перечню продукции проектов «Цифровая радиоэлектронная промышленность» и «Техносфера»). Кроме того, проект использует сквозную технологию п. 25 «Технологии искусственного интеллекта в отраслях экономики, социальной сферы и в органах публичной власти» (Указ Президента РФ от 18.06.2024 № 529), адаптируя готовые модели машинного зрения под конкретные бытовые потребности уязвимых групп населения. Целью проекта является разработка прототипа сервиса адаптации визуального контента, обеспечивающего автоматическое распознавание этикеток лекарственных препаратов, извлечение ключевых параметров безопасности и их мгновенный голосовой вывод. Для достижения этой цели поставлены следующие задачи: проанализировать существующие решения компьютерного зрения и их ограничения при работе с мелким текстом на блистерах; разработать архитектуру сервиса с максимально упрощенным интерфейсом; интегрировать готовые библиотеки оптического распознавания текста (OCR); создать алгоритм фильтрации для извлечения из распознанного текста только трех целевых сущностей (название, дозировка, срок годности); подключить модуль синтеза речи (Text-to-Speech) на русском языке; провести тестирование прототипа на выборке из 50 реальных упаковок лекарств в условиях, имитирующих бытовое использование (разное освещение, угол наклона), и измерить точность и время отклика.Ожидаемым результатом проекта станет работающий MVP (минимально жизнеспособный продукт) сервиса ВИЗОР, способный по одной фотографии выдать точное голосовое описание лекарства. Измеримыми показателями эффективности выступят: точность правильного извлечения и озвучивания ключевых полей на уровне не менее 85–90% на тестовой выборке, а также время отклика системы (от загрузки фото до начала воспроизведения аудио) не более 10 секунд. Внедрение такого решения повысит качество жизни и уровень самостоятельности слабовидящих граждан, а масштабируемая архитектура прототипа в будущем позволит добавить распознавание других категорий товаров (продукты питания, банковские купюры, документы).
