Разработка генеративной модели аугментации текстовых и аудио данных
На данный момент ни один из имеющихся синтезаторов речи не поддерживает дагестанские языки, что сильно усложняет ознакомление всех туристов, лингвистов и просто интересующихся людей с непереведенными материалами. Если вдобавок учесть сложность изучения многих д. я. (например, табасаранский язык имеет 46 падежей, даргинский – 19) , становится очевидной необходимость в неком инструменте, решающем эту проблему.
Решение проблемы:
- Использование имеющихся материалов и их переводов для обучения модели;
- Создание нейросетевой модели на основе родственных связей между дагестанскими языками.
Цель стартап-проекта – разработка модели нейронного машинного перевода дагестанских языков (на примере табасаранского языка) в виде веб-сервиса.
Научная новизна исследования – в решении проблемы сбора данных и разработке нейросетевой модели для дагестанских языков (на примере табасаранского языка).
2. Задачи реализации проекта:
a) подготовка большого количества (не менее 500000) параллельных текстов – пар предложений на двух языках для нераспространенных языков:
-Создание нейросетевых моделей на основе родственных связей между дагестанскими языками (пантюркская модель, аваро-андоцезская модель, лезгино-дарголакская модель): нейросетевую модель для перевода с одного языка можно использовать при обучении переводчика другому, родственному ему языку.
-Cоздание синтетических данных техникой обратного машинного перевода (back-translation, tagged back-translation);
-Создание сайта и/или канала для сбора необходимых данных энтузиастами.
Ожидаемые результаты.
a) параллельные корпусы текстов основных национальных и русского языков (не менее 2000 пар), в том числе, созданные программно (синтетические);
b) базовая версию веб-сервиса для перевода и озвучки текста на дагестанском языке или на русском и наоборот.
Прогноз по рынку
Результат проекта востребован как часть других популярных сервисов в сфере туризма, транспорта, питания и т.д.
