Разработка модели и программного обеспечения нейронного машинного перевода дагестанского языка
Согласно статистике Юнеско, 131 язык в России находится на стадии исчезновения: более десятка из них – дагестанские. Многие из этих языков являются объектами многочисленных лингвистических исследований в России и за рубежом. Например, табасаранский язык (ISO 639-3 code, tab) выделяют как один из морфологически и фонетически сложных языков в мире.
- Изучение цифровых интерактивных проектов в форме онлайн-словарей выявило насущные проблемы – отсутствие реализации перевода произвольного текста и голосового вывода, решение которых позволило бы создать, в дальнейшем, обучающие языку, приложения. Представляется возможным получить корректный и естественно звучащий текст, если разработать сервис нейронного машинного перевода на основе модели глубокого обучения. Известными примерами таких сервисов являются Google Переводчик, Яндекс Переводчик, Amazon Translate.
- Цель проекта:
- разработка модели и программного обеспечения нейронного машинного перевода дагестанских языков (на примере табасаранского языка) в виде веб-сервиса.
Научная новизна исследования – в решении проблемы сбора данных и разработке нейросетевой модели для дагестанских языков (на примере табасаранского языка).
2. Задачи реализации проекта:
a) подготовка большого количества (не менее 50000) параллельных текстов – пар предложений на двух языках для нераспространенных языков:
- Создание нейросетевых моделей на основе родственных связей между дагестанскими языками (пантюркская модель, аваро-андоцезская модель, лезгино-дарголакская модель): нейросетевую модель для перевода с одного языка можно использовать при обучении переводчика другому, родственному ему языку.
- Cоздание синтетических данных техникой обратного машинного перевода (back-translation, tagged back-translation);
- - Создание сайта и/или канала для сбора необходимых данных энтузиастами.
b) опробовать и сравнить 3 подхода к разработке модели:
- использовать Neural Machine Translation (NMT) для наборов данных;
- использовать одну из статистических моделей только для коротких предложений или разговорных фраз, где нейронный перевод может оказаться хуже;
- воспользоваться гибридной моделью: перевести предложение двумя методами — статистическим и нейросетевым, затем выбрать наиболее подходящий.
3. Ожидаемые результаты.
- a) параллельные корпусы текстов основных национальных и русского языков (не менее 50000 пар), в том числе, созданные программно (синтетические);
- базовую версию веб-сервиса для перевода текста с табасаранского языка на русский и наоборот.
-
4. Прогноз по рынку
Результат проекта востребован как часть других популярных сервисов в сфере туризма, транспорта, питания и т.д.
