Экспертные заключения: 0
Консультации: 0

Разработка модели и программного обеспечения нейронного машинного перевода дагестанского языка

Согласно статистике Юнеско, 131 язык в России находится на стадии исчезновения: более десятка из них – дагестанские. Многие из этих языков являются объектами многочисленных лингвистических исследований в России и за рубежом. Например, табасаранский язык (ISO 639-3 code, tab) выделяют как один из морфологически и фонетически сложных языков в мире.

  • Изучение цифровых интерактивных проектов в форме онлайн-словарей выявило насущные проблемы – отсутствие реализации перевода произвольного текста и голосового вывода, решение которых позволило бы создать, в дальнейшем, обучающие языку, приложения. Представляется возможным получить корректный и естественно звучащий текст, если разработать сервис нейронного машинного перевода на основе модели глубокого обучения. Известными примерами таких сервисов являются Google Переводчик, Яндекс Переводчик, Amazon Translate.
  • Цель проекта:
  • разработка модели и программного обеспечения нейронного машинного перевода дагестанских языков (на примере табасаранского языка) в виде веб-сервиса.

Научная новизна исследования – в решении проблемы сбора данных и разработке нейросетевой модели для дагестанских языков (на примере табасаранского языка).

2. Задачи реализации проекта:

a) подготовка большого количества (не менее 50000) параллельных текстов – пар предложений на двух языках для нераспространенных языков:

  • Создание нейросетевых моделей на основе родственных связей между дагестанскими языками (пантюркская модель, аваро-андоцезская модель, лезгино-дарголакская модель): нейросетевую модель для перевода с одного языка можно использовать при обучении переводчика другому, родственному ему языку.
  • Cоздание синтетических данных техникой обратного машинного перевода (back-translation, tagged back-translation);
  • - Создание сайта и/или канала для сбора необходимых данных энтузиастами.

b) опробовать и сравнить 3 подхода к разработке модели:

  • использовать Neural Machine Translation (NMT) для наборов данных;
  • использовать одну из статистических моделей только для коротких предложений или разговорных фраз, где нейронный перевод может оказаться хуже;
  • воспользоваться гибридной моделью: перевести предложение двумя методами — статистическим и нейросетевым, затем выбрать наиболее подходящий.

3. Ожидаемые результаты.

  • a) параллельные корпусы текстов основных национальных и русского языков (не менее 50000 пар), в том числе, созданные программно (синтетические);
  • базовую версию веб-сервиса для перевода текста с табасаранского языка на русский и наоборот.

4. Прогноз по рынку

Результат проекта востребован как часть других популярных сервисов в сфере туризма, транспорта, питания и т.д.

Ссылка

На страницу проекта

Направление

IT

Рынки

TechNet

Сквозные технологии

Технологии машинного обучения и когнитивные технологии, Технологии хранения и анализа больших данных