AutoExtract. Самообучаемая система для извлечения данных из неструктурированного текста
В современном мире потоки документов увеличиваются вместе с ростом мировой экономики. Перед многими компаниями и государственными учреждениями остро стоит задача автоматизации обработки документов, хранения и аналитики данных, содержащихся в этих документах. Для построения эффективных систем аналитики данных из текстов документов, которые зачастую лишь частично структурированы или вовсе не структурированы, уже на этапе обработки требуется выделить данные и сущности, которые отражают смысловую суть и необходимы для аналитики. Ускорение и повышение качества этого процесса требует разработки эффективных систем автоматизированного извлечения сущностей. Такого рода системы актуальны во многих сферах, например, в банковской, юридической, медицинской, таможенной, госуправления и других. Можно выделить четыре подхода к решению проблемы извлечения пользовательских сущностей из текста: 1) регулярные выражения; 2) решения на основе геометрической детекции сущностей; 3) онтологии (анализ лингвистики); 4) решения на основе машинного обучения. Последняя группа пока менее всего представлена на рынке, однако является наиболее перспективной ввиду своей универсальности. Существующие продукты по извлечению данных не позволяют на должном уровне работать с неструктурированными текстами, устойчиво улучшать качество модели извлечения непосредственно в процессе использования системы, а также настраивать и эксплуатировать модель ресурсами бизнес-пользователя, не являющегося сильным техническим специалистом. В рамках данного проекта будет разработано универсальное ПО для извлечения определяемых пользователем сущностей на базе машинного обучения. Данное программное решение будет иметь возможность постоянного дообучения в процессе функционирования. Улучшение качества модели будет происходить за счет сбалансированного использования в обучающей выборке новых данных, провалидированных специалистом автоматизируемого бизнес-процесса. Соответственно, предлагаемое решение будет иметь в качестве составной части станцию валидации - интерфейс, в котором сотрудник будет обрабатывать исключения, возникшие при обработке документа, и при необходимости проверять извлеченные структурированные данные из текста. Уже проверенные (скорректированные) данные будут направляться далее по бизнес-процессу, а также на пополнение обучающего множества для улучшения модели извлечения (дообучения). В случае, когда сущности извлекаются с большой степенью уверенности будет возможность настроить прохождение документа по бизнес-процессу минуя станцию валидации. Автоматическое пополнение обучающего множества проверенными на станции валидации данными дает возможность постепенно увеличивать степень автоматизации бизнес-процесса, не отрывая специалистов по обработке данных от выполнения своих ежедневных обязанностей. Дообучение модели извлечения данных будет происходить автоматически в фоновом режиме. Таким образом, появляется возможность быстрого запуска проекта автоматизации извлечения сущностей в промышленную эксплуатацию без обученной модели. С появлением размеченных документов, прошедших через станцию валидации, будет обучена базовая модель извлечения, качество которой будет увеличиваться с ростом количества данных. Этот итерационный процесс будет довольно быстро и регулярно увеличивать степень автоматизации. Отметим, что благодаря использованию алгоритмов машинного обучения модель извлечения не требует специальной настройки дорогостоящим квалифицированным специалистом, будет работать с слабоструктурированными и неструктурированными текстами, будет устойчивой к плохому качеству OCR (в случае обработки текстов, распознанных из изображений).
Производитель: ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "БИТРЕЙН"
Ссылка
Направление
IT
