Экспертные заключения: 0
Консультации: 0

Clusterix-New

Объемы собираемых и хранимых данных в современных информационных системах достигают огромных объемов, исчисляемых десятками, сотнями GB и TB, а порой и PB. Объемы БД в десятки и сотни GB все чаще встречаются у относительно небольших предприятий. Терабайтные и петабайтные объемы присущи территориально распределенным системам: социальные сети, поисковые системы, государственные информационные системы и др. Например, размер БД с сообщениями пользователей социальной сети «ВКонтакте» на 2017 год составлял ≈ 324 TB, а поисковые системы давно преодолели петабайтный порог (50 PB для «Яндекс» в 2016 году). Кроме того, объемы хранимых данных по результатам разного рода испытаний и наблюдении также могут быть весьма значительными: от десятков GB до единиц PB. Своевременная обработка накопленных данных требует применения высокопроизводительных вычислительных средств (HPC) и специализированного программного обеспечения – СУБД консервативного типа с эпизодическим обновлением данных. Имеется множество коммерческих и свободных разработок параллельных СУБД на платформе вычислительных кластеров (Microsoft SQL Server, Oracle Database, PostgreSQL, MySQL Cluster и др.). Но все они ориентированы, в основном, на OLTP нагрузку, которая характеризуется выполнением множества сравнительно простых операций типа select и insert над динамически изменяемыми базами данных. Причина в том, что серьезной проблемой для высокопроизводительных реляционных СУБД всегда было и остается повышение скорости обработки сложных запросов. Для консервативных СУБД свойственна OLAP нагрузка, которая характеризуется высоким удельным весом сложных запросов типа «селекция – проекция – соединение», оперирующих множеством таблиц с большим числом операций соединения. Коммерческие OLAP-системы достаточно дороги и потому недоступны организациям с ограниченными финансовыми возможностями. Аналитическую обработку данных значительных объемов в этих организациях можно осуществить с использованием open source программных систем на экономичной кластерной платформе. Ранее созданные Clusterix-подобные СУБД консервативного типа, использующие регулярный план обработки запросов, были не до статочно эффективны. Поэтому исследования по таким системам были развиты с ориентиром на полную загрузку процессорных ядер и применение динамического сегментирования промежуточных и временных отношений на GPU вплоть до разработки системы, сравнимой по эффективности с перспективной открытой системой Spark. В настоящее время правительством РФ взят курс на импортозамещение, в связи с чем серьезное внимание уделяется созданию на базе открытых систем (PostgreSQL, MySQL и др.) отечественных СУБД общего и специального назначения. Поэтому разработка и исследование принципов построения и программной организации сравнительно недорогих отечественных СУБД повышенных объемов является актуальной задачей. Производительность Clustrix-New может быть повышена путем применения GPU-ускорителей для:

1. Выполнения операций select-project - ускорения получения данных для временных отношений.

2. Работы со сжатыми колоночными БД - ускорения распаковки/сжатия данных для передачи данных, увеличение хранимых данных в существующих системах хранения.

В результате выполнения планируемой разработки ожидает существенное ускорение работы системы Clusterix-New (согласно теоретической оценке - на 50%), а также повышение объема обрабатываемых кластером данных без использования накопителей (InMemory). Достижение такого ускорения возможно благодаря разработке специального формата хранения данных, пригодного для работы с GPU и позволяющего хранить данные в сжатом виде. Применение параллельной СУБД для аналитической обработки данных Clusterix-New с ускорением на GPU целесообразно в областях, где накоплены/собираются большие массивы данных и требуется их своевременная обработка. К таким областям относятся: информационные технологии, большие данные, искусственный интеллект, обработка результатов различного рода экспериментов, аналитика накопленных данных.

Ссылка

На страницу проекта

Направление

IT

Сквозные технологии

Технологии хранения и анализа больших данных