Arenadata представила новую версию Arenadata Hadoop (ADH) – корпоративного дистрибутива для хранения, обработки и анализа неструктурированных и слабоструктурированных данных. Релиз расширяет возможности управления данными благодаря поддержке ACID-транзакций и веб-интерфейсу HUE для удобного взаимодействия аналитиков с базами и хранилищами данных.
Расширенная функциональность
Новая версия продукта включает в поставку Apache Iceberg – библиотеку поддержки высокопроизводительного открытого табличного формата данных для управления информацией на уровне файловой системы. Apache Iceberg позволяет работать со структурированной информацией в озере данных, используя SQL-запросы, и легко интегрируется в существующую инфраструктуру благодаря совместимости с большинством технологий хранения данных (от HDFS до S3) и популярными вычислительными инструментами, такими как Spark, Impala, Hive и др.
Iceberg решает проблемы традиционных форматов таблиц и обеспечивает новые возможности, включая согласованную параллельную запись данных в разделяемые файлы в кластере, ретроспективные запросы к ранним версиям данных и откат изменений, изменение схемы хранения данных, секционирование данных и др. Использование Iceberg-таблиц позволяет значительно повысить скорость выполнения запросов за счет инкрементальной обработки данных, быстрого сканирования и фильтрации неактуальных данных.
В новой версии Arenadata Hadoop реализована поддержка HUE (Hadoop User Experience) – популярного веб-интерфейса экосистемы Hadoop, предназначенного для анализа данных. Благодаря его способности подключаться к СУБД, вычислительному инструменту или хранилищу данных через нативные коннекторы, упрощается работа с источниками данных.
HUE востребован широким кругом пользователей: от бизнес-аналитиков, дата-инженеров и дата-сайентистов до администраторов баз данных и SQL-разработчиков. В составе Arenadata Hadoop HUE содержит преднастроенные интерпретаторы SQL для Impala, Hive, Kyuubi и Spark SQL, а также мониторинг задач YARN и Impala и возможность просмотра файловой системы HDFS.
Анонс очередного релиза
«На данный момент поддержка Iceberg доступна в сервисах Spark, Impala и ограниченно в Hive (только чтение). В следующем релизе мы расширим функциональность в Hive и добавим поддержку Iceberg-формата в Flink, что увеличит возможности потоковой обработки данных, – рассказал Александр Анисимов, технический руководитель продукта Arenadata Hadoop. – В свою очередь, новый сервис HUE получит дополнительный функционал, связанный с безопасностью и отказоустойчивостью, также будет расширяться список преднастроенных интерпретаторов».
В вышедшем релизе Arenadata Hadoop обновлены версии сервисов Impala, Spark, Kyuubi и Zeppelin, добавлены LDAP-аутентификация для Impala и Kyuubi, плагин Kyuubi AuthZ в Spark3 для поддержки авторизации в Ranger. Проще стало управление SSL-шифрованием для сервисов кластера. Обновлена и подсистема безопасности Arenadata Platform Security: в новой версии введена поддержка доменного контроллера Samba и режим высокой доступности для Ranger KMS.
Возможности дистрибутива
Arenadata Hadoop (ADH) — корпоративный дистрибутив на базе Apache Hadoop, предназначенный для хранения и обработки слабоструктурированных и неструктурированных данных.
Решаемые задачи:
- хранение и обработка больших объёмов слабоструктурированных и неструктурированных данных любого типа (системы управления документами и контентом, хранение и регистрация событий, данные датчиков, каталоги товаров, резервное копирование других СУБД);
- распределённая обработка информации;
- построение озёр и фабрик данных (единый центр всех данных компании, быстрое развёртывание и сворачивание «песочниц» для пилотных проектов и проверки статистических гипотез, работа с аналитическими инструментами в единой среде);
- машинное обучение и искусственный интеллект;
- источник данных для КХД;
- импортозамещение систем западного производства.
На Arenadata Hadoop получено свидетельство о государственной регистрации программы для ЭВМ. Продукт включен в единый реестр российских программ для электронных вычислительных машин и баз данных, а также в реестр системы сертификации средств защиты информации по требованиям безопасности информации.