ACID-транзакции в Arenadata Hadoop

Arenadata представила новую версию Arenadata Hadoop (ADH) – корпоративного дистрибутива для хранения, обработки и анализа неструктурированных и слабоструктурированных данных. Релиз расширяет возможности управления данными благодаря поддержке ACID-транзакций и веб-интерфейсу HUE для удобного взаимодействия аналитиков с базами и хранилищами данных.

Расширенная функциональность

Новая версия продукта включает в поставку Apache Iceberg – библиотеку поддержки высокопроизводительного открытого табличного формата данных для управления информацией на уровне файловой системы. Apache Iceberg позволяет работать со структурированной информацией в озере данных, используя SQL-запросы, и легко интегрируется в существующую инфраструктуру благодаря совместимости с большинством технологий хранения данных (от HDFS до S3) и популярными вычислительными инструментами, такими как Spark, Impala, Hive и др.

Iceberg решает проблемы традиционных форматов таблиц и обеспечивает новые возможности, включая согласованную параллельную запись данных в разделяемые файлы в кластере, ретроспективные запросы к ранним версиям данных и откат изменений, изменение схемы хранения данных, секционирование данных и др. Использование Iceberg-таблиц позволяет значительно повысить скорость выполнения запросов за счет инкрементальной обработки данных, быстрого сканирования и фильтрации неактуальных данных.

В новой версии Arenadata Hadoop реализована поддержка HUE (Hadoop User Experience) – популярного веб-интерфейса экосистемы Hadoop, предназначенного для анализа данных. Благодаря его способности подключаться к СУБД, вычислительному инструменту или хранилищу данных через нативные коннекторы, упрощается работа с источниками данных.

HUE востребован широким кругом пользователей: от бизнес-аналитиков, дата-инженеров и дата-сайентистов до администраторов баз данных и SQL-разработчиков. В составе Arenadata Hadoop HUE содержит преднастроенные интерпретаторы SQL для Impala, Hive, Kyuubi и Spark SQL, а также мониторинг задач YARN и Impala и возможность просмотра файловой системы HDFS.

Анонс очередного релиза

«На данный момент поддержка Iceberg доступна в сервисах Spark, Impala и ограниченно в Hive (только чтение). В следующем релизе мы расширим функциональность в Hive и добавим поддержку Iceberg-формата в Flink, что увеличит возможности потоковой обработки данных, – рассказал Александр Анисимов, технический руководитель продукта Arenadata Hadoop. – В свою очередь, новый сервис HUE получит дополнительный функционал, связанный с безопасностью и отказоустойчивостью, также будет расширяться список преднастроенных интерпретаторов».

В вышедшем релизе Arenadata Hadoop обновлены версии сервисов Impala, Spark, Kyuubi и Zeppelin, добавлены LDAP-аутентификация для Impala и Kyuubi, плагин Kyuubi AuthZ в Spark3 для поддержки авторизации в Ranger. Проще стало управление SSL-шифрованием для сервисов кластера. Обновлена и подсистема безопасности Arenadata Platform Security: в новой версии введена поддержка доменного контроллера Samba и режим высокой доступности для Ranger KMS.

Возможности дистрибутива

Arenadata Hadoop (ADH) — корпоративный дистрибутив на базе Apache Hadoop, предназначенный для хранения и обработки слабоструктурированных и неструктурированных данных.

Решаемые задачи:

  • хранение и обработка больших объёмов слабоструктурированных и неструктурированных данных любого типа (системы управления документами и контентом, хранение и регистрация событий, данные датчиков, каталоги товаров, резервное копирование других СУБД);
  • распределённая обработка информации;
  • построение озёр и фабрик данных (единый центр всех данных компании, быстрое развёртывание и сворачивание «песочниц» для пилотных проектов и проверки статистических гипотез, работа с аналитическими инструментами в единой среде);
  • машинное обучение и искусственный интеллект;
  • источник данных для КХД;
  • импортозамещение систем западного производства.

На Arenadata Hadoop получено свидетельство о государственной регистрации программы для ЭВМ. Продукт включен в единый реестр российских программ для электронных вычислительных машин и баз данных, а также в реестр системы сертификации средств защиты информации по требованиям безопасности информации.

Следите за нашими новостями в Телеграм-канале Connect


Поделиться:



Следите за нашими новостями в
Телеграм-канале Connect

Спецпроект

Цифровой девелопмент

Подробнее
Спецпроект

Машиностроительные предприятия инвестируют в ПО

Подробнее


Подпишитесь
на нашу рассылку