Курс по администрированию HBase разработан для специалистов, отвечающих за администрирование, настройку и сопровождение кластера Apache HBase.
Практические курсы администрирования кластера HBase.
Продолжительность: 4 дня, 32 академических часа.
Соотношение теории к практике 40/60.
Что такое Apache HBase и где это используется
Apache HBase — это нереляционная (NoSQL) колоночная (column-oriented) база данных. Она использует распределенную файловую систему Apache Hadoop (HDFS) и эффективно обеспечивает динамическое партиционирование данных, распределение нагрузки, кэширование и доступ в реальном времени. Главными достоинствами Apache HBase считаются следующие:
- высокая производительность и быстрота работы, в т.ч. в режиме реального времени, за счет кэширования в памяти и обработки данных на стороне сервера через фильтры и сопроцессоры;
- высокая доступность и отказоустойчивость, обеспечиваемые с помощью репликации в HDFS, поддержку транзакционности операций на уровне строк, а также автоматическое распределение нагрузки и балансировку таблиц;
- масштабируемость — HBase эффективно работает даже при увеличении кластера до сотен узлов для работы с миллиардами строк и миллионами столбцов;
- наличие инструментов расширяемости (REST и другие API-интерфейсы Java и шлюзов) и внешних SQL-решений (Apache Phoenix, Drill, Hive и Cloudera Impala), чтобы работать с данными в HBase, как с реляционными таблицами.
Благодаря этим преимуществам Apache HBase широко применяется для аналитики больших данных в реальном времени (OLTP) и работы с таблицами пользовательских приложений. Например, эта NoSQL-СУБД активно используется в Facebook, Adobe, Yahoo, Twitter, NGDATA и множестве других компаний по всему миру. Все лучшие практики (best practices) такого прикладного использования рассматриваются в рамках нашего практического курса обучения администраторов Big Data по работе с кластером HBase.
Программа
- Введение в HBase
- Немного о Hadoop и NoSQL. Hive и HBase. NoSQL
- Архитектура HBase. Модель данных HBase: Column family, timestamp, версионность
- Сервисы и операторы HBase. Концепция CRUD: базовые операции с таблицами
- Сценарии использования HBase
- Импорт данных и интеграция с HBase
- Импорт данных с использованием importTSV
- Взаимодействие компонент Hadoop и HBase: HDFS, PIG, Hive, sqoop, Impala
- Хранение файлов в HDFS. Форматы файлов для HDFS: параметры сжатия, ORC, Parquet
- Использование Java API для работы с HBase
- Установка и настройка HBase
- Требования по установке HBase
- Дизайн схемы HBase для эффективного хранения данных и HA
- Установка Apache HBase
- Команды и интерфейс командной строки HBase: HBaseAdmin
- Ручная установка кластера HBase. Настройка кластера Zookeeper
- Управление кластером HBase
- Высокая доступность (High Availability) кластера HBase. Настройка Snapshots. Настройка репликации кластера
- Безопасность HBase. Настройка аутентификации и авторизации при доступе к данным в таблицах HBase
- Резервное копирование и восстановление HBase
- Advanced HBase
- Мониторинг Apache HBase. Анализ лог файлов HBase
- Операции обслуживания. Compactions и flushes
- Оптимизация параметров HBase: Hfile, WAL, Memstores, Bloom фильтр
- Диагностика и разрешение проблем (troubleshooting). Мониторинг и оптимизация JVM. Garbage Collection
- Region splitting
- Лекции 0
- Тесты 0
- Учебное время 50 hours
- Навык Все уровни
- Язык English
- Студенты 0
- Оценки Да