-
Notifications
You must be signed in to change notification settings - Fork 0
DNET_ApacheImpala
- 戻る
- データウェアハウス(ビジネス インテリジェンス(BI)の該当節を参照)
- NoSQL, 分散処理
-
Apache Hadoopベース
-
大規模並列処理(MPP)SQLクエリエンジン
-
低レイテンシのSQLクエリを発行できる
-
Apache HiveのHive Query Language(HiveQL)との対比
- Hiveの特性に合わないアドホックなSQL処理の要望に応える。
- Hiveより高速な、新規に開発された並列データ処理系エンジン。
- バッチ処理としての高スループットを目指す用途ではHiveを用い,
分析などのアドホッククエリに対して高速に応答を返す用途ではImpalaを用いる。- 耐障害性を多少犠牲にしてメモリ上で処理を完結することにより高速化を実現する。
- 事前に取得された統計情報を元にメモリの使用量なども推測し、当該処理の並列化方法を決定する。
-
HDFS(Hadoopの該当節を参照)とApache HBaseストレージをサポート
-
Hadoopファイル形式を読み込み。
-
- メタデータ
- ODBCドライバ
- SQL構文
を使用。
- Hadoopセキュリティ(Kerberos認証)をサポート
- Apache Sentryでのきめ細かなロールベースのアクセス制御。
ユーザーのアプリケーションからクエリを実行する。
- JDBC / ODBC
- impala-shell(CUI)
- Hadoopクラスタ上のDataNodeで起動される。
- ImpalaにおけるSQL処理の中核を担うデーモン
- Hadoopクラスタ上で1つだけ起動される。
- Impalaが使用するメタデータを管理するデーモン
- Hadoopクラスタ上で1つだけ起動される。
- impaladの状態を監視するデーモン
Hiveのメタデータを管理するデーモン
HDFSが管理するブロックのメタデータを管理するデーモン
HDFSが管理するブロック自体を管理するデーモン
-
Apache Impala - Wikipedia
https://en.wikipedia.org/wiki/Apache_Impala -
Impalaとは?:Hadoop上で稼動するクエリエンジン|データ分析用語を解説 - GiXo Ltd.
https://www.gixo.jp/blog/12489/ -
ImpalaとHiveの戦略について | by Sho Shimauchi | Cloudera Japan Official Blog
https://blog.cloudera.co.jp/impala%E3%81%A8hive%E3%81%AE%E6%88%A6%E7%95%A5%E3%81%AB%E3%81%A4%E3%81%84%E3%81%A6-c08913d991a0
Hadoopはどのように動くのか
─並列・分散システム技術から読み解くHadoop処理系の設計と実装
- Impalaの設計と実装
正誤
- 「Catalog Server(catalogd)」と「Impala Daemon(impalad)」の説明が 入れ替わっている。正しくは、impalad が各 DataNode 上で起動され SQL 処理の中核を担うデーモン、catalogd がクラスタ上で 1 つだけ起動され メタデータを管理するデーモンである。原文はそのまま残し、ここに注記した。
補足:Apache Sentry は 2020 年に Apache Attic 入りしており、 現在の権限管理は Apache Ranger などが用いられる。
移行メモ
- PukiWiki のページ内アンカ(
#xxxxxxxx)は GitHub Wiki では再現できないため、 同一ページ内のアンカは見出しから生成されるアンカに張り替え、 他ページのアンカを指すリンクは「〜(ページ名の該当節を参照)」の形に置き換えた。
Tags: 移行, Apache Impala, Hadoop, MPP, SQLクエリエンジン, Hive, HBase, HDFS, impalad, catalogd
このWikiは「Open棟梁Project」,「OSSコンソーシアム 開発基盤部会」によって運営されています。