-
Notifications
You must be signed in to change notification settings - Fork 0
DNET_DistributedProcessingBatch
nishi_74322014 edited this page Sep 11, 2026
·
1 revision
得意とするストレージによってフレームワークが異なる感じ。
※ Hadoop MapReduce(Hadoopの該当節を参照)は
他の分散エンジンの隆盛によってフェードアウト気味らしいが、
Hadoop や Hadoop Distributed File System (HDFS)(Hadoopの該当節を参照)は
進化しつつあるらしい。
-
フレームワーク(いずれもHadoopの該当節を参照)
- Hadoop MapReduce
- Hadoop Yet Another Resource Negotiator (YARN)
-
ストレージ
- HDFS(Hadoopの該当節を参照)
-
フレームワーク
- Spark Core(Apache Sparkの該当節を参照)
- Spark SQL(Apache Sparkの該当節を参照、詳細はSpark SQL)
-
ストレージ
- RDD(Apache Sparkの該当節を参照)
- HDFS(Hadoopの該当節を参照)
-
複数台のサーバのディスクを効率よく利用
-
大規模データの保存と処理を、
- 適合した並列分散処理で実行
- 現実的コストで実行
-
繰返しの多い処理や、複雑な処理が苦手
- 複雑な処理は、MapReduceジョブの組み合わせで実現
- MapReduceジョブの都度、ディスクの読み書きが発生
-
Apache Spark系と比べ、スループット重視
HDFS(Hadoopの該当節を参照)を使ったビッグデータの分散(バッチ)処理のプロダクト。
ビッグデータの分散(バッチ)処理のプロダクト。
- 主にRDD(Apache Sparkの該当節を参照)を使用する。
- オプションでHDFS(Hadoopの該当節を参照)も利用できる。
分散処理の該当節を参照。
移行メモ
- 元の PukiWiki は「概要」の中で「フレームワーク」「ストレージ」という 同名の見出しを Hadoop / Apache Spark の 2 系統で繰り返していたが、 GitHub Wiki では同名見出しのアンカが衝突するため、箇条書きにまとめた。
Tags: 移行, 分散処理, バッチ処理, ビッグデータ, Hadoop, Apache Spark, HDFS, MapReduce, YARN
このWikiは「Open棟梁Project」,「OSSコンソーシアム 開発基盤部会」によって運営されています。