Skip to content

DNET_DistributedProcessingBatch

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

分散処理:分散(バッチ)系

概要

得意とするストレージによってフレームワークが異なる感じ。

※ Hadoop MapReduce(Hadoopの該当節を参照)は
 他の分散エンジンの隆盛によってフェードアウト気味らしいが、
 Hadoop や Hadoop Distributed File System (HDFS)(Hadoopの該当節を参照)は
 進化しつつあるらしい。

Hadoop(フレームワークとストレージ)

  • フレームワーク(いずれもHadoopの該当節を参照)

    • Hadoop MapReduce
    • Hadoop Yet Another Resource Negotiator (YARN)
  • ストレージ

    • HDFS(Hadoopの該当節を参照)

Apache Spark(フレームワークとストレージ)

詳細

目的別

Hadoop系

  • 複数台のサーバのディスクを効率よく利用

  • 大規模データの保存と処理を、

    • 適合した並列分散処理で実行
    • 現実的コストで実行
  • 繰返しの多い処理や、複雑な処理が苦手

    • 複雑な処理は、MapReduceジョブの組み合わせで実現
    • MapReduceジョブの都度、ディスクの読み書きが発生
  • Apache Spark系と比べ、スループット重視

Apache Spark系

  • Hadoop系の弱点を克服したもの。

  • 複数台のサーバのメモリ/CPU/ディスクを効率よく利用

    • データのキャッシュ
    • 実行プランの最適化
  • 複雑な処理を実行できる。

    • SQL(汎用化)

    • 機械学習

    • ストリーム

    • ライブラリ、API

    • ストレージとしては、
      HadoopのHDFS(Hadoopの該当節を参照)を使用。

  • Hadoop系と比べ、レスポンス重視

Asakusa Framework

Asakusa Framework

  • Hadoop系の分散(バッチ)系技術を土台としている。
  • バッチアプリケーションを開発するための包括的なフレームワーク

プロダクト

Hadoop

Hadoop

HDFS(Hadoopの該当節を参照)を使ったビッグデータの分散(バッチ)処理のプロダクト。

Apache Spark

Apache Spark

ビッグデータの分散(バッチ)処理のプロダクト。

  • 主にRDD(Apache Sparkの該当節を参照)を使用する。
  • オプションでHDFS(Hadoopの該当節を参照)も利用できる。

参考

分散処理の該当節を参照。

移行メモ

  • 元の PukiWiki は「概要」の中で「フレームワーク」「ストレージ」という 同名の見出しを Hadoop / Apache Spark の 2 系統で繰り返していたが、 GitHub Wiki では同名見出しのアンカが衝突するため、箇条書きにまとめた。

Tags: 移行, 分散処理, バッチ処理, ビッグデータ, Hadoop, Apache Spark, HDFS, MapReduce, YARN

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally