Skip to content

DNET_DistributedProcessingCollect

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

分散処理:データ収集・格納系

概要

(ストリーム系の)データ収集・格納系の処理には、

のプロダクトを使用する。

※ 複雑な、データ収集(DC)系には、
 シングル・イベント・プロセッサ(SEP)系や、
 複雑イベントプロセッサ(CEP)系(分散処理:ストリーム系の該当節を参照)を、
 使うこともある模様。

詳細

目的別

データ収集(DC)系

シングル・イベント・プロセッサ(SEP)系

データフロー・ETL(Extract/Transform/Load)のエンリッチメント。

プロダクト

  • データ生成元 → HadoopのHDFS(Hadoopの該当節を参照), etc. の部分の課題。
  • スクラッチ開発が必要なので、OSSのプロダクトが存在する。

Apache Sqoop

Apache Sqoop

業務データベースからのデータ

Fluentd/Embulk

Fluentd/Embulk

非構造化データ

Logstash, Beats

Elastic Stack(Elasticsearchの該当節を参照)

Apache Flume

Apache Flume

非構造化データ

Apache NiFi

Apache NiFi

EAI/ETL系のデータフロー・オーケストレーション・ツールだが、
ビッグデータのコンテキストでデータ収集+エンリッチメント役割を担う。

Apache Kafka

Apache Kafka

処理性能を重視したメッセージキュー

  • データをロストし難い仕組みを備える。

    • 複数台のマシンでクラスタを構成
    • 分散処理により高いスループットを発揮
  • 以下のような組み合わせで使用する。

参考

分散処理の該当節を参照。

移行メモ

  • 「Logsatsh」は「Logstash」の誤記のため修正した。
  • 「データ生成元 → HadoopのHDFS, etc. 部の課題」は文意が取りにくかったため 「〜 etc. の部分の課題。」と整えた。
  • 元の PukiWiki は「概要」に本文のない見出しを並べて詳細への索引としていたが、 GitHub Wiki では同名見出しのアンカが衝突するため、箇条書きのリンクに置き換えた。

Tags: 移行, 分散処理, データ収集, ビッグデータ, Apache Kafka, Apache NiFi, Fluentd, Embulk, Sqoop, Flume

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally