-
Notifications
You must be signed in to change notification settings - Fork 0
DNET_DistributedProcessingCollect
nishi_74322014 edited this page Sep 11, 2026
·
1 revision
(ストリーム系の)データ収集・格納系の処理には、
のプロダクトを使用する。
※ 複雑な、データ収集(DC)系には、
シングル・イベント・プロセッサ(SEP)系や、
複雑イベントプロセッサ(CEP)系(分散処理:ストリーム系の該当節を参照)を、
使うこともある模様。
データフロー・ETL(Extract/Transform/Load)のエンリッチメント。
- データ生成元 → HadoopのHDFS(Hadoopの該当節を参照), etc. の部分の課題。
- スクラッチ開発が必要なので、OSSのプロダクトが存在する。
業務データベースからのデータ
非構造化データ
Elastic Stack(Elasticsearchの該当節を参照)
- Logstash(Elasticsearchの該当節を参照)
- Beats(Elasticsearchの該当節を参照)
非構造化データ
EAI/ETL系のデータフロー・オーケストレーション・ツールだが、
ビッグデータのコンテキストでデータ収集+エンリッチメント役割を担う。
処理性能を重視したメッセージキュー
-
データをロストし難い仕組みを備える。
- 複数台のマシンでクラスタを構成
- 分散処理により高いスループットを発揮
-
以下のような組み合わせで使用する。
- Apache NiFi → Kafka → Storm
- Fluentd → Kafka → Hadoop/Spark
分散処理の該当節を参照。
移行メモ
- 「Logsatsh」は「Logstash」の誤記のため修正した。
- 「データ生成元 → HadoopのHDFS, etc. 部の課題」は文意が取りにくかったため 「〜 etc. の部分の課題。」と整えた。
- 元の PukiWiki は「概要」に本文のない見出しを並べて詳細への索引としていたが、 GitHub Wiki では同名見出しのアンカが衝突するため、箇条書きのリンクに置き換えた。
Tags: 移行, 分散処理, データ収集, ビッグデータ, Apache Kafka, Apache NiFi, Fluentd, Embulk, Sqoop, Flume
このWikiは「Open棟梁Project」,「OSSコンソーシアム 開発基盤部会」によって運営されています。