Skip to content

DNET_DataPipeline

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

データ・パイプライン

概要

データからの知識発見(ビッグデータの該当節を参照)を行うための実装。

  • データ・パイプライン...まさに配管。
  • 良く、DX(IoTビッグデータAI)のコンテキストで語られる方

v1

取り敢えず書いてみた、最初の版。

イメージ

v2

Databricksのセミナーに影響を受けた結果を反映。

イメージ

DXは=IoT, ビッグデータ分散処理),
AIじゃねーよ。
みたいな話があったりしましたが、まぁ、ワリと、
=IoT, ビッグデータ(分散処理), AI になってしまってます♨。

まぁ、技術マッピング中に含まれているから良いのでは?と。

v3

イメージ

Path(Hot、Warm、Cold)

認証について。

IoTデバイスの認証を参照。

監視 → 制御へ。

  • 効果の段階(IoTの該当節を参照)の監視 → 制御の段階の進化を検討する。
  • エッジ(や認証基盤)から、デバイスへの通信方法を検討する。

詳細

データ収集(データ転送)

バルク型(bulk)

分散(バッチ)処理(分散処理の該当節を参照)

ストリーミング型(streaming)

ストリーム処理(分散処理の該当節を参照)

データレイク → データマート

ワークフロー管理ツール

前述の、データレイク → データマートの処理をワークフロー化する。

  • データ集約プロセス

    • データ検索
    • データ加工
  • 可視化プロセス

    • データ可視化

エンジニア、アナリスト

  • データ エンジニア
    データの設計や統合、クレンジングの仕組み、カタログの整備。

  • データベース エンジニア
    データ基盤のインフラ・アーキテクチャを設計し、安定して運用する。

  • データ アナリスト
    データから価値ある情報を引き出す。

参考

Qiita

NoSQLプロダクトのタイプ

NoSQLの該当節を参照。

ビッグデータ界隈のシステムにおいて、

  • 事例の理解には、先ず、ココの理解が重要になりそう。

  • 「"こう言う業務"だから、"こう言うプロダクト"が選定されているのか。」的な。

    • データの利用目的によってデータストアを使い分けることが多い。

    • これは、データベースの種類によって得意不得意があるため。

      • RDB:構造化されたデータをビジネス要件に矛盾なく永続化する

      • DWH:大規模なデータの蓄積・分析、大規模なユースケースには不向き。

      • NoSQL:Volume & Velocity、Varietyに対応しているが、
        複雑なクエリやソートなどが苦手。

DWHとは異なる。

DWH(ビジネス インテリジェンス(BI)の該当節を参照)は、
業務データを長期的に蓄積し管理したもの(なので、バッチ的アーキテクチャである)。

NoSQLはイベント駆動型である。

NoSQL は、業務データではなく、様々なデータソースから発生するデータを対象にする。

スタック&コラボレーション的例

スタック&コラボレーションも参照。

NiFi, Kafka, Storm

Elastic Stack

Elasticsearchの該当節を参照。
Elastic Stack は、1つの完成された事例的。

Apache Sparkを使用し、

  • NoSQL的なイベント駆動処理から

  • バッチ処理によるDWH作成

までをこなす。


Tags: 移行, DX, ビッグデータ, データ・パイプライン, 開発基盤

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally