ETL

メタデータシステム
- 「特定の情報資産のさまざまな側面を記述し、情報ライフサイクル全体にわたってその有用性を向上させるための情報」と定義されます。
Data Lakeの出現
Google File Systemの出現。Spark、Hive、ODSなどのオープンソースが登場しました。 データベースの構造化データ+半構造化データのパイプラインが生まれました。 DBMSのデータとHadoopのデータを一緒に利用できるPrestoも登場しました。
予測または分類問題。
Hadoopシステム
2016年〜2020年の間に非常に多くのオープンソースが誕生しました。
Sparkは業界をリードしています。 並列処理。メモリにデータをキャッシュして非常に高速な実行速度を提供します。 Java、Scala、Python、Rなどの多様なプログラミング言語をサポートしています。 多様なワークロードをサポートし、データノードのフォールトトレランスも提供します。
データ保存構造
GCPにはBigQueryがあり、最近ではSnowflakeがあります。 運用系で使用していたデータを半構造化・非構造化データに加工してData Lakeに保存するケースが増えています。 データを適切に保存するストレージが必要です。
エンドツーエンドで分析者が簡単に分析できる環境を提供します。 データレイクハウスはクラウド環境の分析環境を使用します。 どの要素を重点的に見るべきか説明します。
TCO(Total Cost of Ownership):総所有コスト インフラ環境をオンプレミスとAWSで運用する場合を比較する総所有コスト分析(取得および運用コスト)
- 適切な容量設計
- 弾力的なアーキテクチャ
- 購入オプション
- ストレージクラス(S3にはいくつかの階層が存在します)
コストも継続的にモニタリングする必要があります。
データパイプラインを構築する際に最も強調されるのはデカップリングです。 Decoupling Compute and Storageアーキテクチャが必須です。 複数の場所のさまざまなソースから発生したデータを、柔軟で保存可能なストレージプラットフォームに論理的または仮想的に最適化された環境として、簡単かつ効果的な分散プラットフォームとして構築できます。

EC2のアイドルリソースをAvailability Zoneごとにオークション形式で利用。 ビッグデータ分析、バッチ処理、ステートレスWebサービス... 大規模並列計算。
Spot Fleet
HDFSとしてS3(オブジェクトストレージ)を使用した場合のメリット: ComputeノードとDataノードを分離して運用可能。 クラスターを終了してから再度クラスターを構成しても、既存のデータを読み取ることができる。 HDFSのスケーリングを気にする必要がない。
分析中でもノードを追加または削除できます。

データレイクは低コスト。 データウェアハウスはクローズドです。
データパイプラインのアーキテクチャ

- 社内のデータ要件への迅速な対応
- 継続的でエラーがないこと
- システム的に発生する問題に対して柔軟でスケーラブルであること
- スケールアップとスケールアウトが自由であること
- イベント性のデータ負荷にも対応可能であること:マーケティングイベント、プッシュ配信、サービスオープン
- 分析しやすいデータフォーマット
Lambdaアーキテクチャ

- API Gateway:外部と内部のデータ接続
- Kinesis:キュー
- Kinesis:キューにあるデータを消費する方法
- Pinpoint:マーケティング情報の送信
- DMS:運用系で使用中のデータを一括で移行
- Spark Streaming、Kinesis Analytics(Flink)
- Elasticsearch、DynamoDB、Redshift
クイズ
Q1: 「AWSパイプライン構築 Ch 01」の主なトピックは何ですか?
AWSパイプライン構築 Ch01
Q2: ETLとは何ですか?
メタデータシステム
「特定の情報資産のさまざまな側面を記述し、情報ライフサイクル全体にわたってその有用性を向上させるための情報」と定義されます。
Data Lakeの出現 Google File Systemの出現。Spark、Hive、ODSなどのオープンソースが登場しました。
データベースの構造化データ+半構造化データのパイプラインが生まれました。
DBMSのデータとHadoopのデータを一緒に利用できるPrestoも登場しました。 予測または分類問題。
Hadoopシステム 2016年〜2020年の間に非常に多くのオープンソースが誕生しました。
Q3: データパイプラインのアーキテクチャについて説明してください。
社内のデータ要件への迅速な対応 継続的でエラーがないこと
システム的に発生する問題に対して柔軟でスケーラブルであること
スケールアップとスケールアウトが自由であること
イベント性のデータ負荷にも対応可能であること:マーケティングイベント、プッシュ配信、サービスオープン
分析しやすいデータフォーマット
Q4: Lambdaアーキテクチャについて説明してください。
API Gateway:外部と内部のデータ接続 Kinesis:キュー Kinesis:キューにあるデータを消費する方法
Pinpoint:マーケティング情報の送信 DMS:運用系で使用中のデータを一括で移行 Spark
Streaming、Kinesis Analytics(Flink) Elasticsearch、DynamoDB、Redshift