ETL의

Meta Data system
- '특정 정보 자산의 여러 측면을 기술하여 정보 수명 주기 전반에 걸쳐 그 유용성을 개선하기 위한 정보'로 정의한다.
Data Lake 출현
Google File System의 출현. Spark, Hive, ODS 등의 Opensource 등장 DataBase의 정형 데이터 + 반정형 데이터 파이프라인이 생겨남. DBMS에 있는 데이터와 Hadoop에 있는 데이터를 함께 사용하는 Presto도 생겨남
예측 또는 분류 문제.
Hadoop system
2016~2020년 사이에 굉장히 많은 오픈소스가 생겨남.
Spark은 업계를 주도하고 있음. 병렬처리. 메모리에 데이터를 캐시하여 무척 빠른 실행속도를 제공. Java, Scala, Python, R 과 같은 다양한 프로그래밍 언어를 지원 다양한 워크로드 지원. 데이터 노드에 fault tolerance도 제공한다.
데이터 저장 구조.
GPC에는 Big Query가 있고. 최근에는 Snowflake가 있다. 운영계가 사용하던 데이터를 반정형 비정형 데이터를 가공해서 DataLake에 저장하는 사례가 늘어나고 있다. 데이터를 잘 저장하는 저장소가 필요하다.
End to End에서 분석가들이 쉽게 분석할 수 있는환경을 제공한다. 데이터 lakehouse는 클라우드 환경의 분석환경을 사용한다. 어떤요소를 중점적으로 봐야하는지 설명을한다.
TCO(Total Cost of Ownership): 총 소유비용 인프라 환경을 온프레미 on-premises 와 AWS에서 운영하는 경우를 비교하는 총 소유 비용 분석(취득 및 운영 비용)
- 적절한 용량 산정
- 탄력적 아키텍처
- 구매 옵션
- 스토리지 클래스 (S3의 경우 몇가지 Layer가 존재한다)
비용도 지속적으로 모니터링을 해야한다.
데이터 파이프라인을 구축할 때 가장 강조하는 것은 Decoupling이다. Decoupling Compute and Storage 아키텍처가 반드시 필요. 여러 위치의 다양한 소스로부터 발생한 데이터를 유연하고 저장 가능한 저장 플랫폼을 논리적 혹은 가상의 최적화된 환경으로 쉽고 효과적인 분산 플랫폼으로 구축가능하다.

EC2의 유휴 자원을 Availability Zone 별로 경매를 통해 이용 빅데이터 분석, 배치 작업, Stateless web ... 대량 병렬계산
Spot Fleet
HDFS로 S3(Object Storage)를 사용했을 때의 장점 Compute Node와 Data Node를 구분해서 운영 가능하다. Cluster를 종료 후에 다시 Cluster를 구성해도 기존 데이터를 읽을 수 있다. HDFS의 확장에 대핵서 신경을 쓰지 않아도 된다.
분석 중에도 Node를 추가하거나, 삭제할 수 있다.

데이터레이크는 저렴. 데이터 웨어하우스는 폐쇄적이다.
데이터 파이프라인 구성방안

- 회사 내의 데이터 요구사항에 대한 빠른 대응
- 지속적이고 애러가 없어야 한다.
- 시스템 적으로 발생하는 문제에 대해서 유연하고 Scailable 해야한다.
- scale up과 scale out이 자유로워야한다.
- 이벤트성 데이터 부하에도 처리가 가능해야한다. 마케팅 이벤트, 푸시 발송, 서비스 오픈
- 쉬운 분석데이터 포맷
Lambda Architecture

- API gateway : 외부와 내부의 데이터 연결
- kinesis : 큐
- Kinesis: 큐에있는 데이터를 내리는 방법
- Pinpoint: 마켓팅 정보 전송
- DMS: 운영계에서 사용중인 데이터를 통짜로 옮겨줌
- Spark Streaming , Kinesis Aanlitics(Flink)
- Elastic search, DynamoDB, Redshift,