LabHub

블로그

AWS pipline 구축 ch 01

한국어English日本語

ETL의

1

Meta Data system

Data Lake 출현

Google File System의 출현. Spark, Hive, ODS 등의 Opensource 등장 DataBase의 정형 데이터 + 반정형 데이터 파이프라인이 생겨남. DBMS에 있는 데이터와 Hadoop에 있는 데이터를 함께 사용하는 Presto도 생겨남

예측 또는 분류 문제.

Hadoop system

2016~2020년 사이에 굉장히 많은 오픈소스가 생겨남.

Spark은 업계를 주도하고 있음. 병렬처리. 메모리에 데이터를 캐시하여 무척 빠른 실행속도를 제공. Java, Scala, Python, R 과 같은 다양한 프로그래밍 언어를 지원 다양한 워크로드 지원. 데이터 노드에 fault tolerance도 제공한다.

데이터 저장 구조.

GPC에는 Big Query가 있고. 최근에는 Snowflake가 있다. 운영계가 사용하던 데이터를 반정형 비정형 데이터를 가공해서 DataLake에 저장하는 사례가 늘어나고 있다. 데이터를 잘 저장하는 저장소가 필요하다.

End to End에서 분석가들이 쉽게 분석할 수 있는환경을 제공한다. 데이터 lakehouse는 클라우드 환경의 분석환경을 사용한다. 어떤요소를 중점적으로 봐야하는지 설명을한다.

TCO(Total Cost of Ownership): 총 소유비용 인프라 환경을 온프레미 on-premises 와 AWS에서 운영하는 경우를 비교하는 총 소유 비용 분석(취득 및 운영 비용)

비용도 지속적으로 모니터링을 해야한다.

데이터 파이프라인을 구축할 때 가장 강조하는 것은 Decoupling이다. Decoupling Compute and Storage 아키텍처가 반드시 필요. 여러 위치의 다양한 소스로부터 발생한 데이터를 유연하고 저장 가능한 저장 플랫폼을 논리적 혹은 가상의 최적화된 환경으로 쉽고 효과적인 분산 플랫폼으로 구축가능하다.

2

EC2의 유휴 자원을 Availability Zone 별로 경매를 통해 이용 빅데이터 분석, 배치 작업, Stateless web ... 대량 병렬계산

Spot Fleet

HDFS로 S3(Object Storage)를 사용했을 때의 장점 Compute Node와 Data Node를 구분해서 운영 가능하다. Cluster를 종료 후에 다시 Cluster를 구성해도 기존 데이터를 읽을 수 있다. HDFS의 확장에 대핵서 신경을 쓰지 않아도 된다.

분석 중에도 Node를 추가하거나, 삭제할 수 있다.

3

데이터레이크는 저렴. 데이터 웨어하우스는 폐쇄적이다.

데이터 파이프라인 구성방안

4

Lambda Architecture

5

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다