LabHub
学习 学习路径 课程

Apache Hadoop — HDFS 와 YARN 을 한 파드에 세우고 운영한다

데이터 & AI 엔지니어링 · 中级 · 讲解 10 · 测验 10 · 实验 10

Hadoop 3.5 를 파드 하나에 의사 분산으로 띄워 NameNode 와 DataNode 가 무엇을 나눠 갖는지, 블록과 복제, 권한과 ACL, 이름·공간 쿼터, 휴지통과 스냅샷, fsimage 와 edits, 맵리듀스와 Hadoop Streaming, YARN 컨테이너 크기와 대기열, 작은 파일과 하둡 아카이브까지 다룹니다. 판정은 NameNode 와 잡 이력에 남은 사실로 합니다. 리눅스 셸이 익숙한 분을 위한 과정입니다.

开始实验

课程大纲

HDFS 의 두 역할

NameNode 는 이름을, DataNode 는 블록을 가진다 — 셸·WebHDFS 로 같은 파일을 두 길로 본다

블록과 복제

블록 크기와 복제 계수, fsck, DataNode 디스크 위의 블록 파일, 체크섬이 블록 크기에 묶이는 이유

권한과 사용자

단순 인증은 누구라고 말하는 대로 믿는다 — 권한 비트·ACL·기본 ACL·스티키 비트

쿼터

이름 쿼터와 공간 쿼터, 공간 쿼터가 블록 크기×복제만큼 미리 잡는 이유

스냅샷과 휴지통

지운 것을 되돌리는 두 길 — 휴지통(클라이언트 쪽)과 스냅샷(NameNode 쪽), snapshotDiff

NameNode 메타데이터

fsimage 와 edits, 안전 모드, saveNamespace, 오프라인 뷰어(oiv·oev)

MapReduce

맵·셔플·정렬·리듀스, 컴바이너, 카운터, 잡 이력(.jhist) — YARN 위에서

Hadoop Streaming

표준 입출력으로 맵퍼·리듀서를 파이썬으로 — 정렬 보장, 컴바이너, 키 필드 분할, 사용자 카운터

YARN 컨테이너와 대기열

ResourceManager·NodeManager·ApplicationMaster, 컨테이너 크기 상·하한, Capacity Scheduler 대기열, 로그 모으기

작은 파일과 HAR

파일 하나가 NameNode 힙을 먹는 이유, 하둡 아카이브(HAR), distcp

参考文档