Apache Hadoop — HDFS 와 YARN 을 한 파드에 세우고 운영한다
데이터 & AI 엔지니어링 · 中级 · 讲解 10 · 测验 10 · 实验 10
Hadoop 3.5 를 파드 하나에 의사 분산으로 띄워 NameNode 와 DataNode 가 무엇을 나눠 갖는지, 블록과 복제, 권한과 ACL, 이름·공간 쿼터, 휴지통과 스냅샷, fsimage 와 edits, 맵리듀스와 Hadoop Streaming, YARN 컨테이너 크기와 대기열, 작은 파일과 하둡 아카이브까지 다룹니다. 판정은 NameNode 와 잡 이력에 남은 사실로 합니다. 리눅스 셸이 익숙한 분을 위한 과정입니다.
课程大纲
HDFS 의 두 역할
NameNode 는 이름을, DataNode 는 블록을 가진다 — 셸·WebHDFS 로 같은 파일을 두 길로 본다
블록과 복제
블록 크기와 복제 계수, fsck, DataNode 디스크 위의 블록 파일, 체크섬이 블록 크기에 묶이는 이유
권한과 사용자
단순 인증은 누구라고 말하는 대로 믿는다 — 권한 비트·ACL·기본 ACL·스티키 비트
쿼터
이름 쿼터와 공간 쿼터, 공간 쿼터가 블록 크기×복제만큼 미리 잡는 이유
스냅샷과 휴지통
지운 것을 되돌리는 두 길 — 휴지통(클라이언트 쪽)과 스냅샷(NameNode 쪽), snapshotDiff
NameNode 메타데이터
fsimage 와 edits, 안전 모드, saveNamespace, 오프라인 뷰어(oiv·oev)
MapReduce
맵·셔플·정렬·리듀스, 컴바이너, 카운터, 잡 이력(.jhist) — YARN 위에서
Hadoop Streaming
표준 입출력으로 맵퍼·리듀서를 파이썬으로 — 정렬 보장, 컴바이너, 키 필드 분할, 사용자 카운터
YARN 컨테이너와 대기열
ResourceManager·NodeManager·ApplicationMaster, 컨테이너 크기 상·하한, Capacity Scheduler 대기열, 로그 모으기
작은 파일과 HAR
파일 하나가 NameNode 힙을 먹는 이유, 하둡 아카이브(HAR), distcp