태그: #big-data
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 12 편
Hadoop 아키텍처 다시 보기 — HDFS, YARN, 그리고 그 이후
Hadoop의 핵심인 HDFS와 YARN, 그리고 MapReduce의 동작 원리를 다이어그램으로 다시 정리합니다. 오브젝트 스토리지와 클라우드, 레이크하우스 시대에 Hadoop의 역할이 어떻게 바뀌었는지, 그리고 오늘날 Hadoop을 어떻게 이해해야 하는지를 살펴봅니다.
2026-06-27 · 55 분 읽기 #hadoop#hdfs#yarn#mapreduce#lakehouse모던 Hadoop & 빅데이터 생태계 2026 완벽 가이드 - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 심층 분석
2026년 Hadoop과 빅데이터 생태계는 '죽었다'가 아니라 '재배치되었다'. Hadoop 3.4의 Erasure Coding과 Ozone, Spark 4의 ANSI 모드와 Spark Connect, Hive 4의 Iceberg 통합, Kafka 4의 KRaft GA와 tiered storage, Flink 2의 disaggregated state, Iceberg 1.8과 REST 카탈로그
2026-05-16 · 45 분 읽기 #hadoop#spark#hive#kafka#flinkHadoop 생태계 & 데이터 엔지니어링 2026 완벽 가이드 - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 심층 분석
2026년 5월 기준 데이터 엔지니어링 스택을 끝까지 본다. "Hadoop은 죽었다"는 자극적 헤드라인의 진실(HDFS는 줄어들지만 YARN과 레이크하우스 패턴은 살아남았다), Iceberg vs Delta Lake vs Hudi 테이블 포맷 전쟁의 결말, Spark 4.0 + Photon + Spark Connect의 현재, Flink SQL과 CDC의 스트리밍 표준화, Trino 페더레이
2026-05-16 · 42 분 읽기 #hadoop#spark#flink#trino#presto하둡은 죽었는가 — 빅데이터 스택의 진화, Hadoop에서 Lakehouse까지 (Spark·Iceberg·Delta, 그리고 2026년의 현실)
Hadoop은 죽었는가? 정확히 말하면 '기본값에서 내려왔다.' HDFS·YARN·MapReduce 3종 세트의 시대가 끝나고, Spark가 MR을 갈아치우고, 객체 스토리지가 HDFS를 갈아치우고, 열린 테이블 포맷(Iceberg·Delta·Hudi)이 Hive 메타스토어 시대를 끝냈다. 그 진화의 전 과정을 한 번에 정리한다 — 무엇이 무엇을 대체했고, 어디에 Hadoop이 아직 살아있고
2026-05-14 · 37 분 읽기 #hadoop#big-data#spark#iceberg#delta-lake확률적 데이터 구조 완전 가이드 2025: HyperLogLog, Count-Min Sketch, MinHash, T-Digest, Cuckoo Filter — Redis/Presto/Spark 실전 분석
Redis가 12KB로 10억 개의 유니크 방문자를 세는 비결, HyperLogLog. Count-Min Sketch, MinHash, T-Digest, Cuckoo Filter까지 — 메모리와 정확도를 교환하는 확률적 자료구조의 세계를 720줄로 완전 분석한다.
2026-04-15 · 33 분 읽기 #probabilistic-data-structures#hyperloglog#count-min-sketch#minhash#t-digestSnowflake 아키텍처 완전 가이드 2025: Compute-Storage Separation, Micro-Partition, Virtual Warehouse, Zero-Copy Clone 심층 분석
Snowflake가 어떻게 클라우드 데이터 웨어하우스 시장을 뒤엎었는가? Compute와 Storage의 분리, 마이크로 파티션, 가상 웨어하우스, zero-copy clone까지 — 현대 데이터 플랫폼의 기준이 된 아키텍처를 720줄로 완전 분석한다.
2026-04-15 · 60 분 읽기 #snowflake#data-warehouse#compute-storage-separation#micro-partition#virtual-warehouse컬럼 지향 스토리지 완전 가이드 2025: Parquet, ORC, Apache Arrow, Dremel — 분석 DB가 10,000배 빠른 이유
Snowflake, BigQuery, Spark가 수 TB 데이터를 수 초에 쿼리하는 비결. Parquet의 Dremel 기반 구조, ORC, Apache Arrow의 메모리 포맷, RLE/Dictionary 압축, 벡터화 실행까지 720줄로 완전 분석한다.
2026-04-15 · 40 분 읽기 #columnar-storage#parquet#orc#apache-arrow#dremel확률적 자료구조 완전 가이드 2025: Bloom Filter, HyperLogLog, Count-Min Sketch, 실전 활용
확률적 자료구조의 모든 것! Bloom Filter, Counting Bloom Filter, HyperLogLog, Count-Min Sketch, MinHash, Cuckoo Filter — 메모리 효율과 정확도의 트레이드오프, RocksDB/Redis/Cassandra/Spark의 실전 활용.
2026-04-15 · 20 분 읽기 #bloom-filter#hyperloglog#count-min-sketch#probabilistic#data-structuresApache Spark 내부 완전 가이드 2025: RDD, Catalyst Optimizer, Tungsten, Whole-Stage Codegen, Shuffle 심층 분석
Spark가 같은 쿼리를 MapReduce보다 100배 빠르게 처리하는 비결. RDD부터 DataFrame/Dataset, Catalyst optimizer, Tungsten project, whole-stage code generation, shuffle 최적화까지 720줄로 완전 분석한다.
2026-04-15 · 57 분 읽기 #spark#catalyst#tungsten#rdd#whole-stage-codegenApache Iceberg 데이터 레이크하우스: 테이블 포맷 혁신과 실전 운영 가이드
Apache Iceberg의 아키텍처와 핵심 기능(Time Travel, Schema Evolution, Partition Evolution)을 분석하고, Spark/Trino 연동과 프로덕션 운영 전략을 다룹니다.
2026-03-14 · 27 분 읽기 #apache-iceberg#data-lakehouse#big-data#hadoop#sparkHadoop 에코시스템 실전 가이드: HDFS, MapReduce, YARN 핵심 정리
Hadoop의 핵심 구성 요소인 HDFS, MapReduce, YARN의 아키텍처와 동작 원리를 이해하고, 클러스터 구축부터 성능 튜닝, 모니터링까지 실전 운영 노하우를 다루는 종합 가이드.
2026-03-08 · 17 분 읽기 #hadoop#hdfs#mapreduce#yarn#big-dataHBase 실전 가이드: 대규모 NoSQL 데이터 저장소 설계부터 운영까지
HBase의 데이터 모델과 아키텍처를 이해하고, 테이블 설계, RowKey 전략, 읽기/쓰기 성능 최적화, Region 관리, 모니터링까지 실전 운영에 필요한 모든 것을 다루는 가이드.
2026-03-08 · 20 분 읽기 #hadoop#hbase#nosql#big-data#database