태그: #spark
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 15 편
PySpark 4.2, Python UDF가 기본으로 Arrow를 탄다 — 타입 강제 변환 225칸 중 132칸이 바뀌는 이야기
2026년 7월 14일 릴리스된 Apache Spark 4.2.0은 SPARK-54555로 spark.sql.execution.pythonUDF.arrow.enabled 기본값을 false에서 true로 뒤집었습니다. 벤더 블로그는 이걸 "코드 재작성 없이 더 빠른 컬럼 경로"라고 소개하지만, 정작 릴리스 어디에도 Arrow 대 pickle의 속도 수치는 공개돼 있지 않습니다. 그리고 진짜
2026-07-16 · 27 분 읽기 #spark#python#arrow#data-engineeringIceberg v3 로우 리니지 — 행 ID는 파일에 저장되지 않는다
Apache Iceberg 포맷 v3는 모든 행에 안정적인 식별자를 부여하는 로우 리니지를 스펙에 넣었고, 이건 옵션이 아니라 v3 테이블이면 무조건 켜집니다. 그런데 이 값은 데이터 파일에 저장되지 않습니다 — 테이블의 next-row-id에서 스냅샷, 매니페스트, 데이터 파일로 내려오는 상속 체인을 통해 읽는 시점에 계산됩니다. 낙관적 커밋이 재시도될 때 데이터 파일을 다시 쓰지 않기 위
2026-07-16 · 31 분 읽기 #iceberg#lakehouse#table-format#data-engineering#spark모던 Hadoop & 빅데이터 생태계 2026 완벽 가이드 - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 심층 분석
2026년 Hadoop과 빅데이터 생태계는 '죽었다'가 아니라 '재배치되었다'. Hadoop 3.4의 Erasure Coding과 Ozone, Spark 4의 ANSI 모드와 Spark Connect, Hive 4의 Iceberg 통합, Kafka 4의 KRaft GA와 tiered storage, Flink 2의 disaggregated state, Iceberg 1.8과 REST 카탈로그
2026-05-16 · 45 분 읽기 #hadoop#spark#hive#kafka#flinkHadoop 생태계 & 데이터 엔지니어링 2026 완벽 가이드 - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 심층 분석
2026년 5월 기준 데이터 엔지니어링 스택을 끝까지 본다. "Hadoop은 죽었다"는 자극적 헤드라인의 진실(HDFS는 줄어들지만 YARN과 레이크하우스 패턴은 살아남았다), Iceberg vs Delta Lake vs Hudi 테이블 포맷 전쟁의 결말, Spark 4.0 + Photon + Spark Connect의 현재, Flink SQL과 CDC의 스트리밍 표준화, Trino 페더레이
2026-05-16 · 42 분 읽기 #hadoop#spark#flink#trino#presto모던 Scala 2026 — Scala 3.6 / 3.7 / ZIO 2 / Cats Effect 3 / Pekko / Tapir / Mill / Scala CLI 심층 가이드
2026년 Scala 생태계의 모든 것 — Scala 3.6/3.7의 새 기능, Scala 4 preview, sbt 2.x vs Mill vs Scala CLI, ZIO 2 vs Cats Effect 3, Pekko/Akka BSL 사태, Play/http4s/Tapir, Scala.js/Native, Spark, Lichess, Effect.ts, Iron refined types, 그리
2026-05-16 · 40 분 읽기 #scala#scala-3#sbt#mill#scala-cli데이터 레이크하우스 & 모던 데이터 엔지니어링 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks 인수) / Trino / Spark 4 / Flink 2 / DataFusion 심층 가이드
2026년의 데이터 엔지니어링은 더 이상 "데이터 웨어하우스 vs 데이터 레이크"의 시대가 아니다. Apache Iceberg가 2024-25년 테이블 포맷 전쟁의 승자로 떠오르면서 Netflix·Apple·LinkedIn·Stripe·Airbnb가 모두 그 위에 모였고, Databricks는 2024년 6월 Iceberg 공동 창시자 Ryan Blue의 Tabular를 $1B 이상으로 인수
2026-05-16 · 48 분 읽기 #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudi하둡은 죽었는가 — 빅데이터 스택의 진화, Hadoop에서 Lakehouse까지 (Spark·Iceberg·Delta, 그리고 2026년의 현실)
Hadoop은 죽었는가? 정확히 말하면 '기본값에서 내려왔다.' HDFS·YARN·MapReduce 3종 세트의 시대가 끝나고, Spark가 MR을 갈아치우고, 객체 스토리지가 HDFS를 갈아치우고, 열린 테이블 포맷(Iceberg·Delta·Hudi)이 Hive 메타스토어 시대를 끝냈다. 그 진화의 전 과정을 한 번에 정리한다 — 무엇이 무엇을 대체했고, 어디에 Hadoop이 아직 살아있고
2026-05-14 · 37 분 읽기 #hadoop#big-data#spark#iceberg#delta-lake컬럼 지향 스토리지 완전 가이드 2025: Parquet, ORC, Apache Arrow, Dremel — 분석 DB가 10,000배 빠른 이유
Snowflake, BigQuery, Spark가 수 TB 데이터를 수 초에 쿼리하는 비결. Parquet의 Dremel 기반 구조, ORC, Apache Arrow의 메모리 포맷, RLE/Dictionary 압축, 벡터화 실행까지 720줄로 완전 분석한다.
2026-04-15 · 40 분 읽기 #columnar-storage#parquet#orc#apache-arrow#dremelApache Spark 내부 완전 가이드 2025: RDD, Catalyst Optimizer, Tungsten, Whole-Stage Codegen, Shuffle 심층 분석
Spark가 같은 쿼리를 MapReduce보다 100배 빠르게 처리하는 비결. RDD부터 DataFrame/Dataset, Catalyst optimizer, Tungsten project, whole-stage code generation, shuffle 최적화까지 720줄로 완전 분석한다.
2026-04-15 · 57 분 읽기 #spark#catalyst#tungsten#rdd#whole-stage-codegen데이터 엔지니어링 입문 — ETL, 데이터 웨어하우스, 스트리밍, 데이터 레이크
데이터 파이프라인은 어떻게 구축하는가? ETL/ELT, 데이터 웨어하우스, 스트리밍, 배치 처리, Spark, Kafka, Airflow까지.
2026-04-13 · 29 분 읽기 #data-engineering-aws#data-engineering#etl#data-warehouse#spark데이터 엔지니어링 파이프라인 완전 가이드 2025: ETL/ELT, Spark, Airflow, 실시간 스트리밍
데이터 엔지니어링의 모든 것! ETL vs ELT, Apache Spark(PySpark), Apache Airflow(DAG/Operator/Sensor), 실시간 스트리밍(Kafka+Flink), dbt(데이터 변환), 데이터 웨어하우스(BigQuery/Snowflake/Redshift), 데이터 품질, 모니터링.
2026-03-25 · 27 분 읽기 #data-engineering#etl#elt#spark#airflowDatabricks AI Engineer (FDE) 합격 가이드: Spark, Unity Catalog, RAG부터 고객 배포까지
Databricks AI Engineer (FDE) JD를 완전 분석합니다. Spark/Delta Lake/Unity Catalog 기술 스택, Lakehouse 아키텍처, RAG 파이프라인 구축, 고객 현장 배포 역량까지 — 면접 예상 질문 25선과 8개월 학습 로드맵.
2026-03-23 · 59 분 읽기 #databricks#fde#spark#delta-lake#unity-catalogApache Spark 실전 운영 가이드: 성능 튜닝, 셔플, 스큐, AQE, 스트리밍 운영
Apache Spark를 프로덕션에서 안정적으로 운영하기 위해 꼭 알아야 할 실행 모델, 셔플과 데이터 스큐, AQE, 캐시 전략, Structured Streaming 운영 체크리스트를 정리합니다.
2026-03-17 · 11 분 읽기 #spark#spark-tuning#data-engineering#shuffle#adaptive-query-executionApache Iceberg 데이터 레이크하우스: 테이블 포맷 혁신과 실전 운영 가이드
Apache Iceberg의 아키텍처와 핵심 기능(Time Travel, Schema Evolution, Partition Evolution)을 분석하고, Spark/Trino 연동과 프로덕션 운영 전략을 다룹니다.
2026-03-14 · 27 분 읽기 #apache-iceberg#data-lakehouse#big-data#hadoop#sparkSpark on YARN 설치 방법
Spark on YARN을 설치하는 법을 알아본다.
2022-11-26 · 7 분 읽기 #hadoop#spark#yarn