태그: #data-engineering
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 27 편
657,607개의 링크를 따라가 본 결과와 URL 수명 — 링크는 왜 404가 아니라 연결 실패로 죽는가
2009년부터 2014년 사이에 만들어진 단축 링크 65만여 개를 2026년에 전부 따라가 본 조사가 공개됐습니다. 결과보다 중요한 것은 실패의 구성입니다. 죽은 링크의 대부분은 404가 아니라 연결 자체가 되지 않는 상태였고, 이는 내용이 옮겨진 것이 아니라 인프라가 사라졌다는 뜻입니다. 조사 방법의 한계까지 짚은 뒤에, 외부 URL을 데이터로 보관하는 시스템에서 무엇을 다르게 해야 하는지
2026-08-14 · 13 분 읽기 #web#data-engineering#archival#reliability#url-design지금 주목받는 오픈소스 (5) 데이터와 ML 파이프라인
데이터 파이프라인은 스케줄러 하나로 해결되지 않습니다. 적재, 변환, 오케스트레이션, 실행 엔진, 모델 수명 주기, 검색 저장소가 각각 다른 도구의 영역이 되었습니다. 이 층들에서 실제로 쓰이는 오픈소스 11개를 스타 순위가 아니라 담당 구간별로 묶어 소개합니다. 무엇을 대체하는지, 성숙도가 어느 정도인지, 언제 쓰면 안 되는지를 함께 적었고, 저장소 경로와 라이선스, 스타 수, 최근 푸시는
2026-08-12 · 9 분 읽기 #open-source#data-engineering#mlops#python#rust2026년 데이터 도구 지형 읽는 법 — 도구 목록이 아니라 층별 결정으로
2026년 7월 28일 GeekNews에 "개발자를 위한 데이터 도구 지형 가이드"가 올라와 51포인트를 받았습니다. 좋은 지도지만 지도는 목적지를 골라 주지 않습니다. 이 글은 같은 지형을 다섯 개 층으로 나누고, 각 층에서 실제로 내려야 하는 결정이 무엇인지 정리합니다. 테이블 포맷 전쟁이 Iceberg v3에서 사실상 끝나고 싸움이 카탈로그로 옮겨 간 경위, DuckDB급 단일 노드 엔
2026-07-31 · 29 분 읽기 #data-engineering#lakehouse#iceberg#duckdb#data-platformAirflow 2 EOL 이후 — 2에서 3으로 가는 실제 작업 목록, 그리고 3.3까지 온 3.x의 현재
Apache Airflow 2는 2026년 4월 22일에 EOL을 지났고, 이제 보안 패치도 나오지 않는 버전입니다. 그런데 2에서 3으로 가는 길은 pip 업그레이드가 아니라 아키텍처 전환입니다 — 워커의 메타데이터 DB 직접 접근이 사라지고, executiondate 계열 컨텍스트 키가 제거되고, 크론 스케줄의 기본 시맨틱까지 바뀝니다. 이 글은 공식 업그레이드 가이드와 릴리스 노트를 원
2026-07-17 · 27 분 읽기 #data-engineering#airflow#workflow-engine#migrationPySpark 4.2, Python UDF가 기본으로 Arrow를 탄다 — 타입 강제 변환 225칸 중 132칸이 바뀌는 이야기
2026년 7월 14일 릴리스된 Apache Spark 4.2.0은 SPARK-54555로 spark.sql.execution.pythonUDF.arrow.enabled 기본값을 false에서 true로 뒤집었습니다. 벤더 블로그는 이걸 "코드 재작성 없이 더 빠른 컬럼 경로"라고 소개하지만, 정작 릴리스 어디에도 Arrow 대 pickle의 속도 수치는 공개돼 있지 않습니다. 그리고 진짜
2026-07-16 · 27 분 읽기 #spark#python#arrow#data-engineeringParquet 2.13.0의 nan_count와 IEEE 754 total order — float 통계가 3년 3개월 만에 고쳐진 이야기
Parquet의 min/max 통계는 쿼리 엔진이 데이터를 건너뛰게 해 주는 장치입니다. 그런데 부동소수점 컬럼에서는 이 장치가 10년 넘게 미묘하게 고장 나 있었습니다 — NaN은 어떤 비교에서도 false를 내므로 통계에서 배제되는데, 그러면 NaN이 든 페이지가 max보다 큰 값을 찾는 쿼리에서 통째로 스킵될 수 있습니다. 성능 문제가 아니라 결과가 틀리는 문제입니다. 2026년 6월
2026-07-16 · 30 분 읽기 #data-engineering#parquet#columnar-storage#apache-arrowDuckDB에 클라이언트-서버 프로토콜이 생겼다 — Quack이 바꾸는 것과 바꾸지 않는 것
2026년 5월 12일 DuckDB 팀이 Quack을 발표했습니다. HTTP 위에 얹은 클라이언트-서버 프로토콜로, DuckDB 인스턴스 두 개가 서로 클라이언트와 서버가 되어 같은 데이터베이스를 여러 프로세스에서 동시에 읽고 쓸 수 있게 합니다. 7년 동안 "인프로세스"를 정체성으로 내세운 프로젝트가 스스로 서버를 붙인 셈이라, 무엇이 바뀌었는지보다 무엇이 안 바뀌었는지가 더 중요합니다.
2026-07-16 · 31 분 읽기 #database#duckdb#olap#analytics#data-engineeringIceberg v3 로우 리니지 — 행 ID는 파일에 저장되지 않는다
Apache Iceberg 포맷 v3는 모든 행에 안정적인 식별자를 부여하는 로우 리니지를 스펙에 넣었고, 이건 옵션이 아니라 v3 테이블이면 무조건 켜집니다. 그런데 이 값은 데이터 파일에 저장되지 않습니다 — 테이블의 next-row-id에서 스냅샷, 매니페스트, 데이터 파일로 내려오는 상속 체인을 통해 읽는 시점에 계산됩니다. 낙관적 커밋이 재시도될 때 데이터 파일을 다시 쓰지 않기 위
2026-07-16 · 31 분 읽기 #iceberg#lakehouse#table-format#data-engineering#spark문서에서 지식 그래프로 — 정직한 구축 파이프라인
'문서에서 지식 그래프를 뽑는다'는 데모에서는 LLM 호출 한 번처럼 보입니다. 하지만 고객의 문서를 실제로 쿼리 가능한 그래프로 바꾸는 일은 여섯 단계의 파이프라인이고, 비용과 고통의 대부분은 추출이 아니라 엔티티 해소에 있습니다. 이 글은 스키마(온톨로지)를 먼저 정하는 이유, LLM 기반 스키마 제약 추출(LangChain LLMGraphTransformer, LlamaIndex의 Si
2026-07-15 · 19 분 읽기 #knowledge-graph#ai#llm#data-engineeringLLM 학습 데이터 전처리 완전 가이드 — 웹 크롤부터 토큰 패킹까지, 최신 논문과 함께
좋은 모델은 좋은 데이터에서 나오고, 좋은 데이터는 전처리 파이프라인에서 나옵니다. 웹 크롤 수집 → 본문 추출 → 언어 식별 → 휴리스틱·분류기 품질 필터링 → 정확·근사(MinHash) 중복 제거 → PII·독성 처리 → 벤치마크 오염 제거 → 토크나이즈와 시퀀스 패킹까지 사전학습 데이터의 전체 공정을 단계별로 설명하고, SFT 데이터 정제의 요점, datatrove·Dolma·NeMo
2026-07-09 · 13 분 읽기 #ai#llm#data-engineering#preprocessing#trainingDuckDB 실전 — 노트북에서 끝내는 임베디드 분석의 시대
OLAP의 SQLite라 불리는 DuckDB가 왜 이렇게 사랑받는지 아키텍처부터 풀어봅니다. Parquet 직접 쿼리, 윈도우 함수와 PIVOT과 ASOF JOIN 실전 예제, pandas와의 zero-copy 연동, dbt-duckdb 기반 경량 ETL, MotherDuck 하이브리드 실행, 그리고 Postgres와 ClickHouse 대비 선택 가이드까지 정리합니다.
2026-06-12 · 24 분 읽기 #duckdb#database#olap#analytics#parquetHadoop 생태계 & 데이터 엔지니어링 2026 완벽 가이드 - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 심층 분석
2026년 5월 기준 데이터 엔지니어링 스택을 끝까지 본다. "Hadoop은 죽었다"는 자극적 헤드라인의 진실(HDFS는 줄어들지만 YARN과 레이크하우스 패턴은 살아남았다), Iceberg vs Delta Lake vs Hudi 테이블 포맷 전쟁의 결말, Spark 4.0 + Photon + Spark Connect의 현재, Flink SQL과 CDC의 스트리밍 표준화, Trino 페더레이
2026-05-16 · 42 분 읽기 #hadoop#spark#flink#trino#presto데이터 레이크하우스 & 모던 데이터 엔지니어링 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks 인수) / Trino / Spark 4 / Flink 2 / DataFusion 심층 가이드
2026년의 데이터 엔지니어링은 더 이상 "데이터 웨어하우스 vs 데이터 레이크"의 시대가 아니다. Apache Iceberg가 2024-25년 테이블 포맷 전쟁의 승자로 떠오르면서 Netflix·Apple·LinkedIn·Stripe·Airbnb가 모두 그 위에 모였고, Databricks는 2024년 6월 Iceberg 공동 창시자 Ryan Blue의 Tabular를 $1B 이상으로 인수
2026-05-16 · 48 분 읽기 #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudi하둡은 죽었는가 — 빅데이터 스택의 진화, Hadoop에서 Lakehouse까지 (Spark·Iceberg·Delta, 그리고 2026년의 현실)
Hadoop은 죽었는가? 정확히 말하면 '기본값에서 내려왔다.' HDFS·YARN·MapReduce 3종 세트의 시대가 끝나고, Spark가 MR을 갈아치우고, 객체 스토리지가 HDFS를 갈아치우고, 열린 테이블 포맷(Iceberg·Delta·Hudi)이 Hive 메타스토어 시대를 끝냈다. 그 진화의 전 과정을 한 번에 정리한다 — 무엇이 무엇을 대체했고, 어디에 Hadoop이 아직 살아있고
2026-05-14 · 37 분 읽기 #hadoop#big-data#spark#iceberg#delta-lakePolars 1.x vs Pandas — Pandas 시대의 끝인가? Rust·Arrow·lazy 시대의 dataframe 심층 분석 2026
Polars가 1.x로 stable API 약속을 내걸고, Pandas 2.2가 PyArrow backend를 정식 지원하면서 dataframe 세계의 무게중심이 흔들렸다. Polars 1.x는 정말로 Pandas를 대체하는가? Rust + Arrow 아키텍처, lazy evaluation, query optimizer(predicate/projection pushdown, common su
2026-05-14 · 30 분 읽기 #polars#pandas#dataframe#apache-arrow#duckdb레이크하우스 2025 완전 가이드: Iceberg vs Delta vs Hudi, Open Table Format 전쟁, Snowflake·Databricks 합종연횡 (2025)
Season 5 Ep 1. 2024년 Snowflake가 Iceberg를 네이티브 지원하고 Databricks가 Tabular를 $1B+로 인수하면서 "Open Table Format 전쟁"은 끝났다. 남은 건 Iceberg를 어떻게 잘 쓸 것인가. Iceberg·Delta·Hudi 아키텍처 비교, Parquet·ORC·Puffin 내부, 카탈로그 전쟁(Glue/Polaris/Unity/Ne
2026-04-15 · 20 분 읽기 #lakehouse#iceberg#delta-lake#hudi#snowflake데이터 엔지니어링 완전 가이드 — Lakehouse·Streaming·dbt·Orchestration·Data Mesh (Season 2 Ep 8, 2025)
데이터 엔지니어링은 더 이상 "ETL 돌리는 일"이 아니다. 2025년의 데이터 엔지니어는 Lakehouse 아키텍처(Iceberg·Delta·Hudi)를 설계하고, Streaming(Flink·Kafka)과 Batch(Spark)를 결합하며, dbt로 데이터 모델링 표준화를 이끌고, Data Mesh로 조직 경계를 재정의하고, Data Contract로 팀 간 인터페이스를 관리한다. 이 글
2026-04-15 · 16 분 읽기 #data-engineering#lakehouse#iceberg#delta-lake#hudi데이터 엔지니어링 입문 — ETL, 데이터 웨어하우스, 스트리밍, 데이터 레이크
데이터 파이프라인은 어떻게 구축하는가? ETL/ELT, 데이터 웨어하우스, 스트리밍, 배치 처리, Spark, Kafka, Airflow까지.
2026-04-13 · 29 분 읽기 #data-engineering-aws#data-engineering#etl#data-warehouse#spark데이터 엔지니어링 파이프라인 완전 가이드 2025: ETL/ELT, Spark, Airflow, 실시간 스트리밍
데이터 엔지니어링의 모든 것! ETL vs ELT, Apache Spark(PySpark), Apache Airflow(DAG/Operator/Sensor), 실시간 스트리밍(Kafka+Flink), dbt(데이터 변환), 데이터 웨어하우스(BigQuery/Snowflake/Redshift), 데이터 품질, 모니터링.
2026-03-25 · 27 분 읽기 #data-engineering#etl#elt#spark#airflowSnowflake Data Engineer 커리어 가이드: 클라우드 데이터 웨어하우스의 왕좌를 차지한 기술의 모든 것
Snowflake Data Engineer 역할을 완전 분석합니다. Snowflake 아키텍처(스토리지-컴퓨트 분리), Snowpark, Cortex AI, Iceberg 테이블, dbt 연동, 스트리밍(Snowpipe), 비용 최적화 — 면접 질문 20선과 학습 로드맵.
2026-03-23 · 40 분 읽기 #snowflake#data-engineering#data-warehouse#sql#dbt