태그: #flink
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 13 편
스트림 처리 2026 완벽 가이드 - Kafka Streams · Flink SQL · RisingWave · Materialize · Arroyo · ksqlDB · Bytewax · Decodable 심층 분석
2026년 스트림 처리 지형도. Flink 2.0이 Disaggregated State와 Materialized Tables로 라이브러리·DB 경계를 허물고, Kafka Streams 4.0은 Share Groups로 Queue까지 흡수했으며, RisingWave 2.x와 Materialize는 Postgres 와이어 위에서 incremental view를 실시간으로 계산한다. Arroyo는
2026-05-16 · 40 분 읽기 #stream-processing#kafka-streams#flink#risingwave#materialize모던 Hadoop & 빅데이터 생태계 2026 완벽 가이드 - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 심층 분석
2026년 Hadoop과 빅데이터 생태계는 '죽었다'가 아니라 '재배치되었다'. Hadoop 3.4의 Erasure Coding과 Ozone, Spark 4의 ANSI 모드와 Spark Connect, Hive 4의 Iceberg 통합, Kafka 4의 KRaft GA와 tiered storage, Flink 2의 disaggregated state, Iceberg 1.8과 REST 카탈로그
2026-05-16 · 45 분 읽기 #hadoop#spark#hive#kafka#flinkHadoop 생태계 & 데이터 엔지니어링 2026 완벽 가이드 - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 심층 분석
2026년 5월 기준 데이터 엔지니어링 스택을 끝까지 본다. "Hadoop은 죽었다"는 자극적 헤드라인의 진실(HDFS는 줄어들지만 YARN과 레이크하우스 패턴은 살아남았다), Iceberg vs Delta Lake vs Hudi 테이블 포맷 전쟁의 결말, Spark 4.0 + Photon + Spark Connect의 현재, Flink SQL과 CDC의 스트리밍 표준화, Trino 페더레이
2026-05-16 · 42 분 읽기 #hadoop#spark#flink#trino#presto데이터 레이크하우스 & 모던 데이터 엔지니어링 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks 인수) / Trino / Spark 4 / Flink 2 / DataFusion 심층 가이드
2026년의 데이터 엔지니어링은 더 이상 "데이터 웨어하우스 vs 데이터 레이크"의 시대가 아니다. Apache Iceberg가 2024-25년 테이블 포맷 전쟁의 승자로 떠오르면서 Netflix·Apple·LinkedIn·Stripe·Airbnb가 모두 그 위에 모였고, Databricks는 2024년 6월 Iceberg 공동 창시자 Ryan Blue의 Tabular를 $1B 이상으로 인수
2026-05-16 · 48 분 읽기 #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudi피처 스토어 2026 완벽 가이드 - Feast · Tecton · Hopsworks · Databricks · Vertex AI · SageMaker · Featureform · Bytewax · Materialize · RisingWave · Fennel · Chalk 심층 분석
2026년 5월 기준 피처 스토어 시장을 끝까지 본다. Feast(CNCF 샌드박스), Tecton(Eppo 인수 통합), Hopsworks, Vertex AI Feature Store, SageMaker Feature Store, Databricks Feature Engineering in Unity Catalog, Featureform, Bytewax/Feldera/Materialize/
2026-05-16 · 32 분 읽기 #feature-store#feast#tecton#hopsworks#databricks스트림 처리 완전 가이드 2025: Apache Flink, Watermark, Checkpointing, Exactly-Once, Event Time 심층 분석
Apache Flink가 어떻게 수십억 이벤트를 정확히 한 번씩 처리하는가? Watermark, event time, checkpointing, Chandy-Lamport 알고리즘, state backend까지 — 스트림 처리의 모든 것을 720줄로 완전 분석한다.
2026-04-15 · 48 분 읽기 #stream-processing#flink#watermark#checkpointing#exactly-once스트리밍 vs 배치의 재정의: Flink·RisingWave·Materialize, CDC, Streaming SQL, 실시간의 실용주의 (2025)
Season 5 Ep 2. "모든 데이터를 실시간으로"는 2020년의 약속이었다. 2025년은 실용주의의 시대 — 배치와 스트리밍의 경계는 흐려졌고, 진짜 질문은 "이 데이터는 얼마나 신선해야 SLA를 만족하는가"로 바뀌었다. Flink·RisingWave·Materialize·ksqlDB 비교, Kappa/Lambda의 2025년 버전, Iceberg v3 row-level delete와
2026-04-15 · 17 분 읽기 #streaming#batch#flink#risingwave#materializeKafka와 Event-Driven Architecture 완전 해부 — Partition/ISR, Exactly-Once, Outbox, Schema Registry, Flink까지
Kafka를 쓰는 곳은 많지만 내부를 아는 사람은 드물다. 파티션과 Leader/ISR, Log Segment의 물리적 구조, Exactly-Once Semantics의 진실, Transactional Outbox, Event Sourcing vs CDC, Schema Registry, 100ms SLA 달성법까지.
2026-04-15 · 23 분 읽기 #kafka#event-driven#streaming#exactly-once#schema-registry데이터 플랫폼의 현대 — Lakehouse·Iceberg·dbt·Airflow·Dagster·Flink·DuckDB·ClickHouse·Snowflake·Databricks 심층 가이드 (2025)
Hadoop의 무덤 위에 선 2025년 데이터 스택. Lakehouse·Iceberg/Delta/Hudi·dbt/SQLMesh·Airflow vs Dagster vs Prefect·Flink vs Spark Streaming·DuckDB·ClickHouse·Snowflake vs Databricks vs BigQuery·Semantic Layer·Data Contracts·Feature St
2026-04-15 · 19 분 읽기 #data-platform#lakehouse#iceberg#dbt#airflow데이터 엔지니어링 완전 가이드 — Lakehouse·Streaming·dbt·Orchestration·Data Mesh (Season 2 Ep 8, 2025)
데이터 엔지니어링은 더 이상 "ETL 돌리는 일"이 아니다. 2025년의 데이터 엔지니어는 Lakehouse 아키텍처(Iceberg·Delta·Hudi)를 설계하고, Streaming(Flink·Kafka)과 Batch(Spark)를 결합하며, dbt로 데이터 모델링 표준화를 이끌고, Data Mesh로 조직 경계를 재정의하고, Data Contract로 팀 간 인터페이스를 관리한다. 이 글
2026-04-15 · 16 분 읽기 #data-engineering#lakehouse#iceberg#delta-lake#hudiEvent Streaming 심화 가이드 2025: Kafka 내부 구조, Flink, Exactly-Once, 스키마 진화
Event Streaming 심화! Kafka 내부(파티션/세그먼트/ISR/컨트롤러), Consumer Group(리밸런싱/오프셋 관리), Exactly-Once(트랜잭션/멱등성), Schema Registry(Avro/Protobuf 진화), Apache Flink(윈도우/워터마크/상태), Kafka Streams vs Flink.
2026-04-14 · 30 분 읽기 #event-streaming#kafka#flink#exactly-once#schema-registry토스뱅크 Data Engineer (Kafka & Streaming) 합격을 위한 완벽 가이드: 기술스택·면접·공부 로드맵
토스뱅크 Real-Time Data 팀의 Kafka & Streaming Data Engineer JD를 완전 분석합니다. Kafka Broker 운영, Spring Boot Kafka Client, Active-Active 이중화, CDC, Flink, ClickHouse까지 — 합격을 위한 기술스택 학습 로드맵과 면접 준비 전략.
2026-03-21 · 64 분 읽기 #kafka#data-engineering#tossbank#streaming#flink실시간 금융 데이터 파이프라인 구축: Kafka, Flink 스트리밍 아키텍처 실전 가이드
실시간 금융 데이터 파이프라인의 설계와 구현을 다룹니다. Kafka 기반 시장 데이터 수집, Flink 스트림 처리, CDC 연동, 윈도우 집계, 이상 거래 탐지까지 저지연 금융 데이터 아키텍처를 코드와 함께 구축합니다.
2026-03-13 · 22 분 읽기 #finance#kafka#flink#streaming#data-pipeline