태그: #kafka
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 34 편
데이터 저장소와 큐의 세대교체 — 라이선스, 포크, 그리고 Attic으로 간 프로젝트들
데이터 계층에서 자리를 내주었거나 배포 조건이 바뀐 프로젝트 10개를 공식 발표문과 Apache Attic 기록만 근거로 정리합니다. Redis와 Elasticsearch, MongoDB의 라이선스 변경과 그로 인해 생긴 Valkey, OpenSearch 포크를 사실만으로 다루고, Kafka에서 ZooKeeper가 빠진 과정, Apache Attic으로 이관된 Sqoop과 Oozie, Gir
2026-08-12 · 18 분 읽기 #open-source#database#kafka#redis#elasticsearch국내 개발 블로그 명글 큐레이션 1 — 백엔드와 인프라, 직접 열어 확인한 14편
한국어로 쓰인 백엔드와 인프라 글 중에서 설명이 구체적이고 재현 가능한 14편을 골라 소개합니다. Istio의 Sidecar와 ServiceEntry, Envoy의 서킷 브레이커와 라우팅, 프로메테우스 푸시 게이트웨이의 한계, JVM 메모리 구조와 GC, 클래스 패스 섀도잉, 카프카 파티션 증설 시 컨슈머 설정, 리눅스 서버를 60초 안에 파악하는 순서, HTTP Keep-Alive와 TCP
2026-08-12 · 24 분 읽기 #curation#큐레이션#backend#infra#istioKafka Diskless Topics(KIP-1150) — 크로스 AZ 비용과 맞바꾸는 지연 시간, 그리고 아직 배송되지 않은 기능
2026년 3월 2일, Apache Kafka 커뮤니티가 KIP-1150 Diskless Topics를 승인했습니다. 브로커 디스크 대신 오브젝트 스토리지를 데이터의 원본으로 삼아, 하이퍼스케일러에서 Kafka 비용의 큰 축인 크로스 AZ 복제 트래픽을 없애겠다는 제안입니다. 다만 승인된 것은 방향이지 구현이 아니고 — KIP 본문이 "이 KIP는 승인되더라도 코드 변경을 요구하지 않는다"고
2026-07-16 · 32 분 읽기 #kafka#streaming#distributed-systems#cloud-native결정론적 시뮬레이션 테스트가 찾은 버그 — KAFKA-19880, 그리고 "버그 0건"을 읽는 법
결정론적 시뮬레이션 테스트(DST)는 클럭, 스레드 인터리빙, 난수처럼 비결정성이 흘러 들어오는 출처를 시뮬레이터 안에 가두어, 재현이 안 되던 heisenbug를 시드 하나로 다시 불러올 수 있게 만드는 기법입니다. 2026년 3월 Aiven은 Kafka의 Diskless Topics 구현체를 Antithesis에 넣고 약 2,200 논리 시간을 돌렸고, 결과는 버그 0건이었습니다. 정작
2026-07-16 · 32 분 읽기 #testing#deterministic-simulation-testing#distributed-systems#kafka#antithesis메시지 큐 & 비동기 입문: Queue·Kafka·RabbitMQ·Redis·asyncio 한눈에
평범한 FIFO 큐부터 Kafka의 파티션 로그, RabbitMQ의 익스체인지·라우팅, Redis의 리스트·Pub/Sub·Streams, 그리고 파이썬 asyncio의 이벤트 루프까지. 메시지 큐와 비동기의 핵심 개념을 하나씩 대조하며 정리하고, 언제 무엇을 쓸지 비교표로 짚습니다.
2026-07-03 · 20 분 읽기 #message-queue#kafka#rabbitmq#redis#asyncio변신 — 카프카가 그린 부조리와 소외
어느 날 아침 벌레로 변한 한 남자의 이야기. 카프카의 변신을 통해 현대인의 소외와 부조리, 가족과 노동의 의미, 그리고 짧지만 깊은 이 작품이 여전히 우리에게 던지는 질문을 살펴봅니다.
2026-07-02 · 32 분 읽기 #literature#kafka#the-metamorphosis#absurdism#classic-review모던 Hadoop & 빅데이터 생태계 2026 완벽 가이드 - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 심층 분석
2026년 Hadoop과 빅데이터 생태계는 '죽었다'가 아니라 '재배치되었다'. Hadoop 3.4의 Erasure Coding과 Ozone, Spark 4의 ANSI 모드와 Spark Connect, Hive 4의 Iceberg 통합, Kafka 4의 KRaft GA와 tiered storage, Flink 2의 disaggregated state, Iceberg 1.8과 REST 카탈로그
2026-05-16 · 45 분 읽기 #hadoop#spark#hive#kafka#flinkHadoop 생태계 & 데이터 엔지니어링 2026 완벽 가이드 - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 심층 분석
2026년 5월 기준 데이터 엔지니어링 스택을 끝까지 본다. "Hadoop은 죽었다"는 자극적 헤드라인의 진실(HDFS는 줄어들지만 YARN과 레이크하우스 패턴은 살아남았다), Iceberg vs Delta Lake vs Hudi 테이블 포맷 전쟁의 결말, Spark 4.0 + Photon + Spark Connect의 현재, Flink SQL과 CDC의 스트리밍 표준화, Trino 페더레이
2026-05-16 · 42 분 읽기 #hadoop#spark#flink#trino#presto분산 메시징 2026 — Kafka 3.9 / NATS / Redpanda / Pulsar / RabbitMQ 4 / WarpStream 심층 비교
2026년 분산 메시징 지형도. Kafka 3.9는 KRaft가 기본이 되었고 ZooKeeper는 사라졌다. WarpStream은 S3 위에 Kafka API를 올렸고 Confluent에 인수됐다. Redpanda는 C++로 Kafka 호환을 밀고, NATS는 JetStream/KV/ObjectStore로 단일 인프라가 되었으며, Pulsar 4.0은 Functions로 스트림 위에서 코드를
2026-05-15 · 30 분 읽기 #messaging#distributed-systems#kafka#nats#redpanda마이크로서비스 통신 패턴 완전 가이드 2025: REST vs gRPC vs 비동기 메시징, Saga, Outbox
마이크로서비스 통신의 모든 것! 동기 vs 비동기 패턴, REST vs gRPC vs GraphQL, Kafka 이벤트 드리븐, Saga 패턴(Choreography vs Orchestration), Outbox 패턴, 분산 트랜잭션, 멱등성, 회복탄력성 패턴(Circuit Breaker, Retry, Bulkhead).
2026-04-15 · 19 분 읽기 #microservices#communication#rest#grpc#kafkaZero-Copy & Linux I/O 완전 가이드 2025: sendfile, splice, mmap, Page Cache, O_DIRECT — Kafka/Nginx/Netflix 실전 분석
Kafka가 초당 수백만 메시지를 처리하고 Netflix가 단일 서버로 수십 Gbps를 뿜어내는 비결, zero-copy I/O를 완전 분석한다. read/write, sendfile, splice, mmap, ODIRECT까지 — 이론과 실전을 720줄로 깊이 있게 다룬다.
2026-04-15 · 34 분 읽기 #zero-copy#linux#sendfile#splice#mmap스트리밍 vs 배치의 재정의: Flink·RisingWave·Materialize, CDC, Streaming SQL, 실시간의 실용주의 (2025)
Season 5 Ep 2. "모든 데이터를 실시간으로"는 2020년의 약속이었다. 2025년은 실용주의의 시대 — 배치와 스트리밍의 경계는 흐려졌고, 진짜 질문은 "이 데이터는 얼마나 신선해야 SLA를 만족하는가"로 바뀌었다. Flink·RisingWave·Materialize·ksqlDB 비교, Kappa/Lambda의 2025년 버전, Iceberg v3 row-level delete와
2026-04-15 · 17 분 읽기 #streaming#batch#flink#risingwave#materialize메시지 큐와 이벤트 스트리밍 완전 비교 — Kafka, RabbitMQ, NATS, Pulsar, SQS, Redis Streams, CDC, Schema Registry 심층 가이드 (2025)
메시지 큐와 이벤트 스트림의 근본 차이, Kafka 내부(파티션/세그먼트/ISR/KRaft), RabbitMQ의 유연한 라우팅, NATS JetStream의 가벼움, Pulsar의 지오리플리케이션, SQS/SNS/Kinesis/EventBridge 비교, Redis Streams의 실무, CDC(Debezium)의 실전, Avro/Protobuf 스키마 진화, Event-Driven의 함정까
2026-04-15 · 21 분 읽기 #kafka#rabbitmq#nats#pulsar#sqsKafka와 Event-Driven Architecture 완전 해부 — Partition/ISR, Exactly-Once, Outbox, Schema Registry, Flink까지
Kafka를 쓰는 곳은 많지만 내부를 아는 사람은 드물다. 파티션과 Leader/ISR, Log Segment의 물리적 구조, Exactly-Once Semantics의 진실, Transactional Outbox, Event Sourcing vs CDC, Schema Registry, 100ms SLA 달성법까지.
2026-04-15 · 23 분 읽기 #kafka#event-driven#streaming#exactly-once#schema-registryApache Kafka 내부 구조 완전 가이드 2025: Partitions, Replication, ISR, KRaft, Tiered Storage
Kafka의 내부 구조! 파티션과 세그먼트 파일, ISR(In-Sync Replica), Replication 메커니즘, KRaft (ZooKeeper 대체), Exactly-Once Semantics, Consumer Group rebalance, Tiered Storage, 운영 베스트 프랙티스.
2026-04-15 · 19 분 읽기 #kafka#streaming#partitions#replication#isr데이터 엔지니어링 완전 가이드 — Lakehouse·Streaming·dbt·Orchestration·Data Mesh (Season 2 Ep 8, 2025)
데이터 엔지니어링은 더 이상 "ETL 돌리는 일"이 아니다. 2025년의 데이터 엔지니어는 Lakehouse 아키텍처(Iceberg·Delta·Hudi)를 설계하고, Streaming(Flink·Kafka)과 Batch(Spark)를 결합하며, dbt로 데이터 모델링 표준화를 이끌고, Data Mesh로 조직 경계를 재정의하고, Data Contract로 팀 간 인터페이스를 관리한다. 이 글
2026-04-15 · 16 분 읽기 #data-engineering#lakehouse#iceberg#delta-lake#hudiCDC (Change Data Capture) 완전 가이드 2025: Debezium, Kafka, 데이터 동기화, Outbox 패턴
CDC의 모든 것! 동작 원리(WAL/binlog 기반), Debezium 아키텍처, PostgreSQL Logical Replication, MySQL binlog, Outbox 패턴, 데이터 웨어하우스 동기화, Kafka 통합, 마이그레이션, 흔한 함정.
2026-04-15 · 17 분 읽기 #cdc#debezium#kafka#postgresql#mysqlEvent Streaming 심화 가이드 2025: Kafka 내부 구조, Flink, Exactly-Once, 스키마 진화
Event Streaming 심화! Kafka 내부(파티션/세그먼트/ISR/컨트롤러), Consumer Group(리밸런싱/오프셋 관리), Exactly-Once(트랜잭션/멱등성), Schema Registry(Avro/Protobuf 진화), Apache Flink(윈도우/워터마크/상태), Kafka Streams vs Flink.
2026-04-14 · 30 분 읽기 #event-streaming#kafka#flink#exactly-once#schema-registry데이터 엔지니어링 입문 — ETL, 데이터 웨어하우스, 스트리밍, 데이터 레이크
데이터 파이프라인은 어떻게 구축하는가? ETL/ELT, 데이터 웨어하우스, 스트리밍, 배치 처리, Spark, Kafka, Airflow까지.
2026-04-13 · 29 분 읽기 #data-engineering-aws#data-engineering#etl#data-warehouse#spark데이터 엔지니어링 파이프라인 완전 가이드 2025: ETL/ELT, Spark, Airflow, 실시간 스트리밍
데이터 엔지니어링의 모든 것! ETL vs ELT, Apache Spark(PySpark), Apache Airflow(DAG/Operator/Sensor), 실시간 스트리밍(Kafka+Flink), dbt(데이터 변환), 데이터 웨어하우스(BigQuery/Snowflake/Redshift), 데이터 품질, 모니터링.
2026-03-25 · 27 분 읽기 #data-engineering#etl#elt#spark#airflow