태그: #data-pipeline
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
Mistral OCR 4.1의 블록 단위 신뢰도 점수 — 문서 파이프라인에서 사람을 어디에 넣을지 정하는 값
Mistral이 OCR 4.1을 공개하면서 문단 단위 바운딩 박스와 구조 블록 레이블, 그리고 블록별 신뢰도 점수를 내놓았습니다. 문서 파이프라인을 만들어 본 사람에게 실제로 중요한 것은 셋째입니다. 신뢰도 점수가 있으면 전수 검토와 무검토 사이에 임계값이라는 선택지가 생기기 때문입니다. 그 임계값을 어떻게 정하는지, 신뢰도를 확률로 착각하면 무엇이 깨지는지, 그리고 페이지 단가 기준으로 자
2026-08-14 · 13 분 읽기 #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimizationFeature Store & MLOps 파이프라인 완전 가이드 2025: Feast, Feature Engineering, 모델 서빙
Feature Store와 MLOps의 모든 것! Feature Store 아키텍처(Feast/Tecton/Hopsworks), Feature Engineering 패턴, MLOps 파이프라인(학습→검증→배포→모니터링), 모델 서빙(BentoML/Seldon/TFServing), 모델 레지스트리(MLflow), 드리프트 감지, A/B 테스트.
2026-04-13 · 27 분 읽기 #feature-store#mlops#feast#feature-engineering#model-servingWEKA 고성능 스토리지 완전 가이드 2025: AI/HPC를 위한 병렬 파일시스템
WEKA(WekaFS)의 모든 것! 병렬 파일시스템 아키텍처, NVMe 계층화, GPU Direct Storage, AI/ML 워크로드 최적화, 클라우드(AWS/Azure/GCP) 연동, Ceph/Lustre/GPFS 비교, 데이터 파이프라인, 성능 벤치마크.
2026-03-25 · 34 분 읽기 #weka#wekafs#storage#parallel-filesystem#ai-infrastructure데이터 엔지니어링 파이프라인 완전 가이드 2025: ETL/ELT, Spark, Airflow, 실시간 스트리밍
데이터 엔지니어링의 모든 것! ETL vs ELT, Apache Spark(PySpark), Apache Airflow(DAG/Operator/Sensor), 실시간 스트리밍(Kafka+Flink), dbt(데이터 변환), 데이터 웨어하우스(BigQuery/Snowflake/Redshift), 데이터 품질, 모니터링.
2026-03-25 · 27 분 읽기 #data-engineering#etl#elt#spark#airflow데이터 엔지니어링 & AI 파이프라인: Spark부터 Kafka까지 완전 가이드
AI를 위한 데이터 엔지니어링 완전 가이드. Apache Spark, Kafka, Airflow, dbt, Delta Lake, 피처 스토어까지 대규모 데이터 파이프라인 설계와 구현을 다룹니다.
2026-03-17 · 22 분 읽기 #data-engineering#apache-spark#kafka#airflow#dbt실시간 금융 데이터 파이프라인 구축: Kafka, Flink 스트리밍 아키텍처 실전 가이드
실시간 금융 데이터 파이프라인의 설계와 구현을 다룹니다. Kafka 기반 시장 데이터 수집, Flink 스트림 처리, CDC 연동, 윈도우 집계, 이상 거래 탐지까지 저지연 금융 데이터 아키텍처를 코드와 함께 구축합니다.
2026-03-13 · 22 분 읽기 #finance#kafka#flink#streaming#data-pipeline