태그: #synthetic-data
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
합성 데이터 생성 2026 완벽 가이드 — Gretel · MOSTLY AI · Tonic · Hazy · Synthea · SDV · Mimesis · Faker · Distilabel · Argilla 심층 분석
2026년 합성 데이터(synthetic data)는 더 이상 "진짜 데이터의 차선책"이 아니다. GDPR/HIPAA의 벽, 불균형 클래스, 희귀 케이스, 그리고 LLM을 학습시키기 위한 수조 토큰의 갈증이 합성 데이터를 1급 시민으로 끌어올렸다. MOSTLY AI가 Gretel을 인수하며 만든 새 지형도, Tonic의 RDBMS 마스킹 스택, MIT가 만든 SDV의 CTGAN/TVAE, 의
2026-05-16 · 46 분 읽기 #synthetic-data#gretel#mostly-ai#tonic#hazyAI 데이터 라벨링·큐레이션 도구 2026 — Label Studio·CVAT·Roboflow·Cleanlab·Argilla·Apify·Firecrawl 심층 비교 (모델보다 데이터가 모델을 만든다)
AI 시스템의 진짜 작업은 모델이 아니라 데이터에서 일어난다. 2026년 현재 데이터 라벨링·큐레이션 도구의 지도를 그린다 — Label Studio(범용 OSS), CVAT(비전), Roboflow(비전 + 오토라벨), Cleanlab(라벨 오류 스캐너), Argilla(HF 텍스트 라벨링), Galileo·Arize Phoenix(LLM eval 데이터 큐레이션), Lilac(데이터셋 인
2026-05-14 · 34 분 읽기 #data-labeling#label-studio#cleanlab#galileo#apifyFine-tuning 완전 가이드: SFT, DPO, LoRA/QLoRA, 합성 데이터, 한국어 모델 (2025)
"Fine-tuning은 죽었다"는 소리도, "RAG로 다 된다"는 소리도 반쯤만 맞다. 2025년 시점에서 SFT/DPO/RLHF의 지형, LoRA·QLoRA로 가볍게 튜닝하는 실전, 합성 데이터 파이프라인, 한국어 모델(Solar, Qwen, Llama) 파인튜닝, 그리고 Fine-tune vs RAG vs Prompt의 경계선을 한 글로 정리합니다.
2026-04-15 · 23 분 읽기 #fine-tuning#llm#ai#lora#qlora데이터 중심 AI(Data-Centric AI) 완전 가이드: 고품질 데이터로 AI 성능 극대화
데이터 중심 AI를 완전히 마스터하는 가이드. 데이터 품질 측정, 레이블 정제, 데이터 증강, 합성 데이터 생성, Cleanlab, 능동 학습, 데이터 플라이휠까지 실전 코드로 배웁니다.
2026-03-17 · 35 분 읽기 #data-centric-ai#data-quality#data-labeling#synthetic-data#ai