태그: #grpo
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
LLM 파인튜닝 프레임워크 2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 심층 가이드
2026년 LLM 파인튜닝 생태계를 한 번에 정리한다. Axolotl·Unsloth·LLaMA-Factory·TRL·PEFT·TorchTune 같은 오픈소스 프레임워크부터 LLM Foundry(MosaicML, Databricks 인수), Modal·Together·OpenAI·Anthropic·Cohere의 클라우드 파인튜닝 API까지. QLoRA·FSDP·DeepSpeed Zero 같은
2026-05-16 · 44 분 읽기 #llm#finetuning#axolotl#unsloth#llama-factoryAI 안전 & 얼라인먼트 2026 완벽 가이드 - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 심층 분석
2026년 AI 안전과 얼라인먼트의 전체 지형을 한 번에 정리한다. outer/inner alignment와 mesa-optimization 같은 개념적 토대부터 RLHF·DPO·GRPO·Constitutional AI로 이어지는 학습 정렬 기법, Anthropic RSP와 OpenAI Preparedness Framework, Google DeepMind Frontier Safety Fra
2026-05-16 · 32 분 읽기 #ai-safety#ai-alignment#constitutional-ai#rlhf#dpo