태그: #grpo
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
추론 모델은 어떻게 만드는가 — CoT에서 GRPO까지, 논문 열두 편으로 따라가는 계보
o1, R1, QwQ 는 새로운 구조가 아닙니다. 채점 가능한 목표를 향해 긴 출력을 최적화한 결과입니다. Chain-of-Thought(2022)에서 STaR, PRM, DeepSeek-R1 의 GRPO, s1 의 budget forcing 까지 논문 열두 편으로 계보를 따라가고, 마지막에는 24GB 그래픽카드 한 장으로 어디까지 재현할 수 있는지 메모리를 항목별로 계산합니다.
2026-09-06 · 16 분 읽기 #ai#llm#reasoning#reinforcement-learning#grpoLLM 파인튜닝 프레임워크 2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 심층 가이드
2026년 LLM 파인튜닝 생태계를 한 번에 정리한다. Axolotl·Unsloth·LLaMA-Factory·TRL·PEFT·TorchTune 같은 오픈소스 프레임워크부터 LLM Foundry(MosaicML, Databricks 인수), Modal·Together·OpenAI·Anthropic·Cohere의 클라우드 파인튜닝 API까지. QLoRA·FSDP·DeepSpeed Zero 같은
2026-05-16 · 44 분 읽기 #llm#finetuning#axolotl#unsloth#llama-factoryAI 안전 & 얼라인먼트 2026 완벽 가이드 - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 심층 분석
2026년 AI 안전과 얼라인먼트의 전체 지형을 한 번에 정리한다. outer/inner alignment와 mesa-optimization 같은 개념적 토대부터 RLHF·DPO·GRPO·Constitutional AI로 이어지는 학습 정렬 기법, Anthropic RSP와 OpenAI Preparedness Framework, Google DeepMind Frontier Safety Fra
2026-05-16 · 32 분 읽기 #ai-safety#ai-alignment#constitutional-ai#rlhf#dpo