태그: #red-team
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
AI 안전 & 얼라인먼트 2026 완벽 가이드 - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 심층 분석
2026년 AI 안전과 얼라인먼트의 전체 지형을 한 번에 정리한다. outer/inner alignment와 mesa-optimization 같은 개념적 토대부터 RLHF·DPO·GRPO·Constitutional AI로 이어지는 학습 정렬 기법, Anthropic RSP와 OpenAI Preparedness Framework, Google DeepMind Frontier Safety Fra
2026-05-16 · 32 분 읽기 #ai-safety#ai-alignment#constitutional-ai#rlhf#dpoLLM 보안 완전 가이드: Prompt Injection, Jailbreak, Red Team, OWASP LLM Top 10, EU AI Act (2025)
2024–2025년 LLM 제품의 실패 원인 TOP3 안에 항상 "보안 사고"가 들어간다. Prompt injection 12변종, Jailbreak 기법, Data exfiltration, Model extraction, Red team 자동화(PyRIT/Garak), OWASP LLM Top 10, EU AI Act와 한국 규제, 그리고 가드레일 설계까지. "기본값으로 안전한 LLM 제품
2026-04-15 · 17 분 읽기 #llm-security#prompt-injection#jailbreak#red-team#owasp-llm