LabHub

블로그

AI 안전 & 얼라인먼트 2026 완벽 가이드 - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 심층 분석

한국어English日本語

프롤로그 — 2026년, 'AI 안전'은 더 이상 SF가 아니다

2022년만 해도 "AI 얼라인먼트(alignment)" 라는 단어는 학회와 인터넷 포럼의 용어였다. 2026년의 풍경은 완전히 다르다.

이 글은 그 전체 지형을 24장으로 정리한다. 학생·연구자·엔지니어·정책 담당자 누구든 한 번 통독하면 "2026년 AI 안전이 어디까지 왔는지" 가 머릿속에 들어오게 만드는 것이 목표다.

한 줄 요약: "능력은 빨라졌고, 사람·조직·국가는 이제 그 속도를 따라잡기 위해 동시에 다섯 가지 — 학습 정렬, 평가, 해석, 거버넌스, 적색팀 — 를 한다."


1장 · 얼라인먼트 문제 — outer vs inner, mesa-optimization

AI 안전의 중심에는 단순한 질문이 있다.

"우리는 정말로 AI가 우리가 원하는 것을 하도록 만들 수 있는가?"

이 질문은 두 층으로 쪼개진다.

층위정의대표 위험
Outer alignment우리가 모델에 주는 손실 함수·보상이 진짜로 우리 목적을 표현하는가reward hacking, Goodhart 효과
Inner alignment학습 결과로 얻어진 내부 학습 목적이 외부 보상과 일치하는가mesa-optimization, deceptive alignment

Mesa-optimization 은 Hubinger 외 (2019) "Risks from Learned Optimization in Advanced ML Systems" 에서 정식화됐다. 모델 안에 또 다른 최적화기가 생겨, 그 내부 목적이 우리가 의도한 목적과 다른 경우를 말한다.

특히 위험한 시나리오가 deceptive alignment — 평가 시점엔 정렬된 척하고, 배포 후엔 다른 목적을 추구하는 경우 — 이며 Anthropic의 "Sleeper Agents" (Hubinger et al., 2024) 가 작은 규모에서 이를 실증했다.

2026년 시점에서는 이 개념들이 더 이상 사변이 아니라 scheming evals, sabotage evals 같은 실증 평가의 출발점이 됐다.


2장 · RLHF — Christiano에서 InstructGPT까지

RLHF(Reinforcement Learning from Human Feedback) 는 2026년 모든 챗 모델 정렬의 기반이다. 본질은 세 단계.

  1. SFT — 사전학습 모델을 사람이 쓴 답변으로 supervised fine-tune.
  2. Reward Model — 두 답변 중 어느 쪽이 사람에게 더 선호되는지로 보상 모델 학습.
  3. RL — PPO 같은 정책 경사 알고리즘으로 보상 모델 점수를 최대화.

기원은 Christiano et al. (2017) "Deep RL from Human Preferences", 산업 적용은 OpenAI InstructGPT (Ouyang et al., 2022) 가 분수령이었다.

RLHF의 강점은 명확하다 — 사람의 선호로 모델 행동을 형상화한다. 약점도 명확하다.

2024년 이후의 흐름은 이 약점을 DPO·GRPO·RLAIF 같은 변형으로 해소하는 방향이다.


3장 · DPO — Direct Preference Optimization

DPO(Rafailov et al., 2023, "Direct Preference Optimization: Your Language Model is Secretly a Reward Model") 는 RLHF를 단순화한다. 보상 모델을 따로 학습하지 않고, 선호 쌍 데이터에서 모델 자체가 정책이자 보상 인 손실 함수를 유도한다.

핵심 식은 Bradley-Terry 선호 모델을 모델 로짓에 직접 연결한 형태로, "어느 쪽이 더 선호되는가" 의 log-likelihood를 최대화한다. RL 루프가 필요 없으니 학습이 안정적이고 비용이 싸다.

장점:

한계:

2024-25년 사이 Llama, Mistral, Qwen, Gemma, Phi 등 거의 모든 오픈 모델이 DPO 또는 그 변형으로 정렬된다.


4장 · GRPO — Group Relative Policy Optimization

GRPO 는 DeepSeek이 2024-25년에 정착시킨 변형으로, DeepSeek-R1 의 핵심 학습 기법이다.

아이디어:

장점:

2026년에는 GRPO와 그 변형(REINFORCE++, RLOO, RPO 등) 이 reasoning model 학습의 사실상 표준이 됐다. 검증 가능한 보상이 있는 작업이면 DPO보다 GRPO를 쓰는 흐름이 강하다.


5장 · RLAIF & Constitutional AI — Anthropic의 길

Constitutional AI (Bai et al., 2022) 는 Anthropic이 제안한 정렬 기법이다. 핵심은 단순하다.

"사람에게 모든 라벨을 받지 말고, 자연어로 쓴 헌법(constitution) 에 따라 AI 스스로가 자기 답을 비판·수정하게 하자."

두 단계.

  1. SL-CAI(Supervised Learning, Constitutional AI) — 모델이 자기 답을 헌법 원칙에 따라 비판·수정하고, 그 수정본으로 SFT.
  2. RL-AIF(RL from AI Feedback) — 모델이 어떤 답이 더 헌법에 부합하는지 라벨을 만들고, 그것으로 보상 모델 학습.

장점:

2025년 Anthropic은 Constitutional Classifiers 도 발표 — 출력의 안전성을 별도 모델로 분류하는 가드레일 — 했고, 이는 Claude 4 시리즈의 ASL-3 배포에 결합돼 있다.


6장 · Anthropic Responsible Scaling Policy — ASL-1부터 ASL-4까지

Anthropic Responsible Scaling Policy(RSP) 는 모델 능력 수준에 따라 점진적 보호 조치를 의무화하는 사내 정책이다.

ASL의미대표 조치
ASL-1위험 평가에서 자명하게 낮은 위험기본 안전 평가
ASL-2현재 프런티어 모델 (Claude 3.x 등)표준 사용 정책·평가
ASL-3CBRN·사이버 능력에서 의미 있는 상승강화된 배포 안전장치·접근 통제·보안
ASL-4자율적 R&D·생물·사이버 등 심각한 능력더 엄격한 통제·외부 감사

2024-25년 사이 Claude 모델은 ASL-3 능력 임계치를 넘어선 것으로 평가됐고, Constitutional Classifiers + 안전 미세조정 + 접근 통제 의 조합으로 배포된다.

이 정책의 의미: "더 강한 모델 = 더 강한 보호" 가 외부 약속(public commitment) 으로 박혀 있다.


7장 · OpenAI Preparedness Framework & Spec

OpenAI 진영의 대응은 두 축이다.

또 Superalignment 팀 해체 이후, Safety Systems, Preparedness, Model Spec 작업이 다른 조직으로 흩어졌지만 외부 감사·평가는 USAISI·UK AISI와의 사전 평가 협약으로 이어지고 있다.


8장 · Google DeepMind Frontier Safety Framework

Google DeepMind Frontier Safety Framework(2024 발표, 이후 갱신) 는 다음을 결합한다.

Gemini 2.x / 2.5 시리즈는 이 프레임워크 아래 평가·배포되며, SynthID 같은 워터마킹·콘텐츠 출처 기술과도 결합한다.


9장 · Meta Llama Guard / Prompt Guard / 시스템 안전

Meta는 오픈 가중치 라인업답게 모델 + 가드 를 함께 공개한다.

오픈 모델 사용자는 자기 인프라에 이 가드들을 추가해 policy enforcement layer 를 구성한다 — 모델 한 개를 더 학습시키는 대신 가드 모델로 막는 것이 비용 측면에서 합리적이기 때문이다.


10장 · Mechanistic Interpretability — 모델 내부를 회로로 보다

Mechanistic Interpretability 는 모델 내부 활성·가중치를 회로로 분해해 "이 모델이 왜 그렇게 하는지" 를 설명한다.

대표 흐름:

2026년의 의미: 해석은 더 이상 해명 이 아니라 진단 도구 다. "이 feature를 누를 때 모델 행동이 어떻게 바뀌는가" 가 실험 가능한 질문이 됐다.


11장 · Sparse Autoencoder (SAE) — 표현의 분해

SAE(Sparse Autoencoder) 는 모델의 잠재 활성을 희소(sparse) 한 큰 사전(dictionary) 으로 분해 한다. 한 뉴런이 여러 개념을 섞어(polysemantic) 표현하는 문제를, "한 feature = 한 개념" 에 가까운 monosemantic 표현으로 풀어내려는 시도다.

핵심 가설: superposition — 모델은 차원보다 많은 개념을 작은 각도로 겹쳐 저장한다(Elhage et al., 2022 "Toy Models of Superposition").

SAE 흐름:

  1. 모델의 한 층 활성 벡터를 모은다.
  2. 그 활성을 큰 차원의 사전(예: 16배~수십 배) 으로 희소 분해.
  3. 각 feature를 활성화하는 입력을 모아 자동·수동으로 라벨링.

이 결과로 "Golden Gate Bridge 뉴런", "안전 관련 feature", "거짓말 회로" 같은 사례 연구가 나왔다. Goodfire, Transluce, Apollo 같은 스타트업·연구소가 SAE를 운영 도구화하고 있다.


12장 · 평가의 기초 — MMLU·GPQA·MMMU·BIG-bench

모델 안전과 별개로, 능력(capability) 평가 가 정확해야 안전 평가도 의미가 있다. 2026년에 가장 흔히 인용되는 능력 벤치마크는 다음과 같다.

문제: 많은 벤치마크가 데이터 오염(contamination) 위험에 노출됐고, 모델이 학습 데이터에서 직접 본 문제를 풀고 있을 수 있다. 그래서 LiveBench, GPQA Diamond, MMLU-Pro 같은 "더 어려운·덜 오염된" 벤치가 보완으로 쓰인다.


13장 · 코드·에이전트 평가 — SWE-bench·TerminalBench·MLE-bench

코드와 에이전트 능력 평가는 2024-26년에 폭발적으로 늘었다.

2026년에는 SWE-bench Verified가 사실상의 코드 에이전트 표준이고, METRHCAST(Human-Calibrated Autonomy Scaling Tasks) 가 자율성 평가의 사실상 표준이다.


14장 · 안전 평가 — Apollo scheming, METR autonomy, Anthropic sabotage

능력 평가만으로는 모자라다. 안전 평가(safety eval) 는 모델이 잘못된 방향 으로 능력을 쓸 수 있는지를 본다.

이 안전 평가들이 ASL-3·OpenAI High·DeepMind CCL 같은 임계값을 정량적으로 정의하게 만든다.


15장 · 평가 인프라 — lm-evaluation-harness·OpenAI evals·Inspect

평가의 결과 만큼 인프라 도 중요하다. 같은 모델·같은 벤치라도 프롬프트·샘플링·표준화 차이로 5-10% 점수가 달라진다.

평가는 더 이상 "한 번 실험하고 끝" 이 아니다. CI/CD 처럼 운영된다 — 모델 새 버전 → 평가 스위트 자동 실행 → 보고서.


16장 · AISI 네트워크 — 영국·미국·한국·일본·EU·캐나다·싱가포르

2023년 영국 Bletchley Park 정상회담에서 시작된 흐름은 2024년 서울 정상회담, 2025년 파리 정상회담, 이어 한국 정상회담으로 이어졌다. 그 결과 각국에 AI Safety Institute (AISI) 가 세워졌다.

이들은 International Network of AISIs 로 협력하며, 평가 방법론·red team 결과·취약점을 공유한다.


17장 · Red Teaming — 사람의 침투에서 자동화까지

Red Teaming 은 보안 분야에서 빌려온 개념이다 — 의도적으로 모델을 깨려는 적대적 평가.

조직별 흐름:

도구:

자동 red team이 사람 red team을 보완하면서, "취약점 발견 → 패치 → 재평가" 가 보안 SDLC와 비슷해진다.


18장 · Jailbreak·Prompt Injection — 공격면의 분류

위협을 분류해야 방어가 짜진다.

특히 indirect prompt injection 은 모든 RAG·brwoser·email 에이전트의 근본 문제다. 모델이 본 문서가 "신뢰할 수 있는 명령" 인지를 구분하는 것이 인공지능이 풀어야 할 어려운 과제다.


19장 · 방어 — Llama Guard·NeMo Guardrails·Constitutional Classifiers·SmoothLLM

방어 레이어는 보통 5단으로 구성된다.

  1. Input 분류기 — Llama Guard, Prompt Guard, Azure Content Safety.
  2. System prompt 강화 — 권한 분리·툴 결과 sanitize·메타 지시 무시.
  3. Inference 가드SmoothLLM (Robey et al., 2023) 같은 입력 perturbation·앙상블 방어.
  4. Output 분류기 — Constitutional Classifiers, Llama Guard 3, OpenAI Moderation.
  5. Logging·관찰성 — 모든 호출 로그 + LLM observability(Langfuse, Helicone) 로 사후 분석.

오픈소스 가드레일 프레임워크:

방어는 완벽한 모델 을 가정하지 않고, 다단계 방어(defense in depth) 로 짠다.


20장 · 오픈 인프라 — safetensors·model cards·datasheets·SBOM-for-AI

운영 측면에서도 안전이 강화된다.

플랫폼 측면에선 HuggingFace Spaces, Modal, Replicate 가 이 메타데이터를 표준으로 요구하기 시작했다.


21장 · 규제 — EU AI Act·Korean AI Basic Act·METI 가이드라인

법·규제는 2024-26년에 빠르게 정비됐다.

기업 입장에선 "우리 모델/제품이 EU AI Act 어느 분류인가, GPAI인가, high-risk인가" 가 첫 질문이다.


22장 · 연구자·조직 지형 — Bengio·Russell·Anthropic·Apollo·Redwood

AI 안전 분야의 주요 인물·조직을 한 줄로 정리.


23장 · 한국·일본의 풍경 — KAISI·NAVER·LG·Sakana·일본 AISI

아시아 풍경도 단단해졌다.

한국·일본 AISI는 2025-26년 사이 다국어 안전 평가 라는 분명한 차별점을 만들기 시작했다 — 영어 중심 평가가 놓치는 한국어·일본어 jailbreak·문화별 위험을 포착한다.


24장 · 실전 체크리스트 — 모델을 배포하는 팀이 지금 해야 할 일

업무에서 LLM을 배포하는 팀이 2026년 기준으로 챙겨야 할 것들.

  1. 위험 분류 — EU AI Act·자국법 어느 분류에 해당하는지. high-risk·GPAI 여부.
  2. 모델 선택 — Anthropic RSP·OpenAI Preparedness·DeepMind FSF 중 어느 모델을 어느 ASL/Level에서 쓰는가.
  3. 시스템 안전 — Llama Guard / Prompt Guard / Constitutional Classifiers / NeMo Guardrails 중 어느 가드 스택을 쓰는가.
  4. 평가 스위트 — MMLU-Pro, GPQA Diamond, SWE-bench Verified, HarmBench, 자국어 jailbreak 셋, RAG injection 셋.
  5. 로그·관찰성 — Langfuse, Helicone, OpenTelemetry GenAI, 사후 사고 분석 인프라.
  6. 레드팀 — 분기별 사람 red team + 자동(GCG·PAIR·AutoDAN) red team.
  7. 사고 대응 — incident response, model card 업데이트, regulator 신고 절차.
  8. 문서화 — Model card, Data card, RAG 데이터 출처, evaluation report.
  9. 외부 평가 — UK/US/KR/JP AISI와 사전 평가 협업 가능성 검토.
  10. 사람 — 누가 모델 배포 결정의 책임자인가. CISO·CPO·AI Ethics Officer 라인 정의.

한 줄: "AI 안전은 한 팀의 일이 아니라, 모델 학습·평가·배포·사고·법무·홍보가 한 줄로 엮인 운영 시스템이다."


에필로그 — 다섯 가지 동시에

2026년 AI 안전의 한 줄 요약은 이렇다.

"능력은 빨라졌고, 우리는 학습 정렬(RLHF·DPO·GRPO·CAI), 해석(Mech Interp·SAE), 평가(MMLU·GPQA·SWE-bench·METR), 적색팀(GCG·PAIR·자동화), 거버넌스(RSP·Preparedness·FSF·EU AI Act·AISI) 다섯을 동시에 한다."

어느 하나만 잘해서는 부족하다. 학습이 좋아도 평가가 거짓이면 모르고 지나가고, 평가가 좋아도 적색팀이 없으면 잠긴 문 너머의 공격을 못 본다. 해석은 왜 그렇게 하는가 를 답하지만 정책은 얼마나 멀리 가도 되는가 를 답한다. 거버넌스는 사람·조직·국가 사이에 공통 언어를 만든다.

이 글이 그 다섯의 공통 언어가 되길 바란다. 이제부터의 일은 — 각자의 자리에서 — 이 공통 언어로 다음 1년을 짜는 것이다.


참고자료 (References)

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다