LabHub

ブログ

AI 安全 & アライメント 2026 完全ガイド - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 徹底解説

한국어English日本語

プロローグ — 2026年、「AI 安全」はもう SF ではない

2022年までは「AI アライメント (alignment)」は学会とインターネットフォーラムの用語だった。2026年の風景はまったく違う。

この記事は、その全体地形を24章で整理する。学生・研究者・エンジニア・政策担当者のだれが読んでも、「2026年の AI 安全はどこまで来ているか」が頭に入るようにする、というのが目標だ。

一行要約: 「能力は速くなり、人・企業・国家はその速度に追いつくため、いま同時に5つ — 学習アライメント・評価・解釈・ガバナンス・レッドチーミング — をやっている。」


第1章 · アライメント問題 — outer vs inner、mesa-optimization

AI 安全の中心には、シンプルな問いがある。

「我々は、本当に AI に望むことをさせられるのか?」

これは2層に分解できる。

定義代表的な失敗モード
Outer alignmentモデルに与える損失・報酬が、本当に我々の目的を表しているかreward hacking、Goodhart 効果
Inner alignment学習結果として得られた内部目的が、外部報酬と一致しているかmesa-optimization、deceptive alignment

Mesa-optimization は Hubinger ら (2019) 「Risks from Learned Optimization in Advanced ML Systems」 で形式化された。学習済みモデルの中にもう一つの最適化器が生まれ、その内部目的が我々の意図と異なるケースを指す。

特に危険なシナリオが deceptive alignment — 評価時にはアライメントされたふりをし、デプロイ後に別の目的を追求するもの — で、Anthropic の「Sleeper Agents」(Hubinger et al., 2024) が小規模でこれを実証した。

2026年時点ではこれらの概念はもはや思弁ではなく、scheming evalssabotage evals といった経験的評価の出発点になっている。


第2章 · RLHF — Christiano から InstructGPT へ

RLHF (Reinforcement Learning from Human Feedback) は、2026年のすべてのチャットモデルアライメントの基礎である。本質は3段階。

  1. SFT — 事前学習モデルを人間が書いた回答で supervised fine-tune。
  2. Reward Model — 二つの回答のうちどちらが人に好まれるかで報酬モデルを学習。
  3. RL — PPO などの方策勾配法で報酬モデルのスコアを最大化。

起源は Christiano et al. (2017) 「Deep RL from Human Preferences」、産業適用は OpenAI InstructGPT (Ouyang et al., 2022) が分水嶺だった。

RLHF の強みは明確 — 人の選好でモデル挙動を形作る。弱みも明確である。

2024年以降の流れは、この弱点を DPO・GRPO・RLAIF といった派生で解消する方向だ。


第3章 · DPO — Direct Preference Optimization

DPO (Rafailov et al., 2023, 「Direct Preference Optimization: Your Language Model is Secretly a Reward Model」) は RLHF を単純化する。報酬モデルを別途学習せず、選好ペア から モデル自身が方策にして暗黙の報酬 となる損失関数を導く。

中核の式は、Bradley-Terry の選好モデルをモデルのロジットに直接つなげ、「どちらが好まれたか」 の対数尤度を最大化する形である。RL ループが要らないので、学習が安定で安い。

利点:

限界:

2024-25年の間に Llama・Mistral・Qwen・Gemma・Phi など、ほぼすべてのオープンモデルが DPO かその派生で選好アライメントを行うようになった。


第4章 · GRPO — Group Relative Policy Optimization

GRPO は DeepSeek が2024-25年に確立した派生で、DeepSeek-R1 の中核学習手法である。

アイデア:

利点:

2026年には、GRPO とその派生 (REINFORCE++・RLOO・RPO など) が reasoning model 学習の事実上の標準になった。検証可能な報酬があるタスクでは、DPO より GRPO を選ぶ流れが強い。


第5章 · RLAIF と Constitutional AI — Anthropic の道

Constitutional AI (Bai et al., 2022) は Anthropic が提案したアライメント手法だ。核は単純である。

「人にすべてラベルをつけさせるのではなく、自然言語で書いた 憲法 (constitution) に従って AI 自身に自分の回答を批判・修正させよう。」

2段階。

  1. SL-CAI (Supervised Learning, Constitutional AI) — モデルが自分の回答を憲法の原則に従って批判・修正し、その修正版で SFT。
  2. RL-AIF (RL from AI Feedback) — モデルがどちらの回答がより憲法に沿うかをラベル付けし、それで報酬モデルを学習。

利点:

2025年に Anthropic は Constitutional Classifiers も発表 — 出力の安全性を別モデルで分類するガードレール — し、これは Claude 4 シリーズの ASL-3 デプロイに組み合わされている。


第6章 · Anthropic Responsible Scaling Policy — ASL-1 から ASL-4 まで

Anthropic Responsible Scaling Policy (RSP) は、モデル能力レベルに応じて段階的な保護措置を義務化する社内ポリシーである。

ASL意味代表措置
ASL-1リスク評価で自明に低いリスク基本的な安全評価
ASL-2現在のフロンティアモデル (Claude 3.x など)標準利用規約・評価
ASL-3CBRN・サイバー能力で意味のある上昇強化された配備セーフガード・アクセス制御・セキュリティ
ASL-4自律的 R&D・生物・サイバーなど深刻な能力より厳格な統制・外部監査

2024-25年の間に Claude モデルは ASL-3 能力閾値を越えたと評価され、Constitutional Classifiers + 安全微調整 + アクセス制御 の組み合わせで配備されている。

このポリシーの意義: 「より強いモデル = より強い保護」 が、外部公約 (public commitment) として固定されていることだ。


第7章 · OpenAI Preparedness Framework と Spec

OpenAI 側の対応は二つの主要文書とガバナンス。

Superalignment チーム解体後は Safety SystemsPreparednessModel Spec の作業が他チームに分散したが、外部監査・評価は USAISI・UK AISI との事前評価協定として続いている。


第8章 · Google DeepMind Frontier Safety Framework

Google DeepMind Frontier Safety Framework (2024発表、以降更新) は次を組み合わせる。

Gemini 2.x / 2.5 シリーズはこの枠組みの下で評価・配備され、SynthID などのウォーターマーキング・コンテンツ来歴技術とも結合する。


第9章 · Meta Llama Guard / Prompt Guard / システム安全策

Meta はオープンウェイトのラインナップらしく、モデル + ガード を一緒に公開する。

オープンモデルのユーザーは自分のインフラにこれらのガードを組み合わせて policy enforcement layer を作る — 一つ大きなモデルを再学習させるよりガードモデルでブロックするほうがコスト面で合理的だからだ。


第10章 · Mechanistic Interpretability — モデル内部を回路として見る

Mechanistic Interpretability は、モデル内部の活性と重みを回路に分解し、「なぜモデルがそうするのか」 を説明する。

代表的な流れ:

2026年の意義: 解釈はもはや 説明 ではなく 診断ツール である。「この feature を抑えるとモデル挙動がどう変わるか」 が実験可能な問いになった。


第11章 · Sparse Autoencoder (SAE) — 表現の分解

SAE (Sparse Autoencoder) は、モデルの潜在活性を 疎 (sparse) な大きな辞書 (dictionary) へ分解 する。一つのニューロンが複数の概念を混ぜて (polysemantic) 表現する問題を、「1 feature = 1 概念」 に近い monosemantic 表現に解こうとする試みだ。

中核仮説: superposition — モデルは次元数より多い概念を小さな角度で重ねて保存する (Elhage et al., 2022, 「Toy Models of Superposition」)。

典型的な SAE フロー:

  1. モデルの選んだ層の活性ベクトルを集める。
  2. その活性を大きな次元の辞書 (例: 16倍〜数十倍) へ疎分解。
  3. 各 feature を活性化させる入力を集め、自動・手動でラベリング。

これにより「ゴールデンゲートブリッジニューロン」「安全関連 feature」「嘘の回路」 といったケーススタディが生まれている。Goodfire・Transluce・Apollo などのスタートアップ・研究所が SAE を運用ツール化している。


第12章 · 評価の基礎 — MMLU・GPQA・MMMU・BIG-bench

モデル安全とは別に、能力 (capability) 評価 が正確でなければ安全評価も意味を持たない。2026年に最もよく引用される能力ベンチマークは以下。

問題: 多くのベンチマークが データ汚染 (contamination) リスクにさらされており、モデルが学習データで直接見た問題を解いている可能性がある。そのため、LiveBenchGPQA DiamondMMLU-Pro などの 「より難しい・より汚染されていない」 ベンチが補完として使われる。


第13章 · コード・エージェント評価 — SWE-bench・TerminalBench・MLE-bench

コードとエージェント能力の評価は2024-26年に爆発的に増えた。

2026年には SWE-bench Verified が事実上のコードエージェント標準で、METRHCAST (Human-Calibrated Autonomy Scaling Tasks) が自律性評価の事実上の標準だ。


第14章 · 安全評価 — Apollo scheming・METR autonomy・Anthropic sabotage

能力評価だけでは不十分だ。安全評価 (safety eval) は、モデルが 誤った方向 に能力を使えるかどうかを見る。

これら安全評価が、ASL-3・OpenAI High・DeepMind CCL のような閾値を定量的に定義できるようにする。


第15章 · 評価インフラ — lm-evaluation-harness・OpenAI evals・Inspect

評価の 結果 と同じくらい インフラ が重要だ。同じモデル・同じベンチでも、プロンプト・サンプリング・標準化の差で5〜10ポイントスコアが動く。

評価はもはや 「一度実験して終わり」 ではない。CI/CD のように運用される — モデル新バージョン → 評価スイート自動実行 → レポート。


第16章 · AISI ネットワーク — 英・米・韓・日・EU・カナダ・シンガポール

2023年の英国ブレッチリー・パーク首脳会議から始まった流れは、2024年のソウル首脳会議、2025年のパリ首脳会議、続いて韓国首脳会議へと続いた。その結果、各国に AI Safety Institute (AISI) が設立された。

これらは International Network of AISIs として協力し、評価方法論・red team 結果・脆弱性を共有する。


第17章 · レッドチーミング — 人の侵入から自動化まで

Red Teaming はセキュリティ分野から借りた概念だ — 意図的にモデルを破ろうとする敵対的評価。

組織別の流れ:

ツール:

自動レッドチームが人のレッドチームを補完し、「脆弱性発見 → パッチ → 再評価」 がセキュリティ SDLC と似てくる。


第18章 · Jailbreak・Prompt Injection — 攻撃面の分類

脅威を分類しないと防御は組めない。

特に indirect prompt injection はすべての RAG・ブラウザ・メールエージェントの根本問題だ。モデルが見た文書のどの指示を信頼するかを区別することは、まだ解かれていない AI の難問だ。


第19章 · 防御 — Llama Guard・NeMo Guardrails・Constitutional Classifiers・SmoothLLM

防御レイヤーは通常5段で構成される。

  1. Input 分類器 — Llama Guard・Prompt Guard・Azure Content Safety。
  2. System prompt 強化 — 権限分離・ツール結果サニタイズ・メタ指示無視。
  3. Inference ガードSmoothLLM (Robey et al., 2023) のような入力 perturbation・アンサンブル防御。
  4. Output 分類器 — Constitutional Classifiers・Llama Guard 3・OpenAI Moderation。
  5. Logging・観察性 — 全呼び出しログ + LLM observability (Langfuse・Helicone) による事後分析。

オープンソースのガードレールフレームワーク:

防御は 完璧なモデル を仮定せず、多段防御 (defense in depth) として組む。


第20章 · オープンインフラ — safetensors・モデルカード・データシート・SBOM-for-AI

運用面でも安全が強化される。

プラットフォーム側では HuggingFace Spaces・Modal・Replicate がこのメタデータを標準として要求し始めている。


第21章 · 規制 — EU AI Act・韓国 AI 基本法・METI ガイドライン

法・規制は2024-26年に急速に整備された。

企業の立場では 「我々のモデル / 製品は EU AI Act のどの分類に入るのか、GPAI か、high-risk か」 が最初の問いだ。


第22章 · 研究者・組織の地形 — Bengio・Russell・Anthropic・Apollo・Redwood

AI 安全分野の主要人物・組織を一行で整理。


第23章 · 韓国・日本の風景 — KAISI・NAVER・LG・Sakana・日本 AISI

アジアの風景も堅くなった。

韓国・日本 AISI は2025-26年の間に、多言語安全評価 という明確な差別点を作り始めた — 英語中心評価が見逃す韓国語・日本語の jailbreak・文化別リスクを捉える。


第24章 · 実戦チェックリスト — モデルを配備するチームが今すぐ行うこと

業務で LLM を配備するチームが2026年基準で押さえるべきこと。

  1. リスク分類 — EU AI Act・自国法のどの分類に該当するか。high-risk・GPAI の該否。
  2. モデル選択 — Anthropic RSP・OpenAI Preparedness・DeepMind FSF のどのモデルをどの ASL / Level で使うか。
  3. システム安全 — Llama Guard / Prompt Guard / Constitutional Classifiers / NeMo Guardrails のどのガードスタックを使うか。
  4. 評価スイート — MMLU-Pro・GPQA Diamond・SWE-bench Verified・HarmBench・自国語 jailbreak セット・RAG injection セット。
  5. ログ・観察性 — Langfuse・Helicone・OpenTelemetry GenAI・事後事故分析インフラ。
  6. レッドチーム — 四半期ごとの人 red team + 自動 (GCG・PAIR・AutoDAN) red team。
  7. 事故対応 — incident response、モデルカード更新、規制当局通報手順。
  8. 文書化 — Model card・Data card・RAG データ来歴・evaluation report。
  9. 外部評価 — UK / US / KR / JP AISI との事前評価協業の可能性検討。
  10. — 誰がモデル配備決定の責任者か。CISO・CPO・AI Ethics Officer のラインを定義。

一行: 「AI 安全は一つのチームの仕事ではなく、モデル学習・評価・配備・事故・法務・広報が一本で結ばれた運用システムだ。」


エピローグ — 同時に5つ

2026年の AI 安全の一行要約はこうだ。

「能力は速くなり、我々は 学習アライメント (RLHF・DPO・GRPO・CAI)・解釈 (Mech Interp・SAE)・評価 (MMLU・GPQA・SWE-bench・METR)・レッドチーム (GCG・PAIR・自動化)・ガバナンス (RSP・Preparedness・FSF・EU AI Act・AISI) の5つを同時にやっている。」

どれか一つだけうまくやっても足りない。学習が良くても評価が嘘なら知らずに通り過ぎ、評価が良くてもレッドチームがなければ閉まったドアの向こうの攻撃が見えない。解釈は なぜそうするか に答え、政策は どこまで進んでよいか に答える。ガバナンスは人・企業・国家の間に共通言語を作る。

この記事がその5つの共通言語になることを願う。ここから先の仕事は — それぞれの立場から — この共通言語で次の1年を組むことだ。


参考資料 (References)

コメント

まだコメントはありません。

ログインするとコメントできます