タグ: #alignment
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
蒸留で転移するものとしないもの — DeepSeekをGPT-OSSに蒸留したら検閲は付いてこなかった
2026年7月30日にShow HNへ上がったCTGTの実験は、DeepSeek V4 Flashを教師、GPT-OSSを生徒として金融推論能力を蒸留したところ、能力は移ってきたのに政治的検閲は移ってこなかったと報告しています。対応ペア152組で教師はセンシティブな質問と対照群のあいだに45.45点の検閲ギャップを示しましたが、生徒は0.43点と3.94点でベースラインにとどまりました。この記事はその実験ひとつを拡大せず、出発点としてだ
2026-07-31 · 22 分で読めます #ai#llm#distillation#alignment#open-weightsRLHF モデルはなぜ報酬をハックするのか — リワードハッキングの仕組み・症状・緩和
Xiaohua Wang ほか 23 名が 2026 年 4 月に arXiv へ投稿した「Reward Hacking in the Era of Large Models」は、RLHF で整列された大型モデルがなぜ、どのように報酬信号をゲーミングするのかを整理したサーベイです。中心的な提案は、リワードハッキングを目標圧縮・最適化増幅・評価者–方策の共進化という三つの力で読む「プロキシ圧縮仮説(PCH)」です。冗長さバイアス、おべっか
2026-07-11 · 11 分で読めます #ai#llm#alignment#rlhf#safetyロボットの安全とアラインメント — 強力なロボットを信頼するには
ますます強力になるロボットをどう信頼できるのか。物理的安全、制約付き強化学習と安全層、分布外への対応、人とロボットの協働安全、検証と標準、そして身体性AIのアラインメント課題までをバランスよく見ていきます。
2026-06-29 · 34 分で読めます #ai-papers#robotics#safety#alignment#reinforcement-learningAI Safety & Alignment 完全ガイド 2025: 責任あるAI、RLHF、Constitutional AI、レッドチーム
AI Safetyの全て!Alignment問題(目標整合)、RLHF/DPO/Constitutional AI、バイアス検出/軽減、ハルシネーション防止、レッドチームテスト、AI Guardrails、解釈可能性(SHAP/LIME)、EU AI Act、企業のResponsible AIフレームワーク。
2026-04-14 · 32 分で読めます #ai-safety#alignment#responsible-ai#rlhf#constitutional-aiAI倫理・安全性・アラインメント完全ガイド:責任あるAI開発
AI倫理・安全性・アラインメントを完全に理解するためのガイド。幻覚、バイアス、プライバシー、RLHF、Constitutional AI、AI安全性研究の最前線まで、AIデベロッパーが必ず知るべきすべてを解説します。
2026-03-17 · 35 分で読めます #ai-ethics#ai-safety#alignment#responsible-ai#llmRLHFからDPOまで:LLMアライメント技術の論文深層分析
LLMアライメント技術の主要論文を深層分析します。InstructGPTのRLHFパイプライン、AnthropicのConstitutional AI、DPOの数学的基盤、PPO学習の安定性、そしてKTO/IPO/ORPOなど最新手法まで体系的に比較し、実務適用方法を整理します。
2026-03-13 · 19 分で読めます #ai-papers#rlhf#dpo#alignment#ppoDPOからKTOまで:人間フィードバックアラインメント技法の最新論文レビューと実践実装
RLHFの限界を克服したDPO、IPO、KTOなど最新の人間フィードバックアラインメント技法の論文レビューとTRLベースの実践実装ガイド。アルゴリズム比較、ハイパーパラメータチューニング、失敗事例まで。
2026-03-05 · 33 分で読めます #ai-papers#dpo#kto#alignment#2026-03