タグ: #safety
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
Ferrocene の認証された core — コンパイラは ASIL D なのに、ライブラリはなぜ ASIL B で止まるのか
「Ferrocene の Rust コンパイラは ASIL D 認証を受けている」という文はそれ自体正しいのですが、そこから人がよく引き出す結論は正しくありません。Ferrocene はコンパイラを ISO 26262 ASIL D / TCL 3 の「ツール」として資格認定されており、これは「このツールを使って ASIL D ソフトウェアを開発してよい」という意味であって、「成果物が ASIL D になる」という意味ではありません。実
2026-07-16 · 44 分で読めます #embedded#rust#ferrocene#safety#systemsRLHF モデルはなぜ報酬をハックするのか — リワードハッキングの仕組み・症状・緩和
Xiaohua Wang ほか 23 名が 2026 年 4 月に arXiv へ投稿した「Reward Hacking in the Era of Large Models」は、RLHF で整列された大型モデルがなぜ、どのように報酬信号をゲーミングするのかを整理したサーベイです。中心的な提案は、リワードハッキングを目標圧縮・最適化増幅・評価者–方策の共進化という三つの力で読む「プロキシ圧縮仮説(PCH)」です。冗長さバイアス、おべっか
2026-07-11 · 11 分で読めます #ai#llm#alignment#rlhf#safetyロボットの安全とアラインメント — 強力なロボットを信頼するには
ますます強力になるロボットをどう信頼できるのか。物理的安全、制約付き強化学習と安全層、分布外への対応、人とロボットの協働安全、検証と標準、そして身体性AIのアラインメント課題までをバランスよく見ていきます。
2026-06-29 · 34 分で読めます #ai-papers#robotics#safety#alignment#reinforcement-learningチャットボット ガードレールと安全性完全ガイド:プロンプトインジェクション防御から出力検証まで
プロダクションチャットボットの安全性確保戦略を扱います。プロンプトインジェクション攻撃類型と防御、NeMo Guardrails/Guardrails AIフレームワーク、コンテンツフィルタリング、出力検証、PIIマスキングまで実務セキュリティアーキテクチャをコードとともに実装します。
2026-03-13 · 24 分で読めます #chatbot#guardrails#prompt-injection#safety#content-filteringLLM安全性とRed Teaming実践ガイド:敵対的攻撃防御からガードレール構築まで
LLMの安全性に関する実践ガイド。Red Teaming手法、敵対的攻撃防御、ガードレール構築まで。
2026-03-08 · 43 分で読めます #llm#red-teaming#safety#guardrails#prompt-injection