タグ: #red-teaming
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
AI 安全 / 評価 / レッドチーミング 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 深掘りガイド
2026年のAI安全・評価・レッドチーミング エコシステムを1枚にまとめる。Inspect AI(Anthropic、UK AISI採用)、Garak(NVIDIA→独立)、PyRIT(Microsoft)、Promptfoo(YC)、OpenAI Evals、lm-evaluation-harness(EleutherAI)、そして MLflow Evals・Arize Phoenix・DeepEval(Confident AI)・G
2026-05-16 · 31 分で読めます #ai-safety#red-teaming#evaluation#inspect-ai#garakAI Safety & Alignment 完全ガイド 2025: 責任あるAI、RLHF、Constitutional AI、レッドチーム
AI Safetyの全て!Alignment問題(目標整合)、RLHF/DPO/Constitutional AI、バイアス検出/軽減、ハルシネーション防止、レッドチームテスト、AI Guardrails、解釈可能性(SHAP/LIME)、EU AI Act、企業のResponsible AIフレームワーク。
2026-04-14 · 32 分で読めます #ai-safety#alignment#responsible-ai#rlhf#constitutional-aiLLM安全性とRed Teaming実践ガイド:敵対的攻撃防御からガードレール構築まで
LLMの安全性に関する実践ガイド。Red Teaming手法、敵対的攻撃防御、ガードレール構築まで。
2026-03-08 · 43 分で読めます #llm#red-teaming#safety#guardrails#prompt-injection