タグ: #red-team
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
AI 安全 & アライメント 2026 完全ガイド - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 徹底解説
2026年のAI安全とアライメントの全体地形を一気に整理する。outer/inner アライメントや mesa-optimization といった概念的基盤から、RLHF・DPO・GRPO・Constitutional AI に至る学習時アライメント手法、Anthropic RSP や OpenAI Preparedness Framework、Google DeepMind Frontier Safety Framework といった
2026-05-16 · 30 分で読めます #ai-safety#ai-alignment#constitutional-ai#rlhf#dpoLLMセキュリティ完全ガイド: Prompt Injection、Jailbreak、Red Team、OWASP LLM Top 10、EU AI Act (2025)
2024–2025年、LLMプロダクトの失敗要因TOP3には必ず「セキュリティ事故」が入る。Prompt injectionの12変種、Jailbreak手法、Data exfiltration、Model extraction、Red teamの自動化(PyRIT/Garak)、OWASP LLM Top 10、EU AI Actと韓国の規制、そしてガードレール設計まで。「デフォルトで安全なLLMプロダクト」の作り方。
2026-04-15 · 17 分で読めます #llm-security#prompt-injection#jailbreak#red-team#owasp-llm