タグ: #prompt-injection
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 8 件
ブラウザ・コンピュータを操作するAIエージェントはいまどこまで来たか — ベンチマークの数字が実際に測っているもの
「コンピュータユースエージェントがOSWorldで83.5%を記録した」と「最強のエージェントでも20.6%しか完了できない」は、どちらも2026年に出た事実であり、どちらも正しいのです。前者はOSWorld 1.0、後者は同じチームが作ったOSWorld 2.0です。本稿ではその隔たりがどこから来るのかを、原論文とベンチマーク著者らの自己測定でたどります。OSWorldの課題の半分近くはGUIをほとんど使わずターミナルで解けるというE
2026-07-17 · 44 分で読めます #ai#computer-use#browser-agents#benchmark#prompt-injectionイシュー1件でサプライチェーンの端まで — CI内のエージェントが崩れた経路と、防御が実際に稼いだ時間
2026年6月1日にGMO Flatt SecurityのRyotaKが公開したClaude Code GitHub Actionsの脆弱性は、CIパイプラインに入り込んだエージェントがどのようにしてリポジトリ全体を明け渡す通路になるのかを、最後まで追った事例です。ボット判定の一行が信頼境界を崩し、イシュー本文に仕込まれた指示が命令になり、読み取り専用に見える一つのコマンドが流出チャネルになります。本稿はその経路をアーキテクチャのレベル
2026-07-16 · 39 分で読めます #security#ai#prompt-injection#supply-chain#ci-cdウェブエージェントはページの文章を命令として読む — クロスサイトプロンプトインジェクションとPrismataの封じ込め
2026年7月9日にarXivへ投稿されたPrismata論文(Villa、Ozdarendeli、Tan、Popa)は、自律型ウェブエージェントのもっとも古い弱点を扱います。エージェントは自然言語を命令として解釈するため、ページに混ざった第三者・ユーザー生成コンテンツがそのままエージェントを乗っ取れてしまいます。著者らはこれをCross-Site Scriptingの再来と見ます。Prismataは、ページ構造から信頼を導き、信頼でき
2026-07-11 · 11 分で読めます #prompt-injection#web-agents#ai-security#least-privilege#browser-agentsLLMセキュリティ完全ガイド: Prompt Injection、Jailbreak、Red Team、OWASP LLM Top 10、EU AI Act (2025)
2024–2025年、LLMプロダクトの失敗要因TOP3には必ず「セキュリティ事故」が入る。Prompt injectionの12変種、Jailbreak手法、Data exfiltration、Model extraction、Red teamの自動化(PyRIT/Garak)、OWASP LLM Top 10、EU AI Actと韓国の規制、そしてガードレール設計まで。「デフォルトで安全なLLMプロダクト」の作り方。
2026-04-15 · 17 分で読めます #llm-security#prompt-injection#jailbreak#red-team#owasp-llmAI Engineering 実戦 — LLM API・RAG・Agent・LoRA/DPO・Vector DB・評価・Observability・Prompt Injection (2025)
本番LLM API呼び出しの本当の難しさ、RAGが単純検索ではない理由、Agentパターン (ReAct・Plan-Execute・ReWOO)、Fine-tuning (LoRA・QLoRA・DPO) をいつやり、いつやらないか、Vector DB決定マトリクス、LLM評価が根本的に難しい理由、コスト最適化、そしてPrompt Injection防御まで。デモではなく、本番AIアプリを出荷する方法。
2026-04-15 · 9 分で読めます #ai-engineering#llm#rag#ai-agent#loraAIシステムセキュリティエンジニアリング: プロンプトインジェクションからモデルセキュリティまで
AIシステムセキュリティの完全ガイド。プロンプトインジェクション、ジェイルブレイク、データポイズニング、モデル抽出、プライバシー攻撃、防御戦略を実際の攻撃事例とPythonコードで学びます。
2026-03-17 · 26 分で読めます #ai-security#prompt-injection#llm-security#adversarial-attack#jailbreakチャットボット ガードレールと安全性完全ガイド:プロンプトインジェクション防御から出力検証まで
プロダクションチャットボットの安全性確保戦略を扱います。プロンプトインジェクション攻撃類型と防御、NeMo Guardrails/Guardrails AIフレームワーク、コンテンツフィルタリング、出力検証、PIIマスキングまで実務セキュリティアーキテクチャをコードとともに実装します。
2026-03-13 · 24 分で読めます #chatbot#guardrails#prompt-injection#safety#content-filteringLLM安全性とRed Teaming実践ガイド:敵対的攻撃防御からガードレール構築まで
LLMの安全性に関する実践ガイド。Red Teaming手法、敵対的攻撃防御、ガードレール構築まで。
2026-03-08 · 43 分で読めます #llm#red-teaming#safety#guardrails#prompt-injection