タグ: #agents
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 10 件
AIエージェントを本番で運用するということ — 冪等性、予算、そして自信満々の誤答
エージェントをプロトタイプから本番へ移すとき、遅れて見つかる運用面があります。リトライされたツール呼び出しの冪等性、予算とステップ上限、非決定的な制御フローの可観測性、ツール単位の権限境界、そしてエージェントが自信満々に間違えたときのエスカレーション経路です。最近GeekNewsのAsk GNに投稿された分析は、ベンチマークのトレース6,780件から重複ツール実行8,042件を見つけ、そのうち159件は状態を変えるツールが実際に重複リソ
2026-07-31 · 29 分で読めます #ai#agents#observability#reliability#mcpAIエージェントはプロダクションでどう失敗するのか — 14の失敗モード、そしてリトライが安全ではない理由
エージェントをプロダクションに載せると、3つの場所が痛みます。第一に、失敗はモデルではなくシステム設計から生まれます — UCバークレーのMAST研究は実行トレース1642件を分類して14の失敗モードを抽出し、そのうち44.2%がシステム設計の問題でした。第二に、最も多い2つの失敗モード(ステップ反復15.7%、終了条件の未認識12.4%)が、そのままトークンの請求書になります。第三に、まさにその2つがリトライ/冪等性の問題を生みます
2026-07-17 · 39 分で読めます #ai#agents#observability#reliability#mcpシミュレーションされた顧客は絶対に離脱しない — LLMユーザーシミュレーターがエージェントのスコアを水増しする場所
τ-bench系の対話型エージェントベンチマークでは、「ユーザー」役はもう一つのLLMが務めます。ところがこのシミュレーターは測定対象ではなく測定器具であり、器具は校正を受けなければなりません。2026年に出た3本の検証研究は同じ方向を指しています — シミュレーションされたユーザーは協調的すぎるのです。実在の人間451人でτ-benchプロトコルをそのまま回した研究は、シミュレーターが作る「イージーモード」がエージェントの成功率を人間
2026-07-16 · 41 分で読めます #ai#llm#evaluation#agents#simulationMCPがセッションを取り払う — 2026-07-28リビジョンのステートレスコアを読む
MCP仕様の次のリビジョン2026-07-28は、公開以来もっとも大きな変更です。核心はプロトコル層から状態を取り払うこと — initializeハンドシェイクとMcp-Session-Idセッションが消え、すべてのリクエストがmetaにプロトコルバージョンとクライアント能力を載せて自らを説明します。その代償として、サーバーが聞き返す方式がMRTR(Multi Round-Trip Requests)にひっくり返り、SSE再開(res
2026-07-16 · 30 分で読めます #mcp#ai#protocol#agents#integration2026 年の良いエージェントベンチマークとは — UniClawBench、ライブコンテナ、隠れた監督者
HKU MMLab が 2026 年 7 月に arXiv へ投稿した UniClawBench は、「能力駆動(capability-driven)」を掲げるプロアクティブエージェント向けのベンチマークです。あらかじめ記録された静的な正解と照合する代わりに、ライブの Docker コンテナ内でエージェントを動かし、きめ細かなステップ単位のチェックポイントで採点します。実行者・隠れた監督者・ユーザーエージェントからなる閉ループで多ターン
2026-07-11 · 9 分で読めます #ai#agents#evaluation#benchmark#llmMicrosoft Flint を読む — エージェントがチャートを描くための可視化言語
Microsoft Research が公開した Flint は、エージェントを可視化する言語ではなく、AI エージェントがデータから見栄えの良いチャートを安定して作れるようにする中間言語です。コンパイラがスケール・軸・色・レイアウトといった低レベルの決定をデータとセマンティック型から代わりに導き、ひとつの仕様を Vega-Lite・ECharts・Chart.js へコンパイルします。この記事では Flint が実際に何でどんな問題を
2026-07-11 · 10 分で読めます #ai#agents#data-visualization#llm#microsoftModel Context Protocol(MCP)リファレンス — AIを外部世界につなぐ開かれた標準
Model Context Protocol(MCP)は、アプリケーションがLLMにコンテキストを提供する方法を標準化した開かれたプロトコルです。この記事はMCPが実際に何であるかを公式ドキュメントに基づいて整理したエンジニア向けリファレンスです — なぜM×N統合問題を解くのか、ホスト・クライアント・サーバー構造と2つの層(データ/トランスポート)、3つのサーバープリミティブ(ツール・リソース・プロンプト)、stdioとStreama
2026-07-11 · 11 分で読めます #mcp#ai#agents#llm#protocolステップごとにどれだけ考えるかを選ぶ — Ares の適応的な推論努力ルーティング
Ares(2026年3月のプレプリント)を実務の視点から整理しました。この論文は、推論努力をタスク全体ではなくステップ単位のコストレバーとして扱います。軽量なルーターが相互作用履歴を見て、各ステップに必要な最も低い推論レベルを予測し、すべてのステップを最大努力で回す無駄を減らします。著者はTAU-Bench・BrowseComp-Plus・WebArenaで推論トークンを最大52.7%まで削減し、成功率の低下はわずかだったと報告していま
2026-07-11 · 8 分で読めます #ai#agents#llm#efficiencyコーディングベンチマークはエージェント時代とズレている — リーダーボードがエージェントを誤って比べる三つの理由
Tessl のチームが 2026 年 6 月に arXiv へ投稿したポジション論文は、今日のコーディングベンチマークがエージェント型のソフトウェアエンジニアリングと根本的にズレていると主張します。ベンチマークは個々のモデルを測るために作られたのに、私たちはそれで、モデル・ハーネス・コンテキスト・環境・フィードバックが絡み合ったシステム全体を比べているからです。論文は三つの具体的なズレ — モデルとハーネスをひとまとめにする点数、単一正
2026-07-11 · 11 分で読めます #ai#agents#evaluation#software-engineering#coding-benchmarks効果的なAIエージェントを作る — 5つのワークフローパターンとエージェントのリファレンス
Anthropicのエンジニアリングガイド「Building Effective Agents」を実務リファレンスとして整理しました。ワークフローとエージェントの正確な区別、すべての土台となる増強されたLLM(検索・ツール・メモリ)、そして5つのワークフローパターン(プロンプトチェイニング・ルーティング・並列化・オーケストレーター/ワーカー・エバリュエーター/オプティマイザー)を、それぞれの使いどころと具体例とともに扱います。自律エージ
2026-07-11 · 16 分で読めます #ai#agents#llm#engineering#anthropic