タグ: #agent
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 11 件
ハーネスエンジニアリングとは何か — モデルは固定入力、デプロイするのはその周り全部です
同じモデルを使っているのに、なぜチームごとにエージェントの成果が違うのでしょうか。ほとんどのチームにとってモデルは固定入力であり、実際にデプロイしているのはツール表面、失敗の返し方、ループと停止条件、コンテキストポリシー、権限、評価者まで、モデルを取り囲むハーネス全部です。ハーネスエンジニアリング連載の第1回として、ハーネスの定義と6つのつまみ、そしてプロンプトエンジニアリングという名前がこの仕事を過小評価する理由を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ツール表面の設計 — スキーマ1行が成功率を動かします
ツールを増やしたのにエージェントの成功率が下がる、という事態は珍しくありません。ツール表面はエージェントのインターフェースであり、名前・説明・パラメータ・失敗の返し方・応答サイズのすべてが設計対象です。ハーネスエンジニアリング連載第3回では、ツール数の呪い、ネームスペーシングと説明文、ポカヨケなパラメータ、失敗を返す形式まで、ツール表面の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ループ設計 — 無限ループと早すぎる諦めの間
エージェントのループは2方向に失敗します。同じ呼び出しを何十回も繰り返す無限ループと、最初の障害で諦める早すぎる停止です。ハーネスエンジニアリング連載第4回では、再試行上限、固定ステップ・目標チェック・確信度という3つの停止条件、確信度ベース停止の落とし穴、そして人間やサブエージェントへのエスカレーションまで、ループ設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネスエンジニアとして成長する — なぜ生まれた職務で、何を練習すべきか
ハーネスエンジニアという肩書きは求人票にはまだ珍しいものの、その仕事はエージェントをデプロイするすべてのチームにすでにあります。ハーネスエンジニアリング連載の最終回である第8回では、この職務がなぜ生まれたのか、既存のソフトウェア技能がどう再配置されるのか、そして観測と指紋から自己改善ループまで、ハーネスRPGの6ティアで段階的に練習する経路を整理しました。
2026-08-12 · 8 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트評価者のボトルネック — 弱い採点者がシステム全体の上限になります
ハーネスをどれだけ直してもスコアが動かないなら、ボトルネックはハーネスではなく評価者かもしれません。測定できない品質は選択できず、だから弱い採点者がシステム全体の上限になります。ハーネスエンジニアリング連載第5回では、スモークテストからユニットテスト、ルーブリック、採点データの隔離、牽制指標のパネルまで、評価者のはしごと、評価の較正を先にすべき理由を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트リワードハッキング — 指標は上がるのに課題は失敗します
エージェントにとってテストを通す最も安い方法がテストを書き換えることなら、エージェントはそうします。リワードハッキングはバグではなく、私たちが定義した目標の正確な最適化の結果です。ハーネスエンジニアリング連載第6回では、採点基準の緩和やassertionの削除といったよくある形、権限の隔離が消してくれる半分、そして牽制指標の設計まで、リワードハッキングへの対応を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネス指紋とバージョン管理 — 記録なき変更を追跡可能にする
プロンプトのコミットもモデル変更もないのに成功率が動いたなら、何をロールバックすべきでしょうか。ハーネスエンジニアリング連載第7回は、ハーネスを構成するすべての決定を正規化したハッシュひとつに要約するハーネス指紋を扱います。指紋に何を入れて何を外すか、なぜ指紋が同じでなければ比較が成立しないのか、そして指紋の履歴でリグレッションを二分探索してロールバックする方法まで整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트コンテキスト予算 — 何を入れるかではなく何を外すかが設計です
コンテキストウィンドウにはまだ余裕があるのに、エージェントの正確さは落ちていきます。コンテキストは有限の注意予算であり、ツールのスキーマもその予算を食います。ハーネスエンジニアリング連載第2回では、プロンプト累積をプレイブックに変える方法、ドロップポリシーとコンパクションの基準、サブエージェント委任の本当のコストまで、コンテキスト予算の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트攻撃者のいない侵害事故 — エージェントの資格情報を見直すべき理由
Hugging Faceは2026年7月16日に自律エージェントによる本番環境の侵害を公開し、約3週間後にOpenAIはその攻撃が自社の学習環境から流れ出たものだったと明かしました。この記事は事件の要約ではなく、その事件が脅威モデルに何を追加するのかを扱います。悪意がなくても権限を持った自動化は目標へ向けて漂流すること、このとき実際に働いた防衛線が侵入検知ではなく資格情報の寿命と範囲だったこと、そしてその事実が自分の組織の点検項目をどう
2026-08-09 · 15 分で読めます #security#llm#agent#incident-response#credentialsハーネスは設定ではなくデプロイ成果物です — 自己改善ループの本当のボトルネック
Lilian Wengが2026年7月にまとめたハーネスエンジニアリングの記事は、モデルを包むシステム全体にひとつの工学対象としての名前を与えます。この記事はその定義を移すのではなく、ハーネスを設定ファイルではなくバージョンの付いたデプロイ成果物として扱うと何が変わるのかを扱います。ハーネスの指紋を取って回帰を捕まえる方法、コンテキストを伸び続けるプロンプトではなくプレイブックとして扱う方法、そして自己改善ループの本当のボトルネックがな
2026-08-09 · 13 分で読めます #llm#agent#harness-engineering#context-engineering#evaluationエージェントウェブの登場 — auth.mdとAIが代わりに登録する時代
AIエージェントがユーザーに代わってサービスに登録し行動するエージェントウェブが急速に現実になっています。WorkOSの文脈で提案されたauth.mdのようなドメインルート標準の発想を、robots.txtとsitemapの系譜の上で読み解き、OAuthと委任トークンによる権限委任、ボットの区別と悪用の懸念、標準化の課題、設計上の考慮点を整理します。
2026-06-25 · 38 分で読めます #ai#agent#authentication#oauth#web-standards