タグ: #AI에이전트
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 8 件
ハーネスエンジニアリングとは何か — モデルは固定入力、デプロイするのはその周り全部です
同じモデルを使っているのに、なぜチームごとにエージェントの成果が違うのでしょうか。ほとんどのチームにとってモデルは固定入力であり、実際にデプロイしているのはツール表面、失敗の返し方、ループと停止条件、コンテキストポリシー、権限、評価者まで、モデルを取り囲むハーネス全部です。ハーネスエンジニアリング連載の第1回として、ハーネスの定義と6つのつまみ、そしてプロンプトエンジニアリングという名前がこの仕事を過小評価する理由を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ツール表面の設計 — スキーマ1行が成功率を動かします
ツールを増やしたのにエージェントの成功率が下がる、という事態は珍しくありません。ツール表面はエージェントのインターフェースであり、名前・説明・パラメータ・失敗の返し方・応答サイズのすべてが設計対象です。ハーネスエンジニアリング連載第3回では、ツール数の呪い、ネームスペーシングと説明文、ポカヨケなパラメータ、失敗を返す形式まで、ツール表面の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ループ設計 — 無限ループと早すぎる諦めの間
エージェントのループは2方向に失敗します。同じ呼び出しを何十回も繰り返す無限ループと、最初の障害で諦める早すぎる停止です。ハーネスエンジニアリング連載第4回では、再試行上限、固定ステップ・目標チェック・確信度という3つの停止条件、確信度ベース停止の落とし穴、そして人間やサブエージェントへのエスカレーションまで、ループ設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネスエンジニアとして成長する — なぜ生まれた職務で、何を練習すべきか
ハーネスエンジニアという肩書きは求人票にはまだ珍しいものの、その仕事はエージェントをデプロイするすべてのチームにすでにあります。ハーネスエンジニアリング連載の最終回である第8回では、この職務がなぜ生まれたのか、既存のソフトウェア技能がどう再配置されるのか、そして観測と指紋から自己改善ループまで、ハーネスRPGの6ティアで段階的に練習する経路を整理しました。
2026-08-12 · 8 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트評価者のボトルネック — 弱い採点者がシステム全体の上限になります
ハーネスをどれだけ直してもスコアが動かないなら、ボトルネックはハーネスではなく評価者かもしれません。測定できない品質は選択できず、だから弱い採点者がシステム全体の上限になります。ハーネスエンジニアリング連載第5回では、スモークテストからユニットテスト、ルーブリック、採点データの隔離、牽制指標のパネルまで、評価者のはしごと、評価の較正を先にすべき理由を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트リワードハッキング — 指標は上がるのに課題は失敗します
エージェントにとってテストを通す最も安い方法がテストを書き換えることなら、エージェントはそうします。リワードハッキングはバグではなく、私たちが定義した目標の正確な最適化の結果です。ハーネスエンジニアリング連載第6回では、採点基準の緩和やassertionの削除といったよくある形、権限の隔離が消してくれる半分、そして牽制指標の設計まで、リワードハッキングへの対応を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネス指紋とバージョン管理 — 記録なき変更を追跡可能にする
プロンプトのコミットもモデル変更もないのに成功率が動いたなら、何をロールバックすべきでしょうか。ハーネスエンジニアリング連載第7回は、ハーネスを構成するすべての決定を正規化したハッシュひとつに要約するハーネス指紋を扱います。指紋に何を入れて何を外すか、なぜ指紋が同じでなければ比較が成立しないのか、そして指紋の履歴でリグレッションを二分探索してロールバックする方法まで整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트コンテキスト予算 — 何を入れるかではなく何を外すかが設計です
コンテキストウィンドウにはまだ余裕があるのに、エージェントの正確さは落ちていきます。コンテキストは有限の注意予算であり、ツールのスキーマもその予算を食います。ハーネスエンジニアリング連載第2回では、プロンプト累積をプレイブックに変える方法、ドロップポリシーとコンパクションの基準、サブエージェント委任の本当のコストまで、コンテキスト予算の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트