LabHub

ブログ

LLM 可観測性 & プロンプトツール 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 徹底比較

한국어English日本語

プロローグ — 「LLM を立ち上げるのは簡単になった。運用するのが難しい」

2024年までは LLM を本番に乗せること自体が珍しいことだった。2026年5月、それはもう普通の出来事になった。OpenAI · Anthropic · Google · Mistral · DeepSeek · 韓国の HyperCLOVA X · 日本の Sakana · NTT つづみ — いずれも API 一本で呼べる。本当の難しさはその先にある。

この 5 つの問いが 2026 年の LLM ops のすべてだ。そして過去 2 年でこの問いそれぞれに答えるためのツールが一気に増えた。Helicone · LangSmith · Langfuse · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik · Vellum · PromptHub · Portkey · TruLens · Ragas · DeepEval · Galileo · Patronus AI · OpenAI Evals · Bedrock Evals · Vertex AI Evaluation Service — タイトルに並んだツール群がそれだ。

本稿は 2026 年 5 月時点の LLM ops 地図を描く。4 つの領域 (可観測性 · 評価 · プロンプト管理 · ゲートウェイ) に分類し、各ツールの強み・弱み・価格モデル・実際の現場事例を押さえる。最後に個人開発者・スタートアップ・エンタープライズ・RAG 優先組織の 4 つのペルソナで「何を選ぶべきか」を示す。


1章 · 2026 年の LLM ops 地図 — 4 領域分類

まず全体像。

4 領域 — 可観測性 / 評価 / プロンプト管理 / ゲートウェイ

LLM ops ツールは機能が重なり合うが、主要な価値提案で見ると 4 領域に分類できる。

領域何をするか代表的なツール
可観測性すべての LLM 呼び出しをトレース / トークン・遅延・コスト・エラー監視 / デバッグHelicone, LangSmith, Langfuse, W&B Weave, Arize Phoenix, Comet Opik
評価モデル出力の品質をデータセット・メトリック・LLM-as-judge で自動測定Braintrust, Athina, Ragas, TruLens, DeepEval, Galileo, Patronus AI
プロンプト管理プロンプトのバージョン管理 / A·B テスト / 非エンジニア協業 / デプロイVellum, PromptHub, LangSmith Prompts, Langfuse Prompts
ゲートウェイOpenAI / Anthropic / Bedrock など複数プロバイダのルーティング・キャッシュ・rate limit・fallbackPortkey, LiteLLM, Cloudflare AI Gateway

ほとんどのツールが領域をまたぐ。LangSmith は可観測性も評価もプロンプトもやる。Langfuse も同じ。Portkey はゲートウェイが本業だが可観測性もやる。比較を難しくしている最大の理由がこの重なりだ。

2024 → 2026 の変化

2024 年初頭まで LangSmith が事実上唯一の選択肢だった。その後の 2 年間で市場が爆速で分化した。

OpenTelemetry の台頭 — GenAI semantic conventions

2025 年後半に決定的な変化があった。OpenTelemetry の GenAI semantic conventions が事実上の標準になり、Langfuse · Phoenix · Helicone · Portkey · LangSmith がすべて OTel ベースの SDK を提供し始めた。つまり SDK は一度入れたらバックエンドは差し替え可能 になった。これが今後 5 年の LLM ops で最大の変化だ。


2章 · Helicone — Y Combinator の OSS 可観測性

まず最速で始められるツールから。

一行定義

Y Combinator W23 出身、OSS の LLM 可観測性。base URL を一行変えるだけ。 業界最低の参入障壁。

どう動くか

Helicone の最大の特徴は プロキシモード だ。OpenAI SDK の base_urlhttps://oai.helicone.ai/v1 に変えるだけで、すべての呼び出しが自動記録される。たった一行。

from openai import OpenAI

client = OpenAI(
    base_url="https://oai.helicone.ai/v1",
    default_headers={"Helicone-Auth": f"Bearer {os.getenv('HELICONE_API_KEY')}"},
)

この一行で次のものが自動で記録される。

プロキシが不安なら非同期ロギング SDK もある。バックグラウンドで送る。

強み

弱み

誰が使うか

スタートアップ・個人開発者が最多。「今すぐ本番トレースが必要、コード変更は最小化」のシナリオで圧倒的。韓国の一部 LLM スタートアップが PoC 段階で最初に入れるツールとして挙がる。


3章 · LangSmith — LangChain の旗艦

最も有名なツール。

一行定義

LangChain が作った一体型 LLM ops プラットフォーム。 可観測性 · 評価 · Prompts · Datasets を一箇所で。SaaS とセルフホスト (Enterprise) の両方。

どう動くか

LangChain · LangGraph を使えば環境変数 2 つで自動トレーシング。

export LANGSMITH_TRACING=true
export LANGSMITH_API_KEY=ls_...

LangChain を使わない場合は @traceable デコレータで任意の関数をトレースできる。

from langsmith import traceable

@traceable(run_type="llm")
def call_model(prompt: str) -> str:
    # 任意のモデル呼び出し
    ...

強み

弱み

誰が使うか

LangChain · LangGraph を本番で使うチームの標準。韓国・日本の RAG チャットボット会社で LangChain スタックを選んだ所はほぼすべて LangSmith に課金している。


4章 · Langfuse — OSS、Series A

LangSmith の最強の OSS 代替。

一行定義

MIT ライセンス OSS の LLM ops。セルフホストが本当に簡単。 2025 年に Series A を調達し、この領域で最速成長中の OSS プロジェクト。

どう動くか

docker compose up 一発でセルフホスト版が立ち上がる。SDK は Python · TypeScript · OpenAI 自動トレーシング · LlamaIndex · LangChain すべて対応。

from langfuse.openai import openai  # OpenAI の drop-in

response = openai.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "hi"}],
)

自動でトレースが生成される。手動でスパンを作ることもできる。

強み

弱み

誰が使うか

OSS を好むすべてのチーム。韓国の一部フィンテック・ヘルスケア企業はデータ主権の都合からセルフホスト Langfuse を選ぶ。日本も同じ。


5章 · W&B Weave — Weights & Biases の LLM ライン

ML 側で W&B を使っていたチームが自然に流れていくツール。

一行定義

Weights & Biases が作った LLM 可観測性・評価。 既存 W&B の実験追跡と統合される。

どう動くか

weave.init("project") を一行打ってから @weave.op デコレータで関数をラップすれば自動トレーシング。

import weave

weave.init("my-rag-app")

@weave.op()
def answer(query: str) -> str:
    docs = retrieve(query)
    return generate(query, docs)

W&B の既存 UI 内に LLM トレースが現れる。

強み

弱み

誰が使うか

既に W&B を使っていた ML チーム。韓国・日本の大企業 AI ラボで自社モデル学習をする所が多く使う。


6章 · Arize Phoenix — OSS

ML 可観測性の名門 Arize が作った OSS の LLM ツール。

一行定義

Arize AI が作った OSS の LLM 可観測性 + 評価。 ノートブックから本番まで同じツールで。

どう動くか

import phoenix as px
from phoenix.otel import register

tracer_provider = register(project_name="my-rag", auto_instrument=True)

# OpenAI · LangChain · LlamaIndex の呼び出しが全部自動トレース

Phoenix の強みは ノートブックですぐ立ち上げられる こと。px.launch_app() でローカルに UI が起動する。

強み

弱み

誰が使うか

データサイエンス出身の ML エンジニア。RAG デバッグ (どのチャンクが誤って retrieve されたかの可視化) が必要なチーム。


7章 · Braintrust — 評価特化

評価が最重要なチームなら第一候補。

一行定義

評価を最優先に置く LLM ops プラットフォーム。 Stripe · Notion · Vercel のような会社が使う。2024 年に大型ラウンド。

どう動くか

Braintrust の核となる抽象は Eval。dataset · task · scorer の組み合わせで実験を回す。

import { Eval } from "braintrust";

Eval("MyRagApp", {
  data: () => [
    { input: "What is the capital of France?", expected: "Paris" },
  ],
  task: async (input) => myRagPipeline(input),
  scores: [Factuality, AnswerRelevancy],
});

braintrust eval で回すとスコアが時系列で蓄積され、モデル・プロンプト変更の影響がすぐに比較できる。

強み

弱み

誰が使うか

Stripe · Notion · Vercel · Airtable のような米国プロダクト企業。「プロンプトを PR 単位で自動評価しないと本番に出せない」が文化として根付いたチーム。


8章 · Athina — 急成長

評価・可観測性・dataset を 1 パッケージにまとめた急成長株。

一行定義

ダッシュボードが綺麗で 50 以上の事前定義 evaluator を内蔵した LLM ops。 参入が容易。

どう動くか

from athina.loaders import Loader
from athina.evals import Faithfulness

data = Loader().load_csv("eval_data.csv")
Faithfulness(model="gpt-4o").run_batch(data=data).to_df()

あるいは SDK で本番トレースを送り、ダッシュボードで evaluator を自動実行させる。

強み

弱み

誰が使うか

プロダクトチームとエンジニアチームが共に LLM 品質を管理する中規模スタートアップ。英語圏でシェアを急拡大中。


9章 · Comet Opik (2025 年 3 月リリース) — OSS

最も新しく登場した OSS ツール。

一行定義

Comet ML が 2025 年 3 月にリリースした OSS の LLM 可観測性 + 評価。 Apache 2.0。

どう動くか

import opik
from opik import track

opik.configure(use_local=True)

@track
def answer(query: str) -> str:
    return llm_call(query)

use_local=True ならセルフホストインスタンスに送る。Comet cloud にも送れる。

強み

弱み

誰が使うか

Comet の既存 ML 顧客、そして「最新・OSS・最速スタート」の 3 つを揃って欲しい新規プロジェクト。


10章 · Vellum / PromptHub — プロンプト管理本格派

プロンプトをコードから分離するのが本業のツール。

Vellum — エンタープライズ向けプロンプト管理

プロンプトの GitHub。 バージョン · 環境 · デプロイ · A/B テスト · データセットが一箇所に。PM · CS · QA が直接プロンプトを触るワークフローに最適化。

PromptHub — 軽量版コラボ

Vellum より軽く、価格も安い。 小規模チームがプロンプトを git のように管理したいとき。

いつ専用 prompt ツールが必要になるか

ほとんどの小規模チームは LangSmith · Langfuse 内蔵のプロンプト機能で十分。次の時点で別ツールが要る。

3 つ揃えば Vellum、1~2 つなら PromptHub、どれも当てはまらなければ LangSmith · Langfuse 内蔵。


11章 · Portkey — AI Gateway + 可観測性

ゲートウェイ領域の代表格。

一行定義

OpenAI / Anthropic / Bedrock / Google / Azure / Together / 200 以上のプロバイダ を統合する AI ゲートウェイ。 可観測性 · キャッシュ · fallback · rate limit · cost guard が全部入り。

どう動くか

OpenAI SDK の base_url を Portkey に向けて、ヘッダでルーティングルールを渡す。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.portkey.ai/v1",
    default_headers={
        "x-portkey-api-key": os.getenv("PORTKEY_API_KEY"),
        "x-portkey-config": "your-config-id",  # ルーティング・キャッシュ・リトライ規則
    },
)

config の中で「primary は GPT-4o、失敗時は Claude Sonnet 4.5 にフォールバック、同じ入力は 1 時間キャッシュ」のようなポリシーを宣言的に定義。

強み

弱み

LiteLLM との比較

LiteLLM (OSS の SDK / プロキシ) が似た領域。違いは:

スタートアップ / 個人は LiteLLM が多く、中規模以上は Portkey が多い。


12章 · TruLens / Ragas — RAG 評価の二大潮流

RAG が入ったシステムならほぼ必ずどちらか。

Ragas — RAG 評価メトリクスの事実上の標準

OSS。RAG の標準メトリクスをライブラリで。 最も引用される RAG 評価フレームワーク。

from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevancy, context_precision

result = evaluate(
    dataset=eval_dataset,
    metrics=[faithfulness, answer_relevancy, context_precision],
)
print(result)

LangSmith · Langfuse · Athina など、ほぼすべての可観測性ツールが Ragas メトリクスを内蔵 evaluator として提供する。

TruLens — より広い評価 + トレーシング

TruEra (現 Snowflake) の OSS。 Ragas がメトリクスライブラリなら、TruLens はメトリクス + トレーシング + ダッシュボードを併せ持つ。

Ragas と TruLens の選び方


13章 · Galileo / Patronus AI / DeepEval — エンタープライズ評価

規制 · セキュリティ · SLA が重い組織向け。

Galileo — Generative AI Studio

本番グレードのハルシネーション · 安全性 · ドリフト監視。 Fortune 500 · 政府 · 金融。

Patronus AI — 自動評価 + 安全性

自動化された LLM 評価に特化。 Lynx (ハルシネーション検出器)、Glider、FinanceBench といった自社評価モデルを提供。

DeepEval (Confident AI) — pytest スタイルの LLM テスト

LLM の pytest。 開発者にとって最も親しみやすい API。

from deepeval import assert_test
from deepeval.test_case import LLMTestCase
from deepeval.metrics import AnswerRelevancyMetric

def test_answer_relevancy():
    test_case = LLMTestCase(
        input="What is the capital of France?",
        actual_output="The capital is Paris.",
    )
    metric = AnswerRelevancyMetric(threshold=0.7)
    assert_test(test_case, [metric])

CI で pytest のように回せる。Confident AI が結果を蓄積する SaaS ダッシュボード。

3 つの選び分け


14章 · クラウドネイティブ — Bedrock Evals / Vertex AI Evaluation / OpenAI Evals

2025 年後半からクラウドビッグ 3 が本格進出した。

AWS Bedrock Evaluations

Bedrock 内でモデル · プロンプト · RAG を評価するマネージドサービス。

既に AWS にコミットしているチームの標準選択。

Vertex AI Evaluation Service (Google)

Gen AI Eval Service。 Vertex AI 内で Gemini · 3P モデルを評価。

Gemini · PaLM を本番で使う企業の標準。

OpenAI Evals (ダッシュボード)

OpenAI Platform の Evals タブ。 2024 年から OSS で出ていた openai/evals が SaaS ダッシュボードに統合された。

Azure AI Studio Evaluations

Azure OpenAI の評価機能。PromptFlow と統合。Azure にコミットしたエンタープライズの標準。

クラウドネイティブの長所と短所


15章 · 韓国 / 日本 — トス · NAVER · Sakana · NTT つづみ

海外ツールばかりではない。韓国・日本の自前 LLM ops も急速に育っている。

韓国

日本

韓日共通パターン


16章 · 誰が何を選ぶべきか — 4 ペルソナ

最後に意思決定ガイド。

ペルソナ 1 · 個人開発者 / インディーハック

条件 — 一人でサイドプロジェクトとして LLM アプリを作る。費用は最低限。

ペルソナ 2 · Seed/Series A スタートアップ (5~50 人)

条件 — 本番トラフィックあり。高速反復。費用も気にする。

ペルソナ 3 · Series B+ / エンタープライズ

条件 — 規模が大きい。compliance · SOC2 · ISO 27001 が必要。SLA がそのまま売上。

ペルソナ 4 · RAG 優先組織

条件 — RAG がプロダクトの核。retrieval の品質が事業の品質。

ツール選びの前に問う 5 つの質問

ツールを比較する前に、自分自身に問うべき 5 つ。

  1. データ主権 — 自社データはどのリージョンに留まる必要があるか? (韓国 / 日本 / EU / 米国?)
  2. OSS vs SaaS — セルフホスト運用する人員はいるか?
  3. agentic workflow があるか? — あれば LangSmith · Langfuse が優位、なければ Helicone · Athina で十分。
  4. PM · CS がプロンプトを直接触るか? — そうなら Vellum または LangSmith Prompts UI が決定的。
  5. CI で自動 LLM 回帰テストを回すか? — そうなら Braintrust · DeepEval が優位。

17章 · おわりに — 「LLM を運用する」 という言葉がある時代

2024 年時点では「LLM 運用」 という言葉自体が違和感を持って受け止められていた。2026 年 5 月現在、LLM ops は立派な SRE の一分野になった。30 を超えるツールが競い、OpenTelemetry GenAI 規約が標準として定着し、クラウドビッグ 3 が自社評価サービスを出した。

本稿冒頭で投げた 5 つの問い — なぜ変な答えが出るのか、どう再現するか、誰がトークンを使ったか、どのテストが壊れたか、品質を自動で測れるか — に対する答えは、もうツールが提供できる。問題はどのツールを選ぶかだ。

ツールを使わない理由はもう存在しない。「プロンプトはコードだ。コードには監視とテストが必要だ。」 これが 2026 年の新しい常識だ。次のモデル (GPT-5.5 · Claude Opus 5 · Gemini 3 Ultra · Llama 5) が来てもこのインフラはそのまま使える。モデルは変わっても運用の原則は変わらない。


参考 / References

Observability — 一体型

Evaluation 特化

プロンプト管理

ゲートウェイ

クラウドネイティブ eval

標準 / 仕様

韓国・日本

コメント

まだコメントはありません。

ログインするとコメントできます