LabHub

블로그

LLM 관찰성 & 프롬프트 도구 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 심층 비교

한국어English日本語

프롤로그 — "LLM 을 띄우는 것은 쉬워졌다. 운영하는 것이 어렵다"

2024년까지만 해도 LLM 을 production 에 띄우는 것은 신기한 일이었다. 2026년 5월, 그건 더 이상 신기한 일이 아니다. OpenAI · Anthropic · Google · Mistral · DeepSeek · 한국의 HyperCLOVA X · 일본의 Sakana · NTT Tsuzumi 같은 모델은 API 한 줄이면 호출된다. 진짜 어려운 것은 그 다음이다.

이 다섯 가지 질문이 2026년 LLM ops 의 전부다. 그리고 그 질문 각각에 정확히 답하기 위한 도구가 한꺼번에 폭발적으로 늘어났다. Helicone · LangSmith · Langfuse · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik · Vellum · PromptHub · Portkey · TruLens · Ragas · DeepEval · Galileo · Patronus AI · OpenAI Evals · Bedrock Evals · Vertex AI Evaluation Service — 이 글의 제목에 들어간 도구들이 그것이다.

이 글은 2026년 5월 현재의 LLM ops 지도를 펼친다. 네 영역 (관찰성 · 평가 · 프롬프트 관리 · 게이트웨이) 으로 묶고, 각 도구의 강점·약점·가격 모델·실제 사용 현장 사례를 짚는다. 마지막에는 1인 개발자·스타트업·엔터프라이즈·RAG 우선 조직 네 페르소나가 무엇을 골라야 하는지로 마무리한다.


1장 · 2026년 LLM ops 지도 — 네 영역 분류

먼저 큰 그림.

네 영역 — Observability / Evaluation / Prompt management / Gateway

LLM ops 도구는 기능이 겹치지만, 핵심 가치 제안 기준으로 네 영역으로 분류할 수 있다.

영역무엇을 하는가대표 도구
Observability모든 LLM 호출을 트레이싱 / 토큰·지연·비용·에러 모니터링 / 디버깅Helicone, LangSmith, Langfuse, W&B Weave, Arize Phoenix, Comet Opik
Evaluation모델 출력의 품질을 데이터셋·메트릭·LLM-as-judge 로 자동 측정Braintrust, Athina, Ragas, TruLens, DeepEval, Galileo, Patronus AI
Prompt management프롬프트의 버전 관리 / A·B 테스트 / 비기술자 협업 / 배포Vellum, PromptHub, LangSmith Prompts, Langfuse Prompts
GatewayOpenAI / Anthropic / Bedrock 등 멀티 프로바이더 라우팅 · 캐싱 · rate limit · fallbackPortkey, LiteLLM, Cloudflare AI Gateway

대부분의 도구는 영역을 겸한다. LangSmith 는 observability 도 하고 evaluation 도 하고 prompt 도 한다. Langfuse 도 동일하다. Portkey 는 gateway 가 본업이지만 observability 도 한다. 이게 비교를 어렵게 만드는 가장 큰 이유다.

2024 → 2026 의 변화

2024년 초까지만 해도 LangSmith 가 사실상 유일한 선택지였다. 그 뒤 2년 동안 무서운 속도로 시장이 분화됐다.

OpenTelemetry 의 등장 — GenAI semantic conventions

2025년 후반에 결정적인 변화가 있었다. OpenTelemetry 의 GenAI semantic conventions 가 사실상 표준이 됐고, Langfuse · Phoenix · Helicone · Portkey · LangSmith 가 모두 OTel 기반 SDK 를 제공하기 시작했다. 즉, SDK 한 번 깔면 백엔드는 바꿔 끼울 수 있는 시대가 됐다. 이게 향후 5년 LLM ops 의 가장 큰 변화다.


2장 · Helicone — Y Combinator 오픈소스 관찰성

먼저 가장 빠르게 시작할 수 있는 도구부터.

한 줄 정의

Y Combinator W23 출신, 오픈소스 LLM 관찰성. base URL 한 줄 바꾸면 끝. 가장 진입 장벽이 낮다.

어떻게 동작하는가

Helicone 의 가장 큰 특징은 proxy 모드다. OpenAI SDK 의 base_urlhttps://oai.helicone.ai/v1 로 바꾸기만 하면 모든 호출이 자동으로 기록된다. 코드 한 줄.

from openai import OpenAI

client = OpenAI(
    base_url="https://oai.helicone.ai/v1",
    default_headers={"Helicone-Auth": f"Bearer {os.getenv('HELICONE_API_KEY')}"},
)

이 한 줄로 다음이 자동 기록된다.

proxy 가 부담스러우면 async logging SDK 도 있다. 비동기로 백그라운드에서 보낸다.

강점

약점

누가 쓰는가

스타트업·인디 개발자가 가장 많다. "지금 당장 production 트레이싱이 필요한데 코드 변경은 최소화" 시나리오에 압도적이다. 한국의 일부 LLM 스타트업이 PoC 단계에서 가장 먼저 까는 도구로 꼽힌다.


3장 · LangSmith — LangChain 의 깃발

가장 유명한 도구.

한 줄 정의

LangChain 이 만든 일체형 LLM ops 플랫폼. Observability · Evaluation · Prompts · Datasets 를 한 곳에서. SaaS 와 self-hosted (Enterprise) 둘 다.

어떻게 동작하는가

LangChain·LangGraph 를 쓰면 환경변수 두 개만 세팅하면 자동 트레이싱된다.

export LANGSMITH_TRACING=true
export LANGSMITH_API_KEY=ls_...

LangChain 을 안 써도 @traceable 데코레이터로 임의 함수를 트레이싱할 수 있다.

from langsmith import traceable

@traceable(run_type="llm")
def call_model(prompt: str) -> str:
    # 임의의 모델 호출
    ...

강점

약점

누가 쓰는가

LangChain·LangGraph 를 production 에 쓰는 모든 팀의 기본값. 한국·일본의 RAG 챗봇 회사 중 LangChain 스택을 고른 곳은 거의 다 LangSmith 다.


4장 · Langfuse — 오픈소스, Series A

LangSmith 의 가장 강력한 오픈소스 대안.

한 줄 정의

MIT 라이센스 오픈소스 LLM ops. self-host 가 진짜 쉽다. 2025년 Series A 라운드를 받았고, 가장 빠르게 성장 중인 OSS 프로젝트 중 하나.

어떻게 동작하는가

docker compose up 한 번이면 self-hosted 인스턴스가 뜬다. SDK 는 Python · TypeScript · OpenAI 자동 트레이싱 · LlamaIndex · LangChain 모두 지원.

from langfuse.openai import openai  # OpenAI 의 drop-in

response = openai.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "hi"}],
)

자동으로 trace 가 생성된다. 수동으로 span 을 만들 수도 있다.

강점

약점

누가 쓰는가

오픈소스를 선호하는 모든 팀. 한국의 일부 핀테크·헬스케어 회사가 데이터 주권 때문에 self-hosted Langfuse 를 고른다. 일본도 비슷하다.


5장 · W&B Weave — Weights & Biases 의 LLM 라인

ML 쪽에서 W&B 를 쓰던 팀이 자연스럽게 가는 도구.

한 줄 정의

Weights & Biases 가 만든 LLM 관찰성·평가. 기존 W&B 의 실험 추적과 통합된다.

어떻게 동작하는가

weave.init("project") 한 줄 후 @weave.op 데코레이터로 함수를 감싸면 자동 트레이싱.

import weave

weave.init("my-rag-app")

@weave.op()
def answer(query: str) -> str:
    docs = retrieve(query)
    return generate(query, docs)

W&B 의 기존 UI 안에서 LLM 트레이스가 보인다.

강점

약점

누가 쓰는가

이미 W&B 를 쓰던 ML 팀. 한국·일본의 대기업 AI 랩 중 자체 모델 학습을 하는 곳이 많이 쓴다.


6장 · Arize Phoenix — 오픈소스

ML 관찰성의 명가 Arize 가 만든 오픈소스 LLM 도구.

한 줄 정의

Arize AI 가 만든 오픈소스 LLM observability + evaluation. 노트북에서 시작해서 production 까지 같은 도구로.

어떻게 동작하는가

import phoenix as px
from phoenix.otel import register

tracer_provider = register(project_name="my-rag", auto_instrument=True)

# 이제 OpenAI · LangChain · LlamaIndex 호출이 전부 자동 트레이싱

Phoenix 의 강점은 노트북에서 바로 띄울 수 있다는 점이다. px.launch_app() 하면 로컬에서 UI 가 뜬다.

강점

약점

누가 쓰는가

데이터 사이언티스트 출신 ML 엔지니어. RAG 디버깅 (어떤 chunk 가 잘못 retrieve 되었는지 시각화) 이 필요한 팀.


7장 · Braintrust — Evaluation 특화

평가가 가장 중요한 팀이라면 1순위 후보.

한 줄 정의

Eval 이 최우선인 LLM ops 플랫폼. Stripe · Notion · Vercel 같은 회사가 쓴다. 2024년 큰 라운드를 받았다.

어떻게 동작하는가

Braintrust 의 핵심 추상은 Eval. dataset · task · scorer 의 조합으로 실험을 돌린다.

import { Eval } from "braintrust";

Eval("MyRagApp", {
  data: () => [
    { input: "What is the capital of France?", expected: "Paris" },
  ],
  task: async (input) => myRagPipeline(input),
  scores: [Factuality, AnswerRelevancy],
});

braintrust eval 로 돌리면 score 가 시간 축으로 누적되고, 모델·프롬프트 변경의 영향을 즉시 비교할 수 있다.

강점

약점

누가 쓰는가

Stripe · Notion · Vercel · Airtable 같은 미국 product 회사. "프롬프트를 PR 단위로 자동 평가하지 않으면 production 에 못 나간다" 가 문화로 박힌 팀.


8장 · Athina — 빠르게 성장

평가·관찰성·dataset 을 한 패키지로 묶은 빠른 성장주.

한 줄 정의

대시보드가 깔끔하고 50개 이상의 사전 정의 evaluator 가 들어 있는 LLM ops. 진입이 쉽다.

어떻게 동작하는가

from athina.loaders import Loader
from athina.evals import Faithfulness

data = Loader().load_csv("eval_data.csv")
Faithfulness(model="gpt-4o").run_batch(data=data).to_df()

또는 SDK 로 production 트레이스를 보내고 대시보드에서 evaluator 를 자동 실행하게 할 수 있다.

강점

약점

누가 쓰는가

product 팀과 eng 팀이 같이 LLM 품질을 관리하는 mid-size 스타트업. 영어권에서 빠르게 점유율을 늘리고 있다.


9장 · Comet Opik (2025년 3월 출시) — 오픈소스

가장 새로 등장한 오픈소스 도구.

한 줄 정의

Comet ML 이 2025년 3월 출시한 오픈소스 LLM observability + evaluation. Apache 2.0.

어떻게 동작하는가

import opik
from opik import track

opik.configure(use_local=True)

@track
def answer(query: str) -> str:
    return llm_call(query)

use_local=True 면 self-host 인스턴스에 보낸다. Comet cloud 로도 보낼 수 있다.

강점

약점

누가 쓰는가

Comet 의 기존 ML 고객, 그리고 "최신·오픈소스·빠른 시작" 셋을 모두 원하는 신규 프로젝트.


10장 · Vellum / PromptHub — 프롬프트 관리 본격파

프롬프트를 코드에서 분리하는 것이 본업.

Vellum — 엔터프라이즈 프롬프트 관리

프롬프트의 GitHub. 버전 · 환경 · 배포 · A/B 테스트 · 데이터셋이 한 곳에 들어 있다. PM·CS·QA 가 프롬프트를 직접 만지는 워크플로우에 최적화.

PromptHub — 라이트한 협업

Vellum 보다 가볍고 가격이 싸다. 작은 팀이 프롬프트를 git 처럼 관리하고 싶을 때.

언제 별도 prompt 도구가 필요한가

대부분의 작은 팀은 LangSmith · Langfuse 의 내장 prompt 기능으로 충분하다. 다음 시점에서 별도 도구가 필요해진다.

이 셋이 모두 해당하면 Vellum, 한두 개면 PromptHub, 다 안 해당하면 LangSmith·Langfuse 내장 기능.


11장 · Portkey — AI Gateway + 관찰성

게이트웨이 영역의 대표주자.

한 줄 정의

OpenAI / Anthropic / Bedrock / Google / Azure / Together / 200개 프로바이더 를 통합하는 AI gateway. 관찰성 · 캐싱 · fallback · rate limit · cost guard 가 다 들어 있다.

어떻게 동작하는가

OpenAI SDK 의 base_url 을 Portkey 로 바꾼 뒤 헤더로 라우팅 규칙을 전달.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.portkey.ai/v1",
    default_headers={
        "x-portkey-api-key": os.getenv("PORTKEY_API_KEY"),
        "x-portkey-config": "your-config-id",  # 라우팅·캐싱·재시도 규칙
    },
)

config 안에서 "primary 는 GPT-4o, 실패 시 Claude Sonnet 4.5 로 fallback, 같은 입력은 1시간 캐시" 같은 정책을 선언적으로 정의.

강점

약점

LiteLLM 과의 비교

LiteLLM (오픈소스 SDK / proxy) 이 비슷한 영역. 차이는:

스타트업 / 인디는 LiteLLM 이 흔하고, mid-size 이상은 Portkey 가 흔하다.


12장 · TruLens / Ragas — RAG 평가 양대 산맥

RAG 가 들어간 시스템이면 거의 무조건 둘 중 하나.

Ragas — RAG 평가 메트릭의 사실상 표준

오픈소스. RAG 의 표준 메트릭을 라이브러리로. 가장 많이 인용되는 RAG 평가 framework.

from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevancy, context_precision

result = evaluate(
    dataset=eval_dataset,
    metrics=[faithfulness, answer_relevancy, context_precision],
)
print(result)

LangSmith · Langfuse · Athina 등 거의 모든 observability 도구가 Ragas 메트릭을 내장 evaluator 로 제공한다.

TruLens — 더 넓은 평가 + 트레이싱

TruEra (현 Snowflake) 의 오픈소스. Ragas 가 메트릭 라이브러리라면 TruLens 는 메트릭 + 트레이싱 + 대시보드를 함께 제공.

Ragas vs TruLens 선택 기준


13장 · Galileo / Patronus AI / DeepEval — 엔터프라이즈 eval

규제·보안·SLA 가 중요한 조직을 위한 영역.

Galileo — Generative AI Studio

production-grade hallucination · safety · drift 모니터링. Fortune 500 · 정부 · 금융 영역.

Patronus AI — 자동 평가 + 안전성

오토메이션된 LLM 평가에 특화. Lynx (hallucination detector), Glider, FinanceBench 같은 자체 평가 모델을 제공.

DeepEval (Confident AI) — pytest 스타일의 LLM 테스트

LLM 의 pytest. 개발자가 가장 친숙한 API.

from deepeval import assert_test
from deepeval.test_case import LLMTestCase
from deepeval.metrics import AnswerRelevancyMetric

def test_answer_relevancy():
    test_case = LLMTestCase(
        input="What is the capital of France?",
        actual_output="The capital is Paris.",
    )
    metric = AnswerRelevancyMetric(threshold=0.7)
    assert_test(test_case, [metric])

CI 에서 pytest 처럼 돌릴 수 있고, Confident AI 라는 SaaS 대시보드가 결과를 누적해서 보여준다.

셋의 선택 기준


14장 · 클라우드 native — Bedrock Evals / Vertex AI Evaluation / OpenAI Evals

2025년 후반부터 클라우드 빅3가 본격 진입했다.

AWS Bedrock Evaluations

Bedrock 안에서 모델·prompt·RAG 를 평가하는 managed 서비스.

이미 AWS 에 베팅한 팀의 기본 선택지가 된다.

Vertex AI Evaluation Service (Google)

Gen AI Eval Service. Vertex AI 안에서 Gemini · 3P 모델 평가.

Gemini · PaLM 을 production 에서 쓰는 회사의 기본값.

OpenAI Evals (대시보드)

OpenAI Platform 의 Evals 탭. 2024년부터 OSS 로 풀린 openai/evals 가 SaaS 대시보드로 통합됐다.

Azure AI Studio Evaluations

Azure OpenAI 의 평가 기능. PromptFlow 와 통합. Azure 에 베팅한 엔터프라이즈의 기본값.

클라우드 native 의 장단


15장 · 한국 / 일본 — 토스 · NAVER · Sakana · NTT Tsuzumi

해외 도구만이 아니다. 한·일의 자체 LLM ops 도 빠르게 자라고 있다.

한국

일본

한·일 공통 패턴


16장 · 누가 무엇을 골라야 하나 — 4 페르소나

마지막으로 의사결정 가이드.

페르소나 1 · 1인 개발자 / 인디 hack

조건 — 혼자 사이드 프로젝트로 LLM 앱을 만든다. 비용은 최소.

페르소나 2 · Seed/Series A 스타트업 (5~50명)

조건 — production 트래픽 있음. 빠른 iteration. 비용도 신경 씀.

페르소나 3 · Series B+ / 엔터프라이즈

조건 — 규모가 크다. compliance · SOC2 · ISO 27001 필요. SLA 가 곧 매출.

페르소나 4 · RAG 우선 조직

조건 — RAG 가 product 의 핵심. retrieval 의 품질이 사업의 품질.

의사결정의 핵심 질문 다섯

도구를 고르기 전 자기 자신에게 물어봐야 하는 다섯 가지.

  1. 데이터 주권 — 우리 데이터가 어느 region 에 머물러야 하는가? (한국 / 일본 / EU / US?)
  2. 오픈소스 vs SaaS — self-host 운영 인력이 있는가?
  3. agentic workflow 가 있는가? — 있으면 LangSmith · Langfuse 가 우위, 없으면 Helicone · Athina 도 충분.
  4. PM · CS 가 프롬프트를 직접 만지는가? — 그렇다면 Vellum 또는 LangSmith Prompts 의 UI 가 결정적.
  5. CI 에서 자동으로 LLM 회귀 테스트를 돌리는가? — 그렇다면 Braintrust · DeepEval 이 우위.

17장 · 마치며 — "LLM 을 운영하는 것" 은 이제 단어가 있다

2024년에는 "LLM 운영" 이라는 단어 자체가 어색했다. 2026년 5월 현재, LLM ops 는 어엿한 SRE 의 한 갈래가 됐다. 30개가 넘는 도구가 경쟁하고, OpenTelemetry GenAI 컨벤션이 표준으로 자리잡았고, 클라우드 빅3가 자체 평가 서비스를 내놓았다.

이 글을 시작하면서 던진 다섯 가지 질문 — 왜 이상한 답이 나오는가, 어떻게 재현할 것인가, 누가 토큰을 썼는가, 어떤 테스트가 깨졌는가, 자동으로 품질을 측정할 수 있는가 — 에 대한 답은 이제 도구가 줄 수 있다. 문제는 어떤 도구를 골라야 하느냐다.

도구를 안 쓸 이유는 더 이상 없다. "프롬프트는 코드다. 코드에는 모니터링과 테스트가 있어야 한다." 이게 2026년의 새 상식이다. 다음 모델 (GPT-5.5 · Claude Opus 5 · Gemini 3 Ultra · Llama 5) 이 와도 이 인프라는 그대로 쓸 수 있다. 모델은 바뀌어도 운영의 원칙은 안 바뀐다.


참고 / References

Observability — 일체형

Evaluation 특화

Prompt management

Gateway

Cloud-native eval

표준 / spec

한국·일본

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다