태그: #langsmith
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
LLM 관찰성 & 프롬프트 도구 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 심층 비교
2026년의 LLM ops 지도. Helicone (YC) · LangSmith (LangChain) · Langfuse (오픈소스 Series A) · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik (2025년 3월 출시) · Vellum · PromptHub · Portkey AI Gateway · TruLens · Ragas
2026-05-16 · 36 분 읽기 #llm-observability#prompt-engineering#helicone#langsmith#langchain에이전트 평가 시스템 2026 — Inspect AI·Promptfoo·Phoenix·LangSmith·OpenAI Evals 심층 비교 (모델이 아니라 에이전트를 측정한다)
LLM 평가는 모델을 측정한다. 에이전트 평가는 모델 + 하네스 + 도구가 실제 작업을 끝까지 끌고 가는지를 측정한다. 두 개는 완전히 다른 문제다. 2026년 현재 에이전트 평가 프레임워크의 지도를 그린다 — UK AISI의 Inspect AI(점점 골든 스탠더드), Promptfoo(OSS CLI), Arize Phoenix(OSS 옵저버빌리티+eval), LangSmith(LangCha
2026-05-14 · 34 분 읽기 #agent-evaluation#inspect-ai#promptfoo#phoenix#langsmithLLM 평가 & 관측성 완전 가이드: Eval Harness, LLM-as-Judge, Tracing, 회귀 방지 (2025)
모델을 바꿨더니 더 좋아진 것 "같다"는 주장은 과학이 아니다. 2025년 LLM 제품의 실패 원인 1위는 "측정 안 함". Eval harness 설계, LLM-as-judge 함정과 보정, Trace·Span·Metric 3층 관측성, 프로덕션 피드백 루프, Phoenix·LangSmith·LangFuse·Helicone 비교까지. 평가를 제품 개발의 근간으로 세우는 법.
2026-04-15 · 19 분 읽기 #llm-eval#observability#llm-judge#distributed-tracing#langsmithLLM 프로덕션 모니터링 플랫폼 비교: LangSmith·LangFuse·Arize Phoenix 실전 운영 가이드
LLM 프로덕션 모니터링 플랫폼 3종(LangSmith, LangFuse, Arize Phoenix) 종합 비교 가이드. 트레이스 수집, 프롬프트 버전 관리, 평가 파이프라인, 비용 모니터링, 품질 대시보드 구성, 그리고 실전 선택 기준까지 코드 예제와 함께 다룹니다.
2026-03-09 · 34 분 읽기 #ai-platform#llm-monitoring#langsmith#langfuse#arize챗봇 성능 모니터링과 대화 품질 분석: 메트릭 설계부터 A/B 테스트 자동화까지
챗봇 시스템의 성능 모니터링과 대화 품질 분석 실전 가이드. 핵심 메트릭 설계, LangSmith/Langfuse를 활용한 트레이싱, 자동 품질 평가 파이프라인, A/B 테스트 프레임워크 구축을 코드와 함께 다룹니다.
2026-03-08 · 45 분 읽기 #chatbot#monitoring#analytics#ab-testing#langsmith