태그: #deepeval
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
LLM 관찰성 & 프롬프트 도구 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 심층 비교
2026년의 LLM ops 지도. Helicone (YC) · LangSmith (LangChain) · Langfuse (오픈소스 Series A) · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik (2025년 3월 출시) · Vellum · PromptHub · Portkey AI Gateway · TruLens · Ragas
2026-05-16 · 36 분 읽기 #llm-observability#prompt-engineering#helicone#langsmith#langchainAI 안전 / 평가 / 레드티밍 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 심층 가이드
2026년의 AI 안전·평가·레드티밍 생태계를 한 장에 모은다. Inspect AI(Anthropic, UK AISI 채택)·Garak(NVIDIA→독립)·PyRIT(Microsoft)·Promptfoo(YC)·OpenAI Evals·lm-evaluation-harness(EleutherAI), 그리고 MLflow Evals·Arize Phoenix·DeepEval(Confident AI)·
2026-05-16 · 35 분 읽기 #ai-safety#red-teaming#evaluation#inspect-ai#garakRAG 품질 평가와 실패 패턴 분석: 검색 증강 생성의 진단과 개선
RAG(Retrieval-Augmented Generation) 시스템의 품질을 체계적으로 평가하는 방법과 흔히 발생하는 실패 패턴들을 분석합니다. Retriever, Reranker, Generator 각 컴포넌트의 평가 지표부터 RAGAS, DeepEval 같은 프레임워크 비교, 그리고 실전 디버깅 워크플로우까지 다룹니다.
2026-03-07 · 24 분 읽기 #rag#llm#evaluation#ragas#deepevalRAG 챗봇 평가 실전: 오프라인/온라인 품질 측정부터 프로덕션 가드레일까지
RAG 챗봇을 실제 서비스에서 안정적으로 운영하기 위한 평가 체계를 정리한다. 오프라인 벤치마크, LLM-as-a-Judge, 온라인 실험, 알림 임계치, 회귀 방지 파이프라인까지 코드 중심으로 다룬다.
2026-03-04 · 23 분 읽기 #chatbot#rag#evaluation#llmops#production