태그: #ragas
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
LLM 관찰성 & 프롬프트 도구 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 심층 비교
2026년의 LLM ops 지도. Helicone (YC) · LangSmith (LangChain) · Langfuse (오픈소스 Series A) · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik (2025년 3월 출시) · Vellum · PromptHub · Portkey AI Gateway · TruLens · Ragas
2026-05-16 · 36 분 읽기 #llm-observability#prompt-engineering#helicone#langsmith#langchainRAGAS 완전 가이드: RAG 시스템을 어떻게 정량적으로 평가하는가
RAGAS의 4가지 핵심 지표(Faithfulness, Answer Relevancy, Context Precision, Context Recall)를 이해하고, 실제 Python 코드로 RAG 시스템을 평가하는 방법을 설명합니다. 자동 평가 파이프라인 구축과 테스트셋 생성까지 실전 중심으로 다룹니다.
2026-03-18 · 15 분 읽기 #ragas#RAG평가#LLM평가#ai-development#품질관리LLM 평가와 벤치마킹 완전 가이드: MMLU, MT-Bench, RAGAS, LM-Eval
LLM을 올바르게 평가하는 완전 가이드. MMLU, MT-Bench, HumanEval 같은 표준 벤치마크부터 RAGAS로 RAG 시스템 평가, LM-Evaluation-Harness 실전 사용, 그리고 프로덕션 LLM 평가 파이프라인까지 상세히 다룹니다.
2026-03-17 · 25 분 읽기 #llm#evaluation#benchmark#ragas#lm-eval챗봇 평가 체계 구축 가이드: LLM-as-Judge·RAGAS·자동화 테스트 파이프라인
LLM 기반 챗봇의 품질 평가 체계를 체계적으로 구축하는 방법을 다룹니다. RAGAS 프레임워크를 활용한 RAG 파이프라인 평가, LLM-as-Judge 패턴, 자동화 테스트 파이프라인 구축, 프로덕션 모니터링까지 실전 가이드를 제공합니다.
2026-03-10 · 28 분 읽기 #chatbot#evaluation#ragas#llm-as-judge#testingRAG 품질 평가와 실패 패턴 분석: 검색 증강 생성의 진단과 개선
RAG(Retrieval-Augmented Generation) 시스템의 품질을 체계적으로 평가하는 방법과 흔히 발생하는 실패 패턴들을 분석합니다. Retriever, Reranker, Generator 각 컴포넌트의 평가 지표부터 RAGAS, DeepEval 같은 프레임워크 비교, 그리고 실전 디버깅 워크플로우까지 다룹니다.
2026-03-07 · 24 분 읽기 #rag#llm#evaluation#ragas#deepevalRAG 챗봇 평가 실전: 오프라인/온라인 품질 측정부터 프로덕션 가드레일까지
RAG 챗봇을 실제 서비스에서 안정적으로 운영하기 위한 평가 체계를 정리한다. 오프라인 벤치마크, LLM-as-a-Judge, 온라인 실험, 알림 임계치, 회귀 방지 파이프라인까지 코드 중심으로 다룬다.
2026-03-04 · 23 분 읽기 #chatbot#rag#evaluation#llmops#production