タグ: #deepeval
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
LLM 可観測性 & プロンプトツール 2026 — Helicone / LangSmith / Langfuse / Braintrust / Athina / Comet Opik / Portkey 徹底比較
2026年の LLM ops 地図。Helicone (YC) · LangSmith (LangChain) · Langfuse (OSS Series A) · W&B Weave · Arize Phoenix · Braintrust · Athina · Comet Opik (2025年3月リリース) · Vellum · PromptHub · Portkey AI Gateway · TruLens · Ragas ·
2026-05-16 · 33 分で読めます #llm-observability#prompt-engineering#helicone#langsmith#langchainAI 安全 / 評価 / レッドチーミング 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 深掘りガイド
2026年のAI安全・評価・レッドチーミング エコシステムを1枚にまとめる。Inspect AI(Anthropic、UK AISI採用)、Garak(NVIDIA→独立)、PyRIT(Microsoft)、Promptfoo(YC)、OpenAI Evals、lm-evaluation-harness(EleutherAI)、そして MLflow Evals・Arize Phoenix・DeepEval(Confident AI)・G
2026-05-16 · 31 分で読めます #ai-safety#red-teaming#evaluation#inspect-ai#garakLLM評価・ベンチマーク完全ガイド:本当に重要なことを測定する
LLMの評価とベンチマークに関する包括的なガイドです。標準的な学術ベンチマーク(MMLU、HELM、MT-Bench)、本番環境での評価パイプライン、LLM-as-judge、人間による評価、RAG評価、安全性テスト、実用的なカスタム評価フレームワークの構築方法までを網羅しています。
2026-03-17 · 27 分で読めます #llm#evaluation#benchmark#mmlu#helmRAG品質評価と失敗パターン分析:検索拡張生成の診断と改善
RAG(Retrieval-Augmented Generation)システムの品質を体系的に評価する方法と、よく発生する失敗パターンを分析します。Retriever、Reranker、Generator各コンポーネントの評価指標からRAGAS、DeepEvalなどのフレームワーク比較、そして実践的なデバッグワークフローまでカバーします。
2026-03-07 · 25 分で読めます #rag#llm#evaluation#ragas#deepevalRAGチャットボット評価実践:オフライン/オンライン品質測定からプロダクションガードレールまで
RAGチャットボットを実際のサービスで安定的に運用するための評価体系をまとめる。オフラインベンチマーク、LLM-as-a-Judge、オンライン実験、アラート閾値、回帰防止パイプラインまでコード中心で扱う。
2026-03-04 · 22 分で読めます #chatbot#rag#evaluation#llmops#production