标签: #mmlu
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
LLM、Tool Calling、Embedding 基准完全解析:每个基准到底衡量什么
MMLU、HellaSwag、HumanEval、BFCL、MTEB 等主要 AI 基准到底衡量什么、各项分数的含义与局限,以及在实际使用时该参考哪个基准,本文逐一完整解析。
2026-03-17 · 37 分钟阅读 #llm#benchmark#mmlu#mteb#bfclAI 基准数据集完全指南:ImageNet、COCO、GLUE、MMLU、HumanEval
AI 模型评估用主要基准数据集完全指南。详细解析计算机视觉(ImageNet、COCO、ADE20K)、NLP(GLUE、SuperGLUE、SQuAD、MMLU)、代码(HumanEval、MBPP)、LLM 评估(HELM、MT-Bench)。
2026-03-17 · 34 分钟阅读 #benchmark#datasets#imagenet#coco#glue