태그: #swe-bench
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
AI 코딩 모델 평가에서 신호와 잡음 가려내기 — SWE-bench가 흔들리는 이유
OpenAI 평가팀은 가장 널리 쓰이는 코딩 벤치마크인 SWE-bench Verified가 오염과 설계 결함 탓에 더 이상 의미 있는 신호를 주지 못한다고 밝혔습니다. 신호(모델을 가려내는 힘)와 잡음(실행마다 흔들리는 변동)이라는 두 축으로 다시 보면, 리더보드 순위의 상당수가 잡음 위에 서 있습니다. 오염·하네스 차이·채점 불가능한 과제·과적합이 어떻게 점수를 부풀리는지 정리하고, 팀이
2026-07-11 · 12 분 읽기 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding코드가 에이전트의 실행 기반이 되다: code-as-harness 관점
코드를 단순한 LLM의 최종 산출물이 아니라 에이전트가 환경과 상호작용하는 실행 기반(harness)으로 다시 바라봅니다. 검증 루프, 도구 호출, 실행 피드백을 중심으로 에이전트 설계 패턴과 함정을 정리합니다.
2026-06-25 · 36 분 읽기 #ai#agentic-coding#llm-agents#tool-calling#reactAI 에이전트 & LLM 벤치마크 2026 — SWE-bench Verified / ARC-AGI 2 / GAIA / MMLU-Pro / GPQA / LiveCodeBench / Chatbot Arena 심층 가이드
2026년 현재 가장 의미 있는 AI 벤치마크 30+ 종을 한 장에 정리한다. SWE-bench / SWE-bench Verified / SWE-bench Multimodal부터 AgentBench·WebArena·GAIA, ARC-AGI 2(샹폴레의 $1M 상금), RE-Bench(METR), Frontier Math(Epoch AI), HumanEval / MBPP / LiveCodeBe
2026-05-16 · 35 분 읽기 #ai-benchmark#llm-evaluation#swe-bench#swe-bench-verified#agentbench