태그: #benchmark
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 17 편
벤치마크가 거짓말하는 세 가지 방식 — Rust CLI를 실제로 재보고 진 이야기
Rust로 만든 검색 도구를 실제 코퍼스 11,483개 파일에 돌려 ripgrep, grep과 비교했습니다. 결과는 ripgrep이 약 10배 빨랐고 제 도구는 BSD grep과 비슷했습니다. 그런데 이 숫자에 도달하기까지 하니스 버그 세 개가 각각 그럴듯하지만 틀린 결과를 냈습니다. 셸 함수가 실제 도구를 가로챈 일, 프로세스 기준 타이머를 프로세스 간에 뺀 일, time의 출력을 스스로
2026-08-19 · 16 분 읽기 #rust#cli#benchmark#performance#ripgrepGemini 3.7 Flash의 도입가와 3주 주기 — 모델 원가를 계약이 아니라 확률로 잡아야 하는 이유
Gemini 3.7 Flash 발표에서 실무자가 봐야 할 것은 벤치마크 상승폭이 아니라 두 가지입니다. 하나는 특정 날짜에 단가가 두 배로 오르는 도입가 구조이고, 다른 하나는 직전 모델이 3주 전에 나왔다는 사실입니다. 이 둘이 겹치면 모델 원가는 고정비가 아니라 만료일이 붙은 조건부 값이 됩니다. 공개된 벤치마크가 무엇을 비교하고 무엇을 비교하지 않는지, 그리고 발표에서 끝내 공개되지 않
2026-08-14 · 13 분 읽기 #llm#cost-optimization#benchmark#api-design#capacity-planning리더보드와 벤치마크를 읽는 법 — SOTA는 왜 유통기한이 짧은가
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#benchmark#evaluation추론 강도는 모델 선택이 아니라 요청 단위 배포 파라미터입니다
ARC Prize가 공개한 DeepSeek V4 Flash 0731 결과 페이지에는 점수가 하나가 아니라 추론 강도별로 세 개 실려 있습니다. 이 글은 그 세 숫자에서 실제로 읽어 낼 수 있는 것을 계산합니다. 같은 강도 상향이 쉬운 벤치마크에서는 5퍼센트포인트를, 어려운 벤치마크에서는 15퍼센트포인트를 사 준다는 사실과, 그렇다면 강도를 모델 설정이 아니라 요청마다 결정하는 값으로 다뤄야
2026-08-09 · 14 분 읽기 #llm#benchmark#arc-agi#inference#cost명령어 하나가 62초 걸릴 수 있다 — 지연은 명령어가 아니라 경로의 속성이다
Assembly Hall of Shame는 단일 명령어를 가장 느리게 만드는 경쟁의 순위표입니다. 최하위 nop이 1사이클, 1위 fxrstor64가 1,980억 사이클로 62초입니다. 이 순위표를 아래에서 위로 읽으면 현대 CPU가 멈출 수 있는 모든 지점의 목록이 되는데, 마이크로코드 보조 경로, 캐시 라인을 걸친 원자 연산, TLB 무효화, 엔트로피 고갈, 그리고 다이 밖 PCIe 패브
2026-08-09 · 19 분 읽기 #os-concepts#performance#cpu#microarchitecture#benchmarkvLLM을 고쳐서 빠르게 만들기 — 설정, 내부 구조, 그리고 코드를 건드릴 지점
vLLM 성능을 올리는 작업을 코드를 고치지 않고 되는 것부터 순서대로 정리합니다. 배치 관련 인자와 프리픽스 캐싱, 청크드 프리필, 양자화 선택을 먼저 다루고, 그다음 PagedAttention과 연속 배칭 스케줄러가 내부에서 무엇을 결정하는지 실제 소스를 근거로 설명합니다. 실제로 코드를 건드릴 만한 세 지점인 커스텀 로짓 프로세서, 커스텀 어텐션 백엔드, 스케줄러 정책과 그 대가도 짚습
2026-08-02 · 35 분 읽기 #vllm#llm-inference#paged-attention#benchmark#schedulerLLM 벤치마크 도구를 뜯어보기 — 같은 MMLU가 하네스마다 다른 점수를 내는 이유
벤치마크 점수는 모델의 속성이 아니라 특정 조건에서 수행된 측정의 결과입니다. 같은 LLaMA 65B가 같은 MMLU에서 63.6점과 48.8점을 동시에 받은 사건은, 하네스가 프롬프트를 어떻게 조립하고 정답을 어떻게 파싱하느냐가 점수의 상당 부분을 결정한다는 것을 보여 줍니다. 이 글은 평가 하네스가 내부에서 실제로 수행하는 여섯 단계를 분해하고 lm-evaluation-harness 0.
2026-08-02 · 35 분 읽기 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibilityAI 에이전트의 메모리는 실제로 어떻게 만드는가 — 네 가지 설계와, 벤치마크가 실제로 증명한 것
"에이전트 메모리"는 한 가지 기술이 아니라 최소 네 가지 서로 다른 설계를 뭉뚱그린 말입니다 — 파일 스크래치패드, 요약/컴팩션, 벡터 회수, 지식 그래프. 이 글은 각각이 실제로 무엇을 하는지 제품 문서로 확인하고, 그다음 훨씬 불편한 질문을 던집니다: 어느 쪽이 낫다는 근거가 실제로 측정된 적이 있나? Mem0 논문(arXiv:2504.19413)의 표를 직접 읽어 보면, 헤드라인인 "
2026-07-17 · 38 분 읽기 #ai#ai-agent#agent-memory#llm#benchmark브라우저·컴퓨터를 조작하는 AI 에이전트, 지금 어디까지 왔나 — 벤치마크 숫자가 실제로 재는 것
"컴퓨터 유즈 에이전트가 OSWorld에서 83.5%를 찍었다"와 "가장 강한 에이전트도 20.6%밖에 못 끝낸다"는 둘 다 2026년에 나온 사실이고, 둘 다 맞습니다. 앞은 OSWorld 1.0, 뒤는 같은 팀이 만든 OSWorld 2.0입니다. 이 글은 그 간극이 어디서 오는지를 원 논문과 벤치마크 저자들의 자체 측정으로 따라갑니다. OSWorld 과제의 절반 가까이는 GUI를 거의 쓰
2026-07-17 · 46 분 읽기 #ai#computer-use#browser-agents#benchmark#prompt-injectiontts-bench: 품질이 주관적일 때 로컬 TTS를 비교하는 법
tts-bench는 개발자 5uck1ess가 만든 로컬 벤치마크로, 손에 있는 하드웨어에서 55개 TTS 모델을 비교한다. 평가를 세 렌즈로 나눈다. 속도(TTFA·RTF·메모리), 청취(모든 모델을 귀로 판단), 점수(UTMOS·WER·SIM)다. 가장 흥미로운 건 주관성에 대한 정직함이다. "가장 좋게 들리는" 단일 점수는 없다. 품질은 당신의 귀와 용도에 달렸기 때문이다. 이 글은 이
2026-07-11 · 10 분 읽기 #tts#text-to-speech#benchmark#local-ai#evaluationUniClawBench로 보는 2026년의 에이전트 벤치마크 — 살아 있는 컨테이너와 숨은 감독자
홍콩대(HKU) MMLab이 2026년 7월 arXiv에 올린 UniClawBench는 "능력 중심(capability-driven)"을 표방하는 프로액티브 에이전트 벤치마크입니다. 정적으로 미리 기록된 정답을 맞히는 대신, 살아 있는 Docker 컨테이너 안에서 단계별 체크포인트로 채점하고, 실행자·숨은 감독자·사용자 에이전트로 이루어진 닫힌 고리로 다중 턴 피드백을 시뮬레이션합니다. 40
2026-07-11 · 10 분 읽기 #ai#agents#evaluation#benchmark#llmBFCL 벤치마크 완전 가이드 2025: Tool Calling 성능 평가, 리더보드 분석, 모델 비교
BFCL(Berkeley Function Calling Leaderboard)의 모든 것! 벤치마크 카테고리(Simple/Multiple/Parallel/Relevance/AST), 평가 메트릭, 모델 성능 비교(Claude/GPT/Gemini/Llama), 자체 모델 평가 방법, Tool Calling 개선 전략.
2026-03-25 · 35 분 읽기 #bfcl#benchmark#tool-calling#function-calling#evaluation2025 오픈소스 AI 모델 완전 비교: DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral — 누가 왕인가
DeepSeek R1(671B/37B), Llama 4 Scout/Maverick, Qwen 3(235B MoE), Mistral 8x22B — 2025년 오픈소스 AI 모델 4강 완전 비교. 벤치마크, 라이센스, 배포 방법, 비용 분석까지.
2026-03-22 · 32 분 읽기 #open-source#ai#llm#deepseek#llama2025년 3월 테크·AI·K-POP 위클리 다이제스트: GTC부터 BTS 컴백까지
NVIDIA GTC 2025 Blackwell Ultra 발표, Gemini 2.5 Pro 등장, MCP의 업계 표준화, DeepSeek-R1 오픈소스 충격, BTS 5년만의 완전체 컴백, JENNIE 솔로 앨범 밀리언셀러 등 2025년 3월 테크·AI·K-POP 핵심 트렌드를 한눈에 정리합니다.
2026-03-21 · 22 분 읽기 #culture#ai#kpop#nvidia#gtcLLM 평가와 벤치마킹 완전 가이드: MMLU, MT-Bench, RAGAS, LM-Eval
LLM을 올바르게 평가하는 완전 가이드. MMLU, MT-Bench, HumanEval 같은 표준 벤치마크부터 RAGAS로 RAG 시스템 평가, LM-Evaluation-Harness 실전 사용, 그리고 프로덕션 LLM 평가 파이프라인까지 상세히 다룹니다.
2026-03-17 · 25 분 읽기 #llm#evaluation#benchmark#ragas#lm-evalLLM, Tool Calling, Embedding 벤치마크 완전 분석: 각 벤치마크가 측정하는 것
MMLU, HellaSwag, HumanEval, BFCL, MTEB 등 주요 AI 벤치마크들이 정확히 무엇을 측정하는지, 각 점수의 의미와 한계, 그리고 실제 활용 시 어떤 벤치마크를 참고해야 하는지 완전히 분석합니다.
2026-03-17 · 44 분 읽기 #llm#benchmark#mmlu#mteb#bfclAI 벤치마크 데이터셋 완전 가이드: ImageNet, COCO, GLUE, MMLU, HumanEval
AI 모델 평가를 위한 주요 벤치마크 데이터셋 완전 가이드. 컴퓨터 비전(ImageNet, COCO, ADE20K), NLP(GLUE, SuperGLUE, SQuAD, MMLU), 코드(HumanEval, MBPP), LLM 평가(HELM, MT-Bench)까지 상세히 분석합니다.
2026-03-17 · 38 분 읽기 #benchmark#datasets#imagenet#coco#glue