태그: #evaluation
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 38 편
AI 엔지니어 회의 영어: 모른다고 말하면서 신뢰를 잃지 않는 법
AI 팀 회의에서 가장 자주 필요한 영어는 확신을 표현하는 말이 아니라 불확실성을 신뢰감 있게 표현하는 말입니다. 평가 결과와 그 한계를 함께 말하기, 원인이 아직 불명확한 회귀 보고, 지표는 올랐는데 품질은 아닐 때, 라벨링 이견, 비용과 지연 시간 트레이드오프, 연구 일정과 제품 일정의 충돌, 비기술 이해관계자에게 불확실성 설명하기, 남의 실험에 이견 제기하기, 재현이 안 될 때까지 상황
2026-08-16 · 47 분 읽기 #english#business-english#meeting#ai#llm리워드 해킹 — 지표는 오르는데 과제는 실패합니다
에이전트가 테스트를 통과시키는 가장 싼 방법이 테스트를 고치는 것이라면, 에이전트는 그렇게 합니다. 리워드 해킹은 버그가 아니라 우리가 정의한 목표를 정확히 최적화한 결과입니다. 하네스 엔지니어링 시리즈 6편에서 채점 기준 완화와 assertion 삭제 같은 흔한 형태, 권한 격리가 지우는 절반, 그리고 견제 지표 설계까지 리워드 해킹 대응을 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트평가자 병목 — 약한 채점자가 시스템 전체의 상한이 됩니다
하네스를 아무리 고쳐도 점수가 안 오른다면, 병목은 하네스가 아니라 평가자일 수 있습니다. 측정할 수 없는 품질은 선택할 수 없고, 그래서 약한 채점자가 시스템 전체의 상한이 됩니다. 하네스 엔지니어링 시리즈 5편에서 스모크 테스트부터 단위 테스트, 루브릭, 채점 자료 격리, 견제 지표 패널까지 평가자의 사다리와 평가 보정을 먼저 해야 하는 이유를 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech이미지 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 샘플 이미지 대신 설계를 읽기
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#image-generation#diffusion-transformerOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-ai리더보드와 벤치마크를 읽는 법 — SOTA는 왜 유통기한이 짧은가
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#benchmark#evaluation기술 리포트 비판적으로 읽기 — 무엇이 적히고 무엇이 빠지는가
모델 기술 리포트에서 검증 가능한 항목과 검증 불가능한 항목을 구분하는 법을 정리합니다. 자체 보고 벤치마크의 한계, config와 리포트가 어긋나는 지점, 게이트된 저장소에서 확인할 수 없는 값, 그리고 시리즈 전체에서 쓴 확인 절차를 실제 사례로 보여 줍니다.
2026-08-12 · 13 분 읽기 #ai-papers#model-internals#tech-report#benchmarks#evaluation비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 데모가 아니라 제약을 읽기
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#video-generation#diffusion-transformer텍스트 LLM 기술 리포트, 무엇을 읽을 것인가 — 순위 대신 설계 결정 읽기
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#llm#moe하네스는 설정이 아니라 배포물입니다 — 자기 개선 루프의 진짜 병목
Lilian Weng이 2026년 7월에 정리한 하네스 엔지니어링 글은 모델을 감싸는 시스템 전체를 하나의 공학 대상으로 이름 붙입니다. 이 글은 그 정의를 옮기는 대신, 하네스를 설정 파일이 아니라 버전이 붙은 배포물로 다루면 무엇이 달라지는지를 다룹니다. 하네스 지문을 찍어 회귀를 잡는 법, 컨텍스트를 늘어나는 프롬프트가 아니라 플레이북으로 다루는 법, 그리고 자기 개선 루프에서 진짜 병
2026-08-09 · 14 분 읽기 #llm#agent#harness-engineering#context-engineering#evaluation평가 주도 개발에서 가장 먼저 보정해야 하는 것은 심사자입니다
Airbnb 엔지니어링이 2026년 7월에 공개한 평가 주도 개발 회고는 평가셋을 먼저 쓰라는 이야기가 아니라, 채점하는 모델부터 계측기로 인정받아야 한다는 이야기에 가깝습니다. 이 글은 심사자 모델을 골든셋 50~100개로 보정하는 절차, 일치도를 단순 정확도가 아니라 카파로 재야 하는 이유, 그리고 보정되지 않은 심사자가 어떻게 팀 전체를 잘못된 방향으로 최적화시키는지를 실행 가능한 코드
2026-08-09 · 15 분 읽기 #ai#llm#eval-driven-development#llm-as-judge#evaluationLLM Ops가 실제로 하는 일 — 재현, 오염, 체크포인트, 승격, 그리고 롤백
LLM Ops를 도구 목록이 아니라 책임 목록으로 정리했습니다. 학습 실행을 다시 만들 수 있게 하는 실행 명세에 무엇이 들어가야 하는지, 평가 세트 오염을 어떻게 막고 감사하는지, 체크포인트 주기를 장애율에서 역산하는 공식과 보관 비용의 실제 숫자, 평가를 CI에 넣을 때 무엇을 게이트로 삼는지를 다룹니다. 후반부는 학습과 서빙 사이의 인수인계에서 실제로 깨지는 지점들과 배포 후 회귀 감지
2026-08-02 · 23 분 읽기 #mlops#llmops#reproducibility#evaluation#model-registryGemini Robotics 2와 로봇 파운데이션 모델 — 전신 제어가 실제로 바꾸는 것
2026년 7월 30일 Google DeepMind가 Gemini Robotics 2를 공개하면서 휴머노이드의 발끝부터 손끝까지를 하나의 비전-언어-행동 모델로 제어한다고 발표했습니다. 함께 공개된 숫자는 흥미롭게도 자랑이 아니라 현재 상태의 정직한 기록에 가깝습니다 — 전구를 푸는 데 92퍼센트, 끼우는 데 36퍼센트, 바닥에서 물건을 집는 데 45.7퍼센트. 이 글은 VLA가 실제로 무엇
2026-07-31 · 26 분 읽기 #ai#robotics#vla#foundation-models#evaluationRAG가 엉뚱한 답을 할 때 — 검색 실패와 생성 실패를 가르는 디버깅 절차
RAG가 틀린 답을 내면 대부분 프롬프트부터 고치는데, 실제 원인의 다수는 검색 단계에 있습니다. 정답 청크를 손으로 넣어 보는 한 번의 실험으로 검색 실패와 생성 실패를 가르는 절차부터 시작해, 청킹이 왜 가장 흔한 범인인지, 임베딩 유사도가 의미 유사도와 갈라지는 지점과 BM25 혼합이 자주 이기는 이유, 재순위화가 값을 하는 조건, 청크에 문서 제목과 메타데이터를 붙였을 때의 효과를 정
2026-07-26 · 22 분 읽기 #llm#rag#retrieval#chunking#evaluationLLM 평가를 감으로 하지 않는 법 — 표본 크기, 심사자 편향, CI 회귀 테스트
프롬프트를 고치고 "좋아진 것 같다"로 배포하는 팀은 조용히 쌓이는 회귀를 볼 방법이 없습니다. 평가를 어서션, 골든 데이터셋, LLM 심사자, 사람 평가의 네 층위로 나눠 각각의 비용과 신뢰도를 정리하고, 심사자 모델의 위치 편향과 길이 선호를 어떻게 상쇄하는지 다룹니다. 예시 20개로 낸 결론의 신뢰구간이 실제로 얼마나 넓은지 계산하고, 짝지은 비교가 필요 표본을 몇 분의 일로 줄이는지
2026-07-26 · 19 분 읽기 #llm#evaluation#llm-as-judge#statistics#regression-testingAI 코드 리뷰는 실제로 쓸 만한가 — 측정된 증거가 말하는 정확도와 거짓 양성
AI 코드 리뷰 도구의 마케팅 문구에는 "PR의 80%에 사람 코멘트가 필요 없다" 같은 숫자가 넘치지만, 정작 정밀도와 거짓 양성률을 함께 공개한 곳은 거의 없습니다. 공개된 측정치를 모아 보면 방향은 대체로 일치합니다 — 오픈소스 PR에서 AI 리뷰 코멘트가 실제 코드 변경으로 이어진 비율은 도구에 따라 0.9~19.2%로, 사람 코멘트의 60%에 크게 못 미쳤습니다(Gan 등, 깃허브
2026-07-17 · 47 분 읽기 #ai#code-review#static-analysis#evaluation#software-engineering시뮬레이션된 고객은 절대 떠나지 않는다 — LLM 유저 시뮬레이터가 에이전트 점수를 부풀리는 지점
τ-bench 계열의 대화형 에이전트 벤치마크에서 "사용자" 역할은 또 다른 LLM이 맡습니다. 그런데 이 시뮬레이터는 측정 대상이 아니라 측정 도구이고, 도구는 교정을 받아야 합니다. 2026년에 나온 세 편의 검증 연구는 같은 방향을 가리킵니다 — 시뮬레이션된 사용자는 너무 협조적입니다. 실제 사람 451명으로 τ-bench 프로토콜을 그대로 돌린 연구는 시뮬레이터가 만드는 "이지 모드"
2026-07-16 · 41 분 읽기 #ai#llm#evaluation#agents#simulationtts-bench: 품질이 주관적일 때 로컬 TTS를 비교하는 법
tts-bench는 개발자 5uck1ess가 만든 로컬 벤치마크로, 손에 있는 하드웨어에서 55개 TTS 모델을 비교한다. 평가를 세 렌즈로 나눈다. 속도(TTFA·RTF·메모리), 청취(모든 모델을 귀로 판단), 점수(UTMOS·WER·SIM)다. 가장 흥미로운 건 주관성에 대한 정직함이다. "가장 좋게 들리는" 단일 점수는 없다. 품질은 당신의 귀와 용도에 달렸기 때문이다. 이 글은 이
2026-07-11 · 10 분 읽기 #tts#text-to-speech#benchmark#local-ai#evaluationUniClawBench로 보는 2026년의 에이전트 벤치마크 — 살아 있는 컨테이너와 숨은 감독자
홍콩대(HKU) MMLab이 2026년 7월 arXiv에 올린 UniClawBench는 "능력 중심(capability-driven)"을 표방하는 프로액티브 에이전트 벤치마크입니다. 정적으로 미리 기록된 정답을 맞히는 대신, 살아 있는 Docker 컨테이너 안에서 단계별 체크포인트로 채점하고, 실행자·숨은 감독자·사용자 에이전트로 이루어진 닫힌 고리로 다중 턴 피드백을 시뮬레이션합니다. 40
2026-07-11 · 10 분 읽기 #ai#agents#evaluation#benchmark#llm