태그: #reproducibility
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
기술 리포트 비판적으로 읽기 — 무엇이 적히고 무엇이 빠지는가
모델 기술 리포트에서 검증 가능한 항목과 검증 불가능한 항목을 구분하는 법을 정리합니다. 자체 보고 벤치마크의 한계, config와 리포트가 어긋나는 지점, 게이트된 저장소에서 확인할 수 없는 값, 그리고 시리즈 전체에서 쓴 확인 절차를 실제 사례로 보여 줍니다.
2026-08-12 · 13 분 읽기 #ai-papers#model-internals#tech-report#benchmarks#evaluationLLM Ops가 실제로 하는 일 — 재현, 오염, 체크포인트, 승격, 그리고 롤백
LLM Ops를 도구 목록이 아니라 책임 목록으로 정리했습니다. 학습 실행을 다시 만들 수 있게 하는 실행 명세에 무엇이 들어가야 하는지, 평가 세트 오염을 어떻게 막고 감사하는지, 체크포인트 주기를 장애율에서 역산하는 공식과 보관 비용의 실제 숫자, 평가를 CI에 넣을 때 무엇을 게이트로 삼는지를 다룹니다. 후반부는 학습과 서빙 사이의 인수인계에서 실제로 깨지는 지점들과 배포 후 회귀 감지
2026-08-02 · 23 분 읽기 #mlops#llmops#reproducibility#evaluation#model-registryLLM 벤치마크 도구를 뜯어보기 — 같은 MMLU가 하네스마다 다른 점수를 내는 이유
벤치마크 점수는 모델의 속성이 아니라 특정 조건에서 수행된 측정의 결과입니다. 같은 LLaMA 65B가 같은 MMLU에서 63.6점과 48.8점을 동시에 받은 사건은, 하네스가 프롬프트를 어떻게 조립하고 정답을 어떻게 파싱하느냐가 점수의 상당 부분을 결정한다는 것을 보여 줍니다. 이 글은 평가 하네스가 내부에서 실제로 수행하는 여섯 단계를 분해하고 lm-evaluation-harness 0.
2026-08-02 · 35 분 읽기 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility2026년 새로운 파이썬 노트북 스택 — Marimo·Quarto, 그리고 Jupyter 이후의 데이터 워크플로 (Observable·Pluto·Polars·DuckDB까지)
Jupyter의 숨은 상태(hidden state)·비-diff 가능·재현 불가 문제는 2026년에도 데이터 사이언스 워크플로의 가장 큰 마찰점이다. Marimo는 노트북을 .py 파일로 저장하고 셀 순서 대신 데이터플로 그래프로 실행하는 반응형 노트북이고, Quarto는 RMarkdown의 후계자로 다국어 멀티-포맷 데이터 퍼블리싱을 가능하게 한다. 여기에 Observable Framewo
2026-05-14 · 33 분 읽기 #marimo#quarto#jupyter#python-notebook#reactive-notebook