태그: #statistics
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
우리 서비스용 평가셋 만들기 — 트래픽 수집부터 통계적 유의성 판정까지
공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가
2026-08-02 · 37 분 읽기 #llm-evaluation#eval-set#rubric#statistics#regression-testing던닝-크루거 효과 — 그 유명한 그래프는 원 논문에 없습니다
인터넷에 떠도는 우매함의 봉우리 그래프는 던닝과 크루거의 1999년 논문에 존재하지 않습니다. 원 논문은 코넬 학부생에게 유머, 논리, 문법 과제를 시키고 성적 사분위별로 자기평가를 비교한 네 개의 연구였고, 실제 결과는 하위권의 과대평가만큼이나 상위권의 과소평가를 보여 줍니다. 더 아픈 지적은 따로 있습니다. 자기평가와 실제 성적이 아무 관계가 없는 난수만 넣어도 똑같은 모양의 그래프가 그
2026-07-26 · 17 분 읽기 #psychology#paper-review#metacognition#self-assessment#statisticsLLM 평가를 감으로 하지 않는 법 — 표본 크기, 심사자 편향, CI 회귀 테스트
프롬프트를 고치고 "좋아진 것 같다"로 배포하는 팀은 조용히 쌓이는 회귀를 볼 방법이 없습니다. 평가를 어서션, 골든 데이터셋, LLM 심사자, 사람 평가의 네 층위로 나눠 각각의 비용과 신뢰도를 정리하고, 심사자 모델의 위치 편향과 길이 선호를 어떻게 상쇄하는지 다룹니다. 예시 20개로 낸 결론의 신뢰구간이 실제로 얼마나 넓은지 계산하고, 짝지은 비교가 필요 표본을 몇 분의 일로 줄이는지
2026-07-26 · 19 분 읽기 #llm#evaluation#llm-as-judge#statistics#regression-testing공업수학 시리즈 24편: 수치해석, 최적화, 그래프, 확률과 통계 로드맵
공업수학 시리즈의 첫 사이클을 마무리하며 수치해석, 최적화, 그래프, 확률과 통계가 왜 중요한지와 앞으로 어떤 순서로 공부하면 좋은지 정리합니다.
2026-03-19 · 8 분 읽기 #engineering-math#numerical-methods#optimization#probability#statisticsAI/ML을 위한 수학 완전 정복: 선형대수, 미적분, 확률통계
AI와 머신러닝을 이해하기 위한 핵심 수학을 완전히 정복하는 가이드. 선형대수(벡터, 행렬, 고유값), 미적분(편미분, 체인 룰), 확률통계(확률분포, 최대우도추정, 베이즈)까지 직관적으로 설명합니다.
2026-03-17 · 38 분 읽기 #mathematics#linear-algebra#calculus#probability#statisticsAI를 위한 수학 완전 가이드 — 선형대수부터 정보이론까지
AI/딥러닝에 필요한 수학을 코드와 직관으로 정리합니다. 선형대수(행렬, 고유값), 미적분(편미분, 역전파), 확률/통계(베이즈, 분포), 최적화(경사하강법), 정보이론(엔트로피, KL-divergence)까지.
2026-03-02 · 16 분 읽기 #ai#mathematics#linear-algebra#calculus#probability