태그: #paper-review
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 23 편
음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech이미지 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 샘플 이미지 대신 설계를 읽기
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#image-generation#diffusion-transformerOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-ai리더보드와 벤치마크를 읽는 법 — SOTA는 왜 유통기한이 짧은가
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#benchmark#evaluation비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 데모가 아니라 제약을 읽기
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#video-generation#diffusion-transformer텍스트 LLM 기술 리포트, 무엇을 읽을 것인가 — 순위 대신 설계 결정 읽기
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#llm#moe스탠퍼드 감옥 실험은 어떻게 무너졌나 — 기록보관소가 말해 준 것
1971년 짐바르도의 감옥 실험은 평범한 대학생이 6일 만에 잔혹한 교도관이 됐다는 이야기로 교과서와 영화에 실렸습니다. 그런데 원 자료는 최상급 학술지가 아니라 작은 저널에 실렸고, 표본은 24명이었으며, 모집 광고 자체가 특정 성향의 지원자를 끌어들였다는 검증이 2007년에 나왔습니다. 2018년 티보 르 텍시에가 스탠퍼드 기록보관소에서 확인한 것은 더 결정적입니다. 교도관들은 강압적으로
2026-07-26 · 17 분 읽기 #psychology#paper-review#social-psychology#replication#research-ethics손실은 이득보다 두 배 아프다 — 전망 이론 원문과 그 후 45년
"사람은 이득의 기쁨보다 손실의 고통을 두 배 크게 느낀다"는 문장은 협상 교재와 가격 정책 문서의 단골이 됐습니다. 출처인 카너먼과 트버스키의 1979년 이코노메트리카 논문을 열어 보면, 실제 재료는 이스라엘 대학생들에게 던진 가설적 도박 문항 몇 개와 응답 비율표입니다. 유명한 "두 배"라는 숫자는 1979년이 아니라 대학원생 25명을 대상으로 한 1992년 후속 연구의 중앙값이고, 20
2026-07-26 · 22 분 읽기 #psychology#paper-review#behavioral-economics#decision-making#money밀그램 복종 실험 재검토 — 65퍼센트라는 숫자의 뒷면
1961년 예일에서 시작된 밀그램 실험은 참가자의 65퍼센트가 최대 전압까지 갔다는 한 문장으로 요약되어 왔습니다. 그런데 그 숫자는 24개에 이르는 변형 실험 중 하나의 값일 뿐이고, 조건을 바꾸면 복종률은 0퍼센트에서 92.5퍼센트까지 움직였습니다. 지나 페리가 예일 기록보관소에서 확인한 것은 실험자가 대본에 없는 압박을 반복했고 상당수 참가자가 속임수를 의심했다는 증거입니다. 하슬람과
2026-07-26 · 19 분 읽기 #psychology#paper-review#social-psychology#obedience#research-ethics38명은 처음부터 없었다 — 방관자 효과의 신화와 진짜 실험
1964년 키티 제노비스가 살해되는 동안 38명의 이웃이 지켜보기만 했다는 뉴욕타임스 기사는 방관자 효과라는 개념을 낳았습니다. 그런데 2007년 아메리칸 사이콜로지스트에 실린 검증은 그 숫자와 정황이 상당 부분 사실이 아니라고 정리합니다. 목격 가능한 사람은 훨씬 적었고, 신고는 있었고, 한 이웃은 현장에 내려와 그녀를 안고 있었습니다. 그럼에도 그 기사가 촉발한 1968년 달리와 라타네의
2026-07-26 · 21 분 읽기 #psychology#paper-review#social-psychology#ethics#communication던닝-크루거 효과 — 그 유명한 그래프는 원 논문에 없습니다
인터넷에 떠도는 우매함의 봉우리 그래프는 던닝과 크루거의 1999년 논문에 존재하지 않습니다. 원 논문은 코넬 학부생에게 유머, 논리, 문법 과제를 시키고 성적 사분위별로 자기평가를 비교한 네 개의 연구였고, 실제 결과는 하위권의 과대평가만큼이나 상위권의 과소평가를 보여 줍니다. 더 아픈 지적은 따로 있습니다. 자기평가와 실제 성적이 아무 관계가 없는 난수만 넣어도 똑같은 모양의 그래프가 그
2026-07-26 · 17 분 읽기 #psychology#paper-review#metacognition#self-assessment#statistics1달러가 20달러를 이긴 실험 — 인지부조화 원문과 60년의 반론
지루한 과제를 시킨 뒤 거짓말을 부탁하고, 한쪽에는 1달러를, 다른 쪽에는 20달러를 줬습니다. 나중에 과제가 더 재미있었다고 답한 쪽은 적게 받은 사람들이었습니다. 페스팅거와 칼스미스의 1959년 논문은 조건당 20명, 마이너스 5에서 플러스 5까지의 척도 위에서 벌어진 작은 실험이지만 사회심리학의 방향을 바꿨습니다. 종말론 집단 잠입 기록의 방법론적 한계, 벰의 자기지각 이론이라는 경쟁
2026-07-26 · 23 분 읽기 #psychology#paper-review#social-psychology#decision-making#mindset마시멜로 실험은 절반만 사실이다 — 원 논문과 2018년 재검증까지
4살의 참을성이 인생을 결정한다는 마시멜로 실험. 그런데 원 논문을 실제로 읽어 보면 대중적 신화와 상당히 다릅니다. 1972년 미셸의 원 실험이 실제로 밝힌 것(기다림의 기술은 전략이라는 것), 유명한 장기 추적 상관의 표본 크기, 그리고 2018년 왓츠 연구팀이 900여 명으로 재검증했을 때 가정환경을 통제하자 효과가 크게 줄어든 이야기까지 — 논문으로 읽는 심리학 첫 편입니다.
2026-07-20 · 11 분 읽기 #psychology#paper-review#mindset#self-control#replication다시 읽지 말고 덮고 떠올려라 — 시험 효과의 원 논문과 간격 반복 알고리즘
공부한 것을 다시 읽으면 아는 느낌이 들지만, 시험을 보면 무너집니다. 2006년 뢰디거와 카픽의 실험은 그 이유를 정확히 보여 줍니다. 반복 읽기는 5분 뒤 시험에서 이기고, 일주일 뒤 시험에서는 반복 인출(스스로 시험 보기)에게 크게 집니다. 인출 연습과 간격 효과의 원 논문을 읽고, 안키가 쓰는 간격 반복 알고리즘 SM-2를 파이썬으로 직접 구현해 봅니다. 공부법을 바꾸는 데 이 한 편
2026-07-20 · 12 분 읽기 #psychology#paper-review#mindset#learning#memory달리기와 항우울제를 나란히 시험하다 — SMILE 임상시험과 그 후 25년
운동이 기분에 좋다는 말은 누구나 하지만, 우울증 환자에게 운동과 항우울제를 무작위 배정해 정면 비교한 임상시험은 흔치 않습니다. 1999년 블루멘탈의 SMILE 연구는 16주 뒤 두 치료의 관해율이 비슷했고, 10개월 추적에서는 운동 그룹의 재발률이 가장 낮았다고 보고했습니다. 이 결과를 어디까지 믿어야 하는지 — 설계의 한계, 2007년 재실험, 218개 임상시험을 종합한 2024년 네트
2026-07-20 · 10 분 읽기 #psychology#paper-review#mindset#exercise#mental-health의지력은 정말 고갈되는가 — 무 실험에서 재현성 위기까지, 그리고 코드로 보는 출판 편향
"의지력은 근육처럼 소모된다"는 자아 고갈 이론은 한때 심리학에서 가장 탄탄해 보이는 이론이었습니다. 초콜릿 향이 가득한 방에서 무를 먹은 사람들이 퍼즐을 더 빨리 포기한 1998년 실험부터, 수백 편의 지지 연구, 그리고 23개 연구실 2천여 명의 공동 재검증이 사실상 0의 효과를 보고한 2016년의 반전까지. 어떻게 수백 편의 논문이 있는 이론이 무너질 수 있는지, 출판 편향 시뮬레이션
2026-07-20 · 11 분 읽기 #psychology#paper-review#mindset#willpower#replication1만 시간 논쟁의 원 논문 — 베를린 바이올리니스트와 12%의 진실
1만 시간의 법칙이 태어난 1993년 에릭손 논문을 실제로 열어 보면, 대중서가 전한 것과 꽤 다른 그림이 나옵니다. 베를린 음악원 연구의 실제 설계(표본 30명, 회고적 추정)와 논문이 정말 주장한 것, 그리고 2014년 매크나마라 메타분석이 내놓은 반전 — 연습량은 실력 차이의 평균 12%만 설명한다 — 을 차례로 읽습니다. 연습 무용론도 만능론도 아닌, 그 사이의 정확한 지점을 찾는 편
2026-07-20 · 10 분 읽기 #psychology#paper-review#mindset#deliberate-practice#expertise딴생각하는 마음은 불행한 마음 — 아이폰으로 수행된 25만 건의 행복 연구
2010년 사이언스에 실린 두 쪽짜리 논문은 스마트폰 앱으로 2,250명의 일상을 실시간 표집해 놀라운 사실을 보고했습니다. 사람들은 깨어 있는 시간의 47%를 지금 하는 일이 아닌 다른 생각을 하며 보내고, 무슨 일을 하는지보다 딴생각 여부가 행복을 더 잘 예측하며, 즐거운 딴생각조차 집중보다 행복하지 않았다는 것. 경험 표집법이라는 연구 방법을 코드로 이해하고, 통근길과 설거지가 달라지는
2026-07-20 · 10 분 읽기 #psychology#paper-review#mindset#happiness#focus감사 일기는 정말 효과가 있을까 — 축복 세기 실험과 정직한 효과 크기
자기계발서의 단골 처방인 감사 일기의 출처는 2003년 에먼스와 매컬러프의 축복 세기 실험입니다. 매주 감사한 일 다섯 가지를 적은 그룹은 골칫거리를 적은 그룹보다 더 행복했고, 운동을 더 했고, 잠까지 더 잘 잤습니다. 다만 후속 메타분석이 말하는 효과 크기는 광고보다 겸손합니다. 원 논문의 세 실험을 차례로 읽고, 과장 없이 남는 것(작지만 값싸고 안전한 개입)과 효과를 높이는 조건, 그
2026-07-20 · 10 분 읽기 #psychology#paper-review#mindset#gratitude#healing6시간 수면 2주는 밤샘 이틀과 같다 — 수면 부채의 도스-반응 실험
"나는 6시간이면 충분해"라고 말하는 사람에게 보여 줄 논문이 있습니다. 2003년 밴 던진 연구팀은 참가자들을 실험실에 2주간 격리하고 수면을 4·6·8시간으로 정확히 배정한 뒤 매일 인지 능력을 측정했습니다. 결과: 6시간 그룹의 주의력은 직선으로 하락해 2주 뒤 이틀 밤샘 수준에 도달했는데, 정작 본인들의 졸림 평가는 며칠 만에 멈춰 있었습니다. 손상은 쌓이는데 자각은 멈추는 것 — 수
2026-07-20 · 10 분 읽기 #psychology#paper-review#mindset#sleep#health