블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3672 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 260#career 233#ai 220#llm 216#devops 195#2026-04 158#security 147#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 66#cs-fundamentals 63#rag 63#systems 63#python 55#learning 54#self-improvement 53
vLLM 내부 구조 (7) — 배포 튜닝과 흔한 함정, OOM 진단 순서
vLLM 배포를 실제로 튜닝하는 순서를 정리했습니다. gpumemoryutilization이 무엇을 정하는지, 텐서 병렬과 파이프라인 병렬을 언제 쓰는지, 양자화와 KV 캐시 자료형을 어떻게 고르는지, 그리고 OOM이 났을 때 기동 단계와 운영 단계를 나눠 진단하는 순서까지 공식 문서 기준으로 확인해 정리했습니다. vLLM 내부 구조 시리즈 마지막 편.
2026-08-12 · 17 분 읽기 #vllm#gpu#quantization#tensor-parallel#llmvLLM 내부 구조 (2) — PagedAttention은 KV 캐시를 왜 페이지로 쪼갰는가
PagedAttention이 KV 캐시를 블록 단위로 쪼갠 이유를 원 논문(arXiv:2309.06180)과 vLLM 공식 설계 문서로 확인해 정리했습니다. 연속 할당이 만드는 내부·외부 단편화, 블록 테이블이 하는 일, 블록 크기를 키우고 줄일 때의 트레이드오프까지 다룹니다. vLLM 내부 구조 시리즈 2편.
2026-08-12 · 12 분 읽기 #vllm#paged-attention#kv-cache#llm#gpuvLLM 내부 구조 (6) — 컨텍스트 윈도우, max_model_len, max_tokens 완전 정리
컨텍스트 윈도우와 maxtokens 차이가 헷갈린다면 이 글 하나로 정리됩니다. 모델의 컨텍스트 윈도우(구조적 한계), vLLM의 maxmodellen(엔진 설정), 요청당 생성 상한인 maxtokens와 maxcompletiontokens, 그리고 배치 한도인 maxnumbatchedtokens와 maxnumseqs가 각각 무엇을 제한하는지 비교표와 실제 에러 메시지로 정리했습니다. 입력과
2026-08-12 · 20 분 읽기 #vllm#context-window#max-model-len#max-tokens#llm음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech이미지 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 샘플 이미지 대신 설계를 읽기
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#image-generation#diffusion-transformer토크나이저 내부 — 한국어가 토큰을 더 먹는 이유와 그 비용
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocabsize와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#tokenizer#bpe#korean-nlp정규화와 활성화 — 학습을 무너뜨리지 않는 법
RMSNorm과 프리노름, SwiGLU가 왜 지금의 표준이 되었는지 config 값으로 확인하고, Qwen3의 QK-Norm과 Kimi K2의 QK-Clip처럼 어텐션 로짓 폭주를 막는 최신 장치를 실제 리포트의 수치와 함께 정리합니다. 안정성을 위해 무엇을 추가하고 무엇을 감수하는지 다룹니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rmsnorm#swiglu#training-stability어텐션 변형 — MHA에서 MLA까지, KV 캐시는 어떻게 줄어드는가
MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#attention#gqa#mlaOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-ai리더보드와 벤치마크를 읽는 법 — SOTA는 왜 유통기한이 짧은가
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#benchmark#evaluation기술 리포트 비판적으로 읽기 — 무엇이 적히고 무엇이 빠지는가
모델 기술 리포트에서 검증 가능한 항목과 검증 불가능한 항목을 구분하는 법을 정리합니다. 자체 보고 벤치마크의 한계, config와 리포트가 어긋나는 지점, 게이트된 저장소에서 확인할 수 없는 값, 그리고 시리즈 전체에서 쓴 확인 절차를 실제 사례로 보여 줍니다.
2026-08-12 · 13 분 읽기 #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE 라우팅 — 전문가는 어떻게 뽑히는가
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#mixture-of-experts#moe#routing비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 데모가 아니라 제약을 읽기
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#video-generation#diffusion-transformer텍스트 LLM 기술 리포트, 무엇을 읽을 것인가 — 순위 대신 설계 결정 읽기
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#llm#moe학습 레시피 — 사전학습에서 후학습까지, 리포트는 무엇을 적는가
Llama 3의 세 단계와 여섯 번의 컨텍스트 확장, Qwen3의 세 단계 사전학습, DeepSeek-V3의 학습률 스케줄과 두 단계 YaRN 확장, Kimi K2의 데이터 재작성 실험을 리포트에 적힌 그대로 비교하고, 학습 단계 기술을 읽는 법을 정리합니다.
2026-08-12 · 12 분 읽기 #ai-papers#model-internals#pretraining#training-recipe#data-mixture위치 인코딩 — RoPE와 컨텍스트 확장의 대가
ropetheta 하나가 문맥 길이에 어떻게 작용하는지 파장 계산으로 보여 주고, Llama 3의 500000, Qwen3의 ABF, DeepSeek-V3와 Kimi K2의 YaRN 설정, GLM-4.5의 부분 회전을 실제 config로 비교합니다. 긴 컨텍스트가 왜 공짜가 아닌지 프리필 연산량과 캐시 비용으로 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 완전 해부 — 설정 파일 한 장으로 모델 구조 읽기
hiddensize, numhiddenlayers, numattentionheads와 numkeyvalueheads, headdim, intermediatesize, ropetheta, vocabsize, tiewordembeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#config-json#transformer#llm-architecture에이전트를 다섯 개 돌리면 정말 다섯 배 빨라질까 — 병렬 작업의 병목은 생성이 아닙니다
코딩 에이전트를 여러 개 동시에 돌리는 전용 환경이 늘고 있습니다. Orca는 그중 하나로, 프롬프트 하나를 여러 에이전트에 뿌리고 각각을 별도의 git worktree에 격리한 뒤 결과를 비교해 하나를 병합하는 방식을 내세웁니다. 그런데 처리량을 늘리면 병목은 사라지지 않고 자리를 옮깁니다. 옮겨 가는 곳이 리뷰와 병합이라는 것을 리틀의 법칙으로 짚고, 도구를 설치하기 전에 git work
2026-08-09 · 16 분 읽기 #developer-tools#git#worktree#code-review#workflowx86 하드웨어 백도어라는 말의 정확한 범위 — rosenbridge를 저자가 쓴 대로 읽기
저장소 제목은 x86 CPU의 하드웨어 백도어라고 되어 있지만, README 본문은 영향받는 것이 VIA C3뿐인 것으로 여겨지며 이후 세대에는 이 기능이 없다고 명시합니다. 저자는 면책 조항에서 이것이 임베디드 시장용 기능으로 선의로 만들어졌다가 초기 세대에서 의도치 않게 활성화된 채 남은 것으로 본다며 악의를 함의하지 않는다고 적었습니다. 이 글은 그 경계선을 정확히 옮긴 뒤, 정작 일반
2026-08-09 · 18 분 읽기 #security#hardware#x86#cpu#fuzzing방문자 통계로는 트래픽의 0.5퍼센트만 보인다 — 봇 방어는 자기 신고가 아니라 출처로 한다
150만 페이지짜리 사이트를 1년간 스크레이퍼로부터 방어한 기록을 근거로, 봇 트래픽 대응의 원칙을 정리합니다. 자바스크립트 기반 분석 도구는 봇을 세지 못하므로 서버 로그를 봐야 하고, 사용자 에이전트 같은 자기 신고 값 대신 ASN과 지리 위치, 암호학적으로 검증된 봇 여부처럼 위조하기 어려운 출처 정보로 규칙을 세워야 합니다. 크롤당 유입 방문자 수라는 지표, Cloudflare가 공개
2026-08-09 · 21 분 읽기 #network#bot#cloudflare#waf#scraping