블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3672 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 260#career 233#ai 220#llm 216#devops 195#2026-04 158#security 147#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 66#cs-fundamentals 63#rag 63#systems 63#python 55#learning 54#self-improvement 53
관측 데이터를 ClickHouse에 넣는다는 것 — 스키마, 롤업, TTL, 그리고 역할 분담
트레이스와 로그가 하루 수 TB로 늘어나면 검색 엔진이나 시계열 DB 하나로 버티기 어려워집니다. ClickHouse 가 관측 데이터에 잘 맞는 이유를 컬럼 저장과 압축, 정렬 키의 관점에서 정리하고 트레이스와 로그 테이블을 실제 DDL 로 설계합니다. 속성을 Map 으로 둘 것인지 JSON 타입으로 둘 것인지의 판단 기준, 머티리얼라이즈드 뷰로 롤업을 만드는 방법, 파티셔닝과 TTL 로 비
2026-08-02 · 25 분 읽기 #observability#clickhouse#opentelemetry#data-modeling#cost모델 카드를 제대로 읽는 법 — 5분 안에 필요한 것만 뽑아내기
모델 카드는 위에서 아래로 읽으면 필요한 정보를 못 찾도록 쓰여 있습니다. 벤치마크 표가 화면의 절반을 차지하는 동안 라이선스와 채팅 템플릿은 한 줄로 지나갑니다. 이 글은 카드를 읽는 순서를 뒤집어, 배포 판단에 실제로 필요한 일곱 가지를 5분 안에 뽑아내는 방법을 정리했습니다. 가중치 공개와 오픈소스가 어떻게 다른지, 카드의 점수를 왜 그대로 믿으면 안 되는지, 컨텍스트 길이 표기가 무엇
2026-08-02 · 33 분 읽기 #llm#huggingface#model-card#license#tokenizer멀티 GPU 학습의 네 가지 병렬화 — 무엇을 쪼개고 무엇을 통신하는가
데이터 병렬, 텐서 병렬, 파이프라인 병렬, 컨텍스트 병렬이 각각 무엇을 쪼개고 그 대가로 무엇을 통신하는지를 숫자로 정리했습니다. 먼저 Adam 혼합정밀 학습의 파라미터당 16바이트 장부를 세우고, ZeRO 1~3단계가 그 장부의 어느 항을 GPU 수로 나누는지 계산합니다. 이어서 활성화 메모리 공식으로 체크포인팅이 왜 100GB를 1GB로 만드는지 확인하고, 각 병렬화의 통신량을 스텝당
2026-08-02 · 23 분 읽기 #mlops#distributed-training#multi-gpu#fsdp#deepspeedGPU 커널을 직접 손본다는 것 — 전치 커널 하나를 5배 빠르게 만들기까지
GPU 커널을 직접 수정한다는 것이 실제로 무엇을 뜻하는지, 스레드와 워프와 메모리 계층부터 짚습니다. 점유율이 왜 목표가 아니라 증상인지, 그리고 대부분의 커널이 연산이 아니라 메모리 대역폭에 묶여 있다는 사실을 루프라인 관점에서 설명합니다. 행렬 전치 커널 하나를 naive에서 코얼레싱, 셰어드 메모리 타일링, 뱅크 충돌 제거까지 네 단계로 고치면서 각 단계의 유효 대역폭을 직접 재는 하
2026-08-02 · 32 분 읽기 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performance맡기면서 잃는 것 — 자동화가 실력을 깎는 방식은 균일하지 않습니다
계산기를 쓰면서 죄책감을 느끼는 사람은 없는데, AI가 써 준 문서를 보낸 뒤에는 대부분 조금 찜찜해합니다. 그 비대칭이 이 글의 질문입니다. 오프로딩이 순수한 이득인 영역, 실제로 능력을 깎는다고 측정된 영역, 그리고 지금 대부분의 지식노동이 놓여 있는 애매한 중간을 나눠 봅니다. 항공 분야의 자동화 의존 연구는 통념과 다른 것을 발견했고, 자동화 편향 연구는 훈련으로 막히지 않는다고 말합
2026-08-02 · 26 분 읽기 #humanities#ai#cognition#automation#skillAMD와 NVIDIA, 무엇이 다른가 — 하드웨어보다 스택이 문제인 이유
AMD GPU와 NVIDIA GPU의 차이를 하드웨어 구조, 소프트웨어 스택, 이식 경로, 생태계 성숙도의 네 층위로 나눠 감정 없이 정리합니다. SM과 CU, 텐서 코어와 매트릭스 코어의 대응 관계부터, 워프 32와 웨이브프론트 64가 코드에 실제로 어떤 버그를 만드는지 구체적으로 다룹니다. HIPIFY가 자동으로 옮겨 주는 것과 반드시 손으로 고쳐야 하는 것을 구분하고, cuBLAS와 r
2026-08-02 · 27 분 읽기 #amd#rocm#hip#nvidia#cudaGPU 컴파일러와 프레임워크 지형 — 그래프를 받아 커널을 만드는 하나의 문제, 층마다 다른 답
NVCC와 PTX부터 LLVM, MLIR, Triton, torch.compile, XLA, IREE, TVM까지를 하나의 지도 위에 올렸습니다. 이름이 다르고 소속이 다르지만 이들은 전부 같은 문제를 풉니다. 연산 그래프를 받아 실행 가능한 커널을 만드는 일입니다. 각 층이 그 문제의 어느 부분을 잘라 가져갔는지, 왜 층이 이렇게 많아졌는지, 그리고 엔지니어가 어떤 상황에서 어느 층까지 내
2026-08-02 · 39 분 읽기 #gpu#compiler#mlir#triton#pytorch기계가 주는 위로는 진짜인가 — 질문을 바꿔야 하는 이유
사람들은 실제로 AI와 대화한 뒤 기분이 나아집니다. 그걸 착각이라고 잘라 말하는 것은 무례할 뿐 아니라 부정확합니다. 이 글은 반응성이 왜 돌봄처럼 느껴지는지, 챗봇 기반 정신건강 연구가 실제로 무엇을 보여 주고 무엇을 보여 주지 못하는지 임상시험 설계까지 들여다봅니다. 그리고 진짜 질문은 "이 위로가 진짜인가"가 아니라 "무엇을 대체하고 있는가"라고 제안합니다. 보완재로서의 위로와 대체재
2026-08-02 · 27 분 읽기 #humanities#ai#psychology#loneliness#relationships커널을 쓰는 세 가지 층위 — CUDA C++, Triton, CUTLASS를 같은 문제로 비교하기
같은 GPU 커널을 손으로 쓰는 CUDA C++, 파이썬으로 타일 단위로 쓰는 Triton, 템플릿으로 조립하는 CUTLASS와 CuTe로 각각 접근할 때 무엇이 달라지는지 비교합니다. 행 단위 softmax를 CUDA C++와 Triton으로 실제로 짜서 코드량과 성능을 나란히 재고, 그 차이가 어디서 오는지 컴파일 파이프라인 수준에서 설명합니다. Triton이 커스텀 어텐션 커널의 사실상
2026-08-02 · 28 분 읽기 #triton#cuda#cutlass#gpu-kernel#compiler도구인가, 상대인가 — 의식 질문을 미뤄 두고도 할 수 있는 이야기
사람들이 AI 앞에서 가장 먼저 집어 드는 질문은 "이것에 의식이 있는가"입니다. 가장 어려운 질문이고, 아마 가장 쓸모 있는 질문은 아닙니다. 이 글은 그 질문을 닫지 않은 채로 옆에 두고, 관찰 가능한 것부터 시작합니다. 도구가 문장으로 답하기 시작했을 때 무엇이 달라졌는지, 의인화가 왜 시스템이 아니라 우리에 대한 사실인지, 엘리자 효과가 보여 주는 것과 보여 주지 않는 것이 무엇인지,
2026-08-02 · 26 분 읽기 #humanities#ai#philosophy#cognition#technology로봇공학에 필요한 수학, 순서대로 — 그리고 무엇을 나중으로 미뤄도 되는가
로봇 팔을 만들려면 수학을 어디까지 알아야 하는지에 대한 답입니다. 선형대수, 삼각법과 회전 표현, 미적분과 다변수, 미분방정식과 제어이론, 확률과 추정, 최적화 순으로 여섯 갈래를 정리했습니다. 각 갈래마다 로봇 팔의 어느 부분에서 정확히 쓰이는지, 어느 수준까지 알면 충분한지, 그리고 무엇을 나중으로 미뤄도 되는지를 함께 적었습니다. 미뤄도 되는 것을 명시한 이유는 그것이 대부분의 사람이
2026-08-02 · 43 분 읽기 #robotics#math#electronics#linear-algebra#control로봇 팔은 무엇으로 이루어지는가 — 링크, 조인트, 그리고 관절을 실제로 움직이는 것들
로봇 팔을 만들려고 서보 여섯 개를 사면 대체로 팔이 자기 무게에 무너집니다. 이 글은 링크와 조인트와 엔드이펙터의 정확한 정의에서 시작해 자유도가 무엇을 세는 값인지, 왜 6이 기준인지를 설명하고, 관절을 실제로 돌리는 세 가지 선택지인 서보와 스테퍼와 BLDC를 제조사 공표 규격으로 비교합니다. 감속기가 토크를 몇 배로 키우고 백래시를 얼마나 만드는지, 하모닉 드라이브가 왜 로봇에 쓰이는
2026-08-02 · 47 분 읽기 #robotics#hardware#electronics#arduino#math2025~2026 일본 영화 드라마 애니 총정리 — 기록을 갈아치운 두 편과 그 그늘
2025년부터 2026년 상반기까지 일본 영화, 드라마, 애니메이션 중 실제로 화제가 되었던 18편을 정리했습니다. 일본 역대 흥행 1위를 갈아치운 극장판 귀멸의 칼날 무한성편, 실사 영화 역대 1위가 된 국보, 로카르노 황금표범상을 받은 여행과 나날, 그리고 25년 만에 칸 경쟁 부문에 세 편이 동시에 오른 2026년까지 다룹니다. 각 작품의 감독과 제작사, 확인된 시청 경로, 누가 좋아하
2026-08-02 · 31 분 읽기 #culture#japanese-film#anime#j-drama#movie-recommendation2025~2026 한국 영화 드라마 총정리 — 극장이 돌아온 해, OTT가 재편된 해
2025년부터 2026년 상반기까지 한국 영화와 드라마 중 실제로 화제가 되었던 18편을 정리했습니다. 1691만 관객을 모은 왕과 사는 남자, 베니스에서 공개된 박찬욱의 어쩔수가없다, 넷플릭스 글로벌 1위를 기록한 폭싹 속았수다와 참교육까지 다룹니다. 각 작품의 감독과 주연, 공개 플랫폼, 그리고 누가 좋아하고 누가 싫어할지를 한 줄로 정리했습니다. 결말은 밝히지 않고 전제만 소개합니다.
2026-08-02 · 29 분 읽기 #culture#korean-film#k-drama#movie-recommendation#netflix2025~2026 미국 영화 시리즈 총정리 — 오스카가 고른 것과 관객이 고른 것
2025년부터 2026년 상반기까지 미국 영화와 시리즈 중 실제로 화제가 되었던 17편을 정리했습니다. 제98회 아카데미 작품상을 받은 원 배틀 애프터 어나더, 오스카 역사상 최다인 16개 부문 후보에 오른 시너스, 넷플릭스 역대 최다 시청 영화가 된 케이팝 데몬 헌터스, 그리고 에미상을 휩쓴 더 핏과 더 스튜디오까지 다룹니다. 각 작품의 감독과 주연, 확인된 시청 경로, 누가 좋아하고 누가
2026-08-02 · 29 분 읽기 #culture#american-film#tv-series#movie-recommendation#oscars어려운 책 읽는 법 — 완독보다 중요한 다섯 가지 판단
어려운 책이 안 읽히는 이유는 대개 모르는 단어가 아니라 논증의 구조입니다. 이 글은 애들러의 독서법과 읽기 연구가 실제로 지지하는 것을 근거로, 느리게 한 번보다 빠르게 두 번 읽는 방법, 해설서가 도움에서 목발로 바뀌는 지점, 책이 끝난 뒤에도 남는 메모, 번역서를 정직하게 읽는 태도, 그리고 잘 포기하는 법을 정리합니다. 대중적 독서 조언이 근거보다 앞서 나간 지점도 함께 표시했습니다.
2026-08-02 · 25 분 읽기 #storytelling#reading#books#learning#culture공개된 학습 사례에서 배우기 — 무엇을 시도했고 무엇이 실패했나
공개된 대규모 학습 기술 보고서와 로그북 일곱 건을 골라 성공 지표가 아니라 실패와 대응만 뽑아 정리했습니다. Llama 3 405B의 54일간 419건 중단 통계에서 체크포인트 주기를 역산하고, DeepSeek-V3와 Kimi K2가 손실 스파이크를 각각 다른 층위에서 없앤 방식을 비교합니다. Olmo 계열이 안정성 수정을 아키텍처에 남긴 이유, OPT-175B와 BLOOM 로그북이 남긴
2026-08-02 · 24 분 읽기 #mlops#llm-training#case-study#training-stability#scaling이 모델들은 어떻게 만들어졌나 — 2026년 오픈 웨이트 파이프라인 해부
2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한
2026-08-02 · 32 분 읽기 #llm#pretraining#moe#post-training#quantizationvLLM을 고쳐서 빠르게 만들기 — 설정, 내부 구조, 그리고 코드를 건드릴 지점
vLLM 성능을 올리는 작업을 코드를 고치지 않고 되는 것부터 순서대로 정리합니다. 배치 관련 인자와 프리픽스 캐싱, 청크드 프리필, 양자화 선택을 먼저 다루고, 그다음 PagedAttention과 연속 배칭 스케줄러가 내부에서 무엇을 결정하는지 실제 소스를 근거로 설명합니다. 실제로 코드를 건드릴 만한 세 지점인 커스텀 로짓 프로세서, 커스텀 어텐션 백엔드, 스케줄러 정책과 그 대가도 짚습
2026-08-02 · 35 분 읽기 #vllm#llm-inference#paged-attention#benchmark#scheduler2025~2026 중화권 영화 드라마 총정리 — 본토, 홍콩, 대만의 서로 다른 성적표
2025년부터 2026년 상반기까지 중화권 영화와 드라마 중 실제로 화제가 되었던 17편을 본토, 홍콩, 대만으로 나눠 정리했습니다. 전 세계 애니메이션 흥행 1위가 된 나타지마동뇨해, 금마장 최우수 극영화상을 받은 대만 영화 대몽, 홍콩금상장 작품상을 받은 재견UFO, 그리고 조우번 방언으로 만들어 더우반 9점을 받은 아마에게 보내는 편지까지 다룹니다. 각 작품의 출신지와 감독, 확인된 시
2026-08-02 · 29 분 읽기 #culture#chinese-film#hong-kong-cinema#taiwan-cinema#movie-recommendation