블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3672 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 260#career 233#ai 220#llm 216#devops 195#2026-04 158#security 147#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 66#cs-fundamentals 63#rag 63#systems 63#python 55#learning 54#self-improvement 53
코드가 어려운 부분이 아니었다는 말이 왜 그렇게 화를 돋우는가
2026년 8월에 Hacker News 상단을 차지한 에세이 하나는 코드는 원래 어려운 부분이 아니었다는 말이 모든 프로그래머에 대한 모욕이라고 주장합니다. 이 글은 그 반박에 동의하되 이유를 다르게 봅니다. 그 문장이 화를 돋우는 것은 틀려서가 아니라 코드라는 단어의 의미를 도중에 바꿔치기하기 때문입니다. 코드를 세 층으로 쪼개면 양쪽 주장이 각각 어디서 참인지가 보이고, 우리 팀이 실제로
2026-08-09 · 14 분 읽기 #career#craft#ai#engineering-culture#skills데이터 레지던시는 드롭다운이 아니라 복제 토폴로지다
Fastmail이 2026년 8월 3일 EU 데이터 리전을 열면서 공개한 문서를 교재 삼아, 데이터 소재지가 왜 리전 선택 한 번으로 결정되지 않는지 정리합니다. 주 사본, 복제본, 비상 백업, 전역 복제되는 메타데이터, 로그, 서드파티 연동, 그리고 장애 시 폴백 경로는 각각 다른 위치를 가질 수 있고 실제로 갖습니다. Fastmail은 EU 계정의 복제본이 미국에 있고 백업은 필라델피아에
2026-08-09 · 16 분 읽기 #architecture#data-residency#gdpr#replication#compliance배포가 곧 부하 테스트다 — 캐시를 채우는 비용을 설계하지 않으면 생기는 일
Canva가 게이트웨이 인메모리 세션 무효화 캐시를 MySQL에서 S3로 옮긴 과정을 뜯어봅니다. 문제는 정상 상태의 조회 비용이 아니라 배포 때마다 수백 개 파드가 동시에 캐시를 채우면서 데이터베이스를 때리는 시작 비용이었고, 해결책은 캐시 계층을 하나 더 얹는 것이 아니라 데이터의 표현을 바꾸는 것이었습니다. 12시간 슬라이딩 윈도를 30분 조각으로 나누고 무효화 하나를 16바이트로 눌러
2026-08-09 · 16 분 읽기 #architecture#caching#s3#scalability#deploymentLLM이 못 하는 것은 증명이 아니라 전제를 세우는 일입니다
ICML 2026 입장 논문 Position: LLMs can not jump은 생성형 AI가 귀납을 마스터했고 연역을 빠르게 정복하는 중이지만, 새로운 설명 가설을 만들어 내는 귀추에는 구조적으로 도달하지 못한다고 주장합니다. 이 글은 그 주장을 요약하는 대신, 그것이 사실이라고 가정했을 때 우리가 지금 만드는 시스템의 설계를 어떻게 바꿔야 하는지를 다룹니다. 가설 공간을 어디서 공급할 것
2026-08-09 · 14 분 읽기 #ai#llm#reasoning#abduction#research평가 주도 개발에서 가장 먼저 보정해야 하는 것은 심사자입니다
Airbnb 엔지니어링이 2026년 7월에 공개한 평가 주도 개발 회고는 평가셋을 먼저 쓰라는 이야기가 아니라, 채점하는 모델부터 계측기로 인정받아야 한다는 이야기에 가깝습니다. 이 글은 심사자 모델을 골든셋 50~100개로 보정하는 절차, 일치도를 단순 정확도가 아니라 카파로 재야 하는 이유, 그리고 보정되지 않은 심사자가 어떻게 팀 전체를 잘못된 방향으로 최적화시키는지를 실행 가능한 코드
2026-08-09 · 15 분 읽기 #ai#llm#eval-driven-development#llm-as-judge#evaluation마찰이 사라지면 안목이 남는 게 아니라 안목을 기를 길이 사라집니다
2026년 8월에 화제가 된 에세이 Taste Is All That Is Left는 만드는 일이 싸지면서 무엇을 만들 가치가 있는지 판단하는 능력만 희소해졌다고 말합니다. 이 글은 그 진단에 동의하면서 한 걸음 더 들어갑니다. 안목은 노력이라는 필터의 부산물이었고, 필터가 사라지면 안목이 자동으로 남는 것이 아니라 안목을 기르던 경로가 함께 사라집니다. 그래서 필요한 것은 마찰을 의도적으로
2026-08-09 · 13 분 읽기 #career#craft#ai#code-review#mentoring사진이 들어간 QR 코드는 무엇을 대가로 지불하는가 — 오류 정정은 예산입니다
QR 코드 안에 사진을 넣는 기법을 뜯어보면, 그것이 디자인 결정이 아니라 예산 배분 결정이라는 사실이 드러납니다. 예쁘게 만드는 데 쓰이는 여유분은 원래 구겨진 종이와 나쁜 조명을 위해 남겨 둔 것이기 때문입니다. 모듈을 아홉 칸으로 쪼개는 방식, 그 결과 생기는 아홉 분의 일의 잡음, 그리고 오차 확산을 두 번 돌려 예산을 덜 쓰고도 더 깨끗한 그림을 얻는 방법까지, 원 자료의 설명을 따
2026-08-09 · 14 분 읽기 #algorithm#qr-code#error-correction#dithering#image-processing소설 추천 — 시간을 쓸 가치가 있는 30권과 첫 50쪽의 법칙
소설 추천 목록은 넘치지만 정작 필요한 정보는 빠져 있습니다. 이 책이 몇 쪽인지, 얼마나 어려운지, 그리고 첫 50쪽이 힘들 때 계속 읽어야 하는 책인지 아닌지. 고전과 20세기 현대소설, 최근 20여 년, 장르소설, 한국문학, 비서구권까지 30권을 그 기준으로 정리했습니다. 마지막에는 한국 독자가 판본을 반드시 골라야 하는 번역 민감 작품들을 따로 묶었습니다.
2026-08-02 · 37 분 읽기 #storytelling#novels#reading#world-literature#culture워드·파워포인트 단축키 — 문서는 스타일로, 슬라이드는 개체로 다룹니다
워드와 파워포인트는 같은 리본을 쓰지만 손버릇이 전혀 다릅니다. 워드는 텍스트 흐름과 스타일을 다루고 파워포인트는 캔버스 위의 개체를 다루기 때문입니다. 이 글은 두 앱을 각각 그 성격에 맞는 묶음으로 나누고, 묶음마다 개별 키가 아니라 그 묶음을 지배하는 규칙을 먼저 설명하면서 서식 복사 반복 적용과 스타일로 문서 전체를 다루는 것처럼 일하는 방식 자체를 바꾸는 항목을 앞세웠습니다. 같은
2026-08-02 · 36 분 읽기 #word#powerpoint#shortcuts#office#productivity엑셀 단축키, 진짜 시간을 아끼는 것들 — 외우지 말고 규칙을 이해하세요
엑셀 단축키를 200개 나열하는 대신, 실제로 하고 있는 작업 단위로 묶어 정리했습니다. 방향키 가족이 왜 데이터의 끝을 정확히 아는지, 절대참조 순환이 어떤 순서로 도는지처럼 규칙을 이해하면 조합을 외울 필요가 없어집니다. 이동과 선택, 편집과 붙여넣기, 수식, 표와 필터, 서식, 시트 관리 여섯 갈래로 나눴고 Windows와 Mac 키를 함께 실었습니다. 마이크로소프트 공식 문서로 확인한
2026-08-02 · 26 분 읽기 #excel#shortcuts#productivity#office#keyboardLLM 학습 스택 지도 2026 — 무엇이 무엇을 대신해 주고 무엇을 숨기는가
LLM 학습 프레임워크를 세 개 층으로 나눠 계보를 정리했습니다. 아래층은 PyTorch 분산, DeepSpeed, Megatron-Core 같은 실행 엔진이고, 가운데는 torchtitan과 Megatron-Bridge 같은 학습 루프이며, 위층은 TRL과 Axolotl처럼 설정 파일로 파인튜닝을 돌려 주는 도구입니다. 각 층이 무엇을 대신해 주고 대신 무엇을 감추는지, 그리고 상위 프레임
2026-08-02 · 23 분 읽기 #mlops#llm-training#pytorch#trl#framework질문에 답하는 Prometheus 메트릭 설계 — 타입 선택, 카디널리티 예산, rate 와 분위수의 함정
메트릭은 많을수록 좋은 것이 아니라 질문에 답할 수 있어야 쓸모가 있습니다. 카운터와 게이지와 히스토그램이 각각 어떤 질문에 답하는지, 잘못 고르면 어떤 계산이 원리적으로 불가능해지는지부터 정리합니다. 레이블 카디널리티를 감으로 다루지 않도록 숫자로 예산을 잡는 방법, rate 와 histogramquantile 이 조용히 틀린 답을 주는 조건, 그리고 레코딩 룰을 언제 어떤 이름으로 만드는
2026-08-02 · 28 분 읽기 #observability#prometheus#promql#metrics#cardinalityAI로 블로그 글 파이프라인 만들기 — 초안이 아니라 검증이 병목입니다
AI로 블로그 글을 쓰는 과정을 주제 수집부터 성과 확인까지 일곱 단계로 나누고, 각 단계에서 모델이 실제로 도움이 되는 지점과 절대 맡기면 안 되는 지점을 구분했습니다. 이 파이프라인의 무게중심은 초안이 아니라 사실 검증입니다. 모델이 실제로 읽은 것만 인용하게 만드는 방법, 자신 있게 쓴 문장과 확인된 문장을 가르는 기준, 그리고 발행 직전에 돌리는 체크리스트를 실행 가능한 스크립트와 함
2026-08-02 · 28 분 읽기 #ai-writing#content-pipeline#fact-checking#automation#blogging읽히는 대시보드와 울릴 만한 경보 — 질문 정의, 변수 구성, SLO, 그리고 경보 피로
대시보드는 예뻐 보이는 것이 아니라 정해진 질문에 순서대로 답해야 쓸모가 있습니다. 패널을 만들기 전에 답할 질문을 적는 방법부터, 데이터소스와 변수를 어떻게 구성해야 하나의 대시보드가 여러 환경에서 재사용되는지를 다룹니다. 경보는 원인이 아니라 증상에 걸어야 하는 이유를 사례로 보이고, SLO 와 에러 버짓, 멀티 번레이트 경보를 실제 규칙으로 작성합니다. 마지막으로 경보 피로를 줄이는 규
2026-08-02 · 24 분 읽기 #observability#grafana#alerting#slo#dashboards지금 허깅페이스에서 무엇이 뜨는가 — 2026년 8월 트렌딩 지도
2026년 8월 2일 기준으로 허깅페이스 트렌딩 목록을 직접 훑고, 용도별로 실제 쓸 만한 모델을 정리했습니다. 범용 LLM, 코딩, 임베딩과 리랭커, 비전, 음성, 이미지·비디오 생성, 소형 온디바이스 순으로 만든 곳과 규모와 라이선스, 그리고 쓰기 전에 알아야 할 제약을 함께 적었습니다. 핵심은 트렌딩 목록의 상당수가 새 모델이 아니라 양자화 재업로드와 커뮤니티 파인튜닝이라는 점입니다.
2026-08-02 · 30 분 읽기 #llm#huggingface#open-weights#model-selection#quantizationSlurm으로 GPU 클러스터 쓰기 — 제출보다 중요한 것은 왜 안 도는지 아는 일
GPU 클러스터에서 Slurm을 실무로 쓰는 데 필요한 것만 정리했습니다. 파티션과 QoS, 계정이라는 좌표계를 먼저 세우고, sbatch 스크립트에서 GPU와 CPU, 메모리를 요구하는 방법과 그 사이의 바인딩 함정을 다룹니다. 멀티노드 학습을 srun과 랑데뷰로 띄우는 두 가지 패턴을 실제로 도는 스크립트로 제시하고, 배열 작업과 의존성 체인으로 스윕과 재개를 스케줄러에 맡기는 방법도 넣
2026-08-02 · 23 분 읽기 #mlops#slurm#hpc#gpu-cluster#distributed-training영화 명작 추천 — 고전 영화 입문, 25편을 어떤 순서로 볼까
고전 영화 목록은 많지만 순서를 알려주는 글은 드뭅니다. 이 글은 명작 25편을 순위가 아니라 초보 관객이 부딪히는 문제별로 나눕니다. 흑백이 견뎌지지 않을 때, 아무 일도 일어나지 않을 때, 장르의 원형이 궁금할 때, 형식 자체가 내용일 때, 그리고 세계 영화 지도의 빈칸을 메울 때. 작품마다 감독·연도·러닝타임과 함께 이 영화를 견디기 어려운 사람의 특징을 적었고, 언제 꺼도 되는지도 밝
2026-08-02 · 32 분 읽기 #storytelling#film#classics#world-cinema#cultureAI가 쓴 글이 무너지는 지점들 — 여섯 가지 실패와 각각의 가드레일
AI가 쓴 글은 문장이 매끄러운 채로 틀립니다. 지어낸 출처, 컷오프 이후의 낡은 정보, 같은 말을 늘려 쓴 문단, 근거 없이 단정하는 문장, 검색만 노린 반복 표현, 그리고 표절과 저작권까지 여섯 가지 실패 유형을 탐지 방법과 수정 방법으로 나눠 정리했습니다. 자동화할 수 있는 검사는 실행 가능한 스크립트로 제시하고, 자동화할 수 없는 것은 그렇다고 명시했습니다. 독자와 검색엔진이 실제로
2026-08-02 · 25 분 읽기 #ai-writing#content-quality#hallucination#seo#editing로그를 검색 가능하게, 그리고 파산하지 않게 — 구조화, 매핑 폭발, 보존, 그리고 진짜 비용
로그 비용이 컴퓨트 비용을 넘어서는 시점은 대부분의 조직에 옵니다. 그 시점을 늦추는 것은 압축률이 아니라 무엇을 필드로 만들 것인가에 대한 결정입니다. 구조화 로그의 필드 설계부터 OpenSearch 매핑 폭발이 실제로 클러스터를 죽이는 경로, 인덱스 템플릿과 ISM 으로 수명주기를 통제하는 방법, 원칙 있는 샘플링과 보존 계층을 다룹니다. 마지막으로 로그로 메트릭을 흉내 낼 때 드는 비용
2026-08-02 · 24 분 읽기 #observability#logging#opensearch#elasticsearch#costLLM Ops가 실제로 하는 일 — 재현, 오염, 체크포인트, 승격, 그리고 롤백
LLM Ops를 도구 목록이 아니라 책임 목록으로 정리했습니다. 학습 실행을 다시 만들 수 있게 하는 실행 명세에 무엇이 들어가야 하는지, 평가 세트 오염을 어떻게 막고 감사하는지, 체크포인트 주기를 장애율에서 역산하는 공식과 보관 비용의 실제 숫자, 평가를 CI에 넣을 때 무엇을 게이트로 삼는지를 다룹니다. 후반부는 학습과 서빙 사이의 인수인계에서 실제로 깨지는 지점들과 배포 후 회귀 감지
2026-08-02 · 23 분 읽기 #mlops#llmops#reproducibility#evaluation#model-registry