태그: #ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 220 편
모두를 위한 AI 6편 — 111만 파라미터 디퓨전으로 단어에서 숫자 그리기
"zero"라고 쓰면 0을 그리는 조건부 디퓨전 모델을 111만 파라미터로 만들었습니다. 노이즈를 섞는 forward는 공식 한 줄이고, 복원하는 reverse는 그 한 줄을 400번 거꾸로 밟는 것뿐입니다. 5편에서 L1 손실이 색을 바래게 만든 문제를 디퓨전이 어떻게 피해 가는지, 그리고 왜 모델이 노이즈를 예측하도록 학습되는지를 실제 생성 결과로 확인합니다.
2026-08-24 · 15 분 읽기 #ai#diffusion#ddpm#generative#pytorch모두를 위한 AI 5편 — 47만 파라미터 U-Net으로 흑백 사진에 색 입히기, 그리고 왜 색이 바랬는가
시리즈에서 가장 작은 모델인 47만 파라미터 U-Net으로 CIFAR-10 흑백 이미지를 컬러로 복원했습니다. 형태는 정확히 살렸지만 색이 눈에 띄게 바랬는데, 이건 모델 용량 문제가 아니라 L1 손실을 고른 결과입니다. skip connection이 무엇을 나르는지, 그리고 회귀 손실이 왜 채도를 죽이는지를 실제 결과 이미지로 확인합니다.
2026-08-23 · 14 분 읽기 #ai#computer-vision#unet#colorization#pytorch모두를 위한 AI 4편 — 137만 파라미터로 이미지에 문장 붙이기, 그리고 3편의 버그가 여기엔 없던 이유
CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.
2026-08-22 · 12 분 읽기 #ai#captioning#multimodal#transformer#pytorch모두를 위한 AI 3편 — 손실 0.0017인데 정확도 7.5%, 범인은 패딩 한 칸이었다
이미지와 질문을 함께 받아 답하는 VQA 모델을 148만 파라미터로 만들었습니다. 학습 손실은 0.0017까지 떨어졌는데 정확도는 7.5%였습니다. 무작위보다 나쁜 수치였죠. 원인은 모델이 아니라 정답을 만드는 코드 한 줄이었고, 고치자 99.5%가 됐습니다. 왜 낮은 손실이 좋은 모델을 보장하지 않는지, 그리고 그 함정을 어떻게 알아채는지를 실제 출력으로 확인합니다.
2026-08-21 · 14 분 읽기 #ai#vqa#multimodal#debugging#pytorch모두를 위한 AI 1편 — 16M 파라미터 언어모델을 15분에 처음부터 학습시키기
GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.
2026-08-19 · 15 분 읽기 #ai#llm#transformer#pytorch#hands-onAI 엔지니어 회의 영어: 모른다고 말하면서 신뢰를 잃지 않는 법
AI 팀 회의에서 가장 자주 필요한 영어는 확신을 표현하는 말이 아니라 불확실성을 신뢰감 있게 표현하는 말입니다. 평가 결과와 그 한계를 함께 말하기, 원인이 아직 불명확한 회귀 보고, 지표는 올랐는데 품질은 아닐 때, 라벨링 이견, 비용과 지연 시간 트레이드오프, 연구 일정과 제품 일정의 충돌, 비기술 이해관계자에게 불확실성 설명하기, 남의 실험에 이견 제기하기, 재현이 안 될 때까지 상황
2026-08-16 · 47 분 읽기 #english#business-english#meeting#ai#llm우리가 실제로 아는 것과 모르는 것 — 커리어 예측을 다루는 법
개발자의 미래에 대한 글은 대부분 두 가지 중 하나입니다. 걱정하지 말라는 위로거나, 지금 준비하지 않으면 도태된다는 경고거나. 둘 다 아무도 뒷받침할 수 없는 예측을 사실처럼 말한다는 점에서 같은 문장입니다. 이 글은 관측된 것과 예측된 것을 갈라놓는 데서 시작합니다. 널리 인용된 2013년 옥스퍼드 연구가 실제로 무엇을 계산했는지, 1964년에도 거의 같은 경고가 있었다는 사실, 그리고
2026-08-15 · 12 분 읽기 #career#ai#uncertainty#forecasting#job-securityAI 도구와 일하는 법을 하나의 기술로 — 위임 기준과 검증 절차
AI 도구를 잘 쓴다는 말은 무엇을 맡겼고 결과를 어떻게 판정했는지를 빼면 아무것도 뜻하지 않습니다. 이 글은 위임 가능성을 난이도가 아니라 검증 비용으로 가르는 기준, 맡기기 전에 네 줄로 적는 위임 카드, 결과를 받은 뒤 읽는 순서를 바꾸는 검증 절차, 그리고 생산성이 오히려 떨어지는 네 가지 패턴을 다룹니다. 무작위 대조 실험과 대규모 개발자 설문에서 나온 숫자를 인용하되 그 숫자가 무
2026-08-15 · 14 분 읽기 #career#skills#ai#verification#engineering-practice무엇이 비싸게 남는가 — 생성이 싸질 때 값이 오르는 네 가지
IT 엔지니어가 앞으로 무엇을 준비해야 하는지 묻는 질문에 도구 목록으로 답하면 그 답은 2년이면 낡습니다. 이 글은 다른 축을 제안합니다. 값이 남는 기술은 검증 비용이 비싼 기술이라는 것입니다. 생성 비용과 검증 비용을 두 축으로 놓고 네 칸을 그리면, 자동화가 어디를 먼저 먹었고 어디에 사람이 남는지가 한 장에 정리됩니다. 그리고 이 틀에는 반전이 하나 있습니다. 엔지니어의 일은 검증을
2026-08-15 · 13 분 읽기 #career#skills#ai#craft#engineering-culture주니어가 특히 불안한 이유 — 진입 계단이 달라졌다는 것
주니어의 불안은 성격이 아니라 위치에서 나옵니다. 대체 가능성이 가장 크다고 지목되는 층이면서, 증거는 가장 적고, 비교 대상은 가장 많은 자리이기 때문입니다. 이 글은 AI가 주니어 일을 한다는 말의 어디까지가 관측이고 어디부터가 예측인지 가른 뒤, 진짜 문제는 일이 사라지는 것이 아니라 시니어로 가는 계단이 아직 다시 설계되지 않았다는 점임을 짚습니다. 그리고 그 상황에서 사람이 배워야
2026-08-15 · 12 분 읽기 #career#junior-developer#ai#learning#entry-level국내 개발 블로그 명글 큐레이션 3 — AI와 ML 실무, 직접 열어 확인한 14편
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기,
2026-08-12 · 23 분 읽기 #curation#큐레이션#ai#llm#ragFDE(Forward Deployed Engineer)란 무엇인가 — 고객사 현장에 배치되는 엔지니어
팔란티어가 만들었고 OpenAI와 앤트로픽이 앞다투어 뽑는 직함, 포워드 디플로이드 엔지니어(FDE)를 한국어로 제대로 정리합니다. 본사가 아니라 고객사 현장에 배치되어 제품과 고객 시스템 사이의 마지막 구간을 코드로 잇는 직무가 무엇인지, 솔루션스 아키텍트·세일즈 엔지니어·컨설턴트·서포트 엔지니어와 어떻게 다른지 표로 가르고, 미완성 플랫폼일수록 현장 엔지니어링이 제품의 일부가 된다는 구조
2026-08-12 · 12 분 읽기 #career#fde#forward-deployed-engineer#ai#job-search텍스트 생성 오픈 모델, 크기대별로 고르는 법
오픈 텍스트 생성 모델을 고를 때 크기는 성능 등급이 아니라 배치 제약입니다. 이 글은 온디바이스용 소형, 단일 GPU에 올리는 중형, 서버가 필요한 대형으로 나눠 각 구간에서 실제로 확인한 모델들의 파라미터, 컨텍스트, 라이선스를 정리하고, MoE 모델의 메모리 계산이 왜 다른지, 컨텍스트 확장이 왜 공짜가 아닌지, 카드가 요구하는 실행 조건을 무시하면 무엇이 깨지는지를 설명합니다. 오픈
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#text-generation음성 모델 고르기: STT와 TTS의 실전 기준
음성 모델은 텍스트 모델과 달리 언어 지원, 오디오 길이 제약, 실시간성, 화자 분리 여부가 먼저 정해지고 그다음에 모델이 결정됩니다. 이 글은 2026-08-12에 확인한 STT와 TTS 오픈 모델의 파라미터, 라이선스, 지원 언어, 오디오 제약을 정리하고, 실시간이라는 말을 어떻게 쪼개야 하는지, 카드에 적힌 환각과 동의 관련 경고가 왜 설계 제약인지를 설명합니다. 오픈 모델 가이드 시리
2026-08-12 · 13 분 읽기 #ai#huggingface#open-source-llm#speech-to-text#text-to-speech한국어를 지원하는 오픈 모델과 토크나이저 비용
한국어 지원이라는 표기는 그 언어를 처리한다는 뜻이지 잘한다는 보장이 아닙니다. 이 글은 2026-08-12에 확인한 한국어 전용·이중언어 오픈 모델과 다국어 모델의 카드 값을 정리하고, 토크나이저가 한국어를 어떻게 쪼개는지가 왜 그대로 비용과 컨텍스트 소모로 이어지는지, 그리고 그것을 직접 재는 방법을 설명합니다. 한국어 모델에서 특히 갈리는 라이선스 유형도 함께 다룹니다. 오픈 모델 가이
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#korean-nlp라이선스와 배포: 유형 읽는 법과 양자화 배포판 출처 확인
오픈 모델의 license 필드에 적힌 짧은 식별자는 목차일 뿐이고 실제 조건은 전문에 있습니다. 이 글은 2026-08-12에 실제로 마주친 라이선스 유형들을 정리하고, 커뮤니티 라이선스와 비상업 조건이 무엇을 요구하는지, 게이트 저장소가 배포 파이프라인에서 왜 문제가 되는지, 그리고 GGUF 같은 양자화 배포판의 출처를 어떻게 확인해야 하는지를 설명합니다. 오픈 모델 가이드 시리즈 마지막
2026-08-12 · 13 분 읽기 #ai#llm#huggingface#open-source-llm#license코드 모델 고르기: 자동완성과 대화형, FIM, 라이선스
코드 모델은 편집기 안에서 커서 위치를 채우는 자동완성용과 질문에 답하는 대화형이 서로 다른 제품입니다. 이 글은 2026-08-12에 확인한 오픈 코드 모델들의 파라미터, 컨텍스트, FIM 지원 표기, 라이선스를 정리하고, 기본 모델에 채팅을 시키면 왜 실패하는지, 코드 모델에서 라이선스가 왜 특히 조심스러운지를 설명합니다. 오픈 모델 가이드 시리즈 7편입니다.
2026-08-12 · 13 분 읽기 #ai#llm#huggingface#open-source-llm#code-llm비전과 멀티모달: 이미지 이해, OCR, VLM 고르기
비전 모델은 하나의 범주가 아닙니다. 대화형 VLM, OCR 전용, 문서 구조화, 이미지 검색용 임베딩은 서로 다른 물건이고 대체되지 않습니다. 이 글은 2026-08-12에 확인한 각 범주의 오픈 모델 카드 값을 정리하고, 해상도와 다중 이미지 처리 같은 실제 제약, 그리고 카드가 명시한 금지 용도를 함께 다룹니다. 오픈 모델 가이드 시리즈 6편입니다.
2026-08-12 · 13 분 읽기 #ai#huggingface#open-source-llm#vision-language-model#ocr허깅페이스 모델 카드 읽는 법: 무엇을 믿고 무엇을 의심할까
허깅페이스 모델 카드에서 실제로 판단 근거가 되는 항목은 라이선스, 파라미터 수, 컨텍스트 길이, intended use, limitations, 학습 데이터 여섯 가지입니다. 이 글은 각 항목이 무엇을 뜻하고 무엇을 숨기는지, 다운로드 수와 좋아요 수가 왜 품질 지표가 아닌지, 그리고 카드에 적혀 있지 않은 항목을 어떻게 다뤄야 하는지를 2026-08-12에 실제로 확인한 모델 페이지 사례
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#model-card임베딩과 리랭커, RAG에서 실제로 중요한 것
RAG를 만들 때 임베딩 모델 선택을 좌우하는 것은 리더보드 순위가 아니라 차원, 최대 입력 길이, 접두어 규약, 다국어 표기, 그리고 리랭커와의 역할 분담입니다. 이 글은 2026-08-12에 확인한 임베딩·리랭커 모델들의 실제 카드 값을 정리하고, MTEB 점수가 무엇을 말해 주지 않는지, 한국어 문서를 다룰 때 무엇을 직접 재야 하는지를 설명합니다. 오픈 모델 가이드 시리즈 3편입니다.
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#embedding