태그: #transformer
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 33 편
모두를 위한 AI 4편 — 137만 파라미터로 이미지에 문장 붙이기, 그리고 3편의 버그가 여기엔 없던 이유
CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.
2026-08-22 · 12 분 읽기 #ai#captioning#multimodal#transformer#pytorch모두를 위한 AI 1편 — 16M 파라미터 언어모델을 15분에 처음부터 학습시키기
GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.
2026-08-19 · 15 분 읽기 #ai#llm#transformer#pytorch#hands-on국내 개발 블로그 명글 큐레이션 3 — AI와 ML 실무, 직접 열어 확인한 14편
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기,
2026-08-12 · 23 분 읽기 #curation#큐레이션#ai#llm#ragconfig.json 완전 해부 — 설정 파일 한 장으로 모델 구조 읽기
hiddensize, numhiddenlayers, numattentionheads와 numkeyvalueheads, headdim, intermediatesize, ropetheta, vocabsize, tiewordembeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#config-json#transformer#llm-architecture위치 인코딩 완전 이해 — 사인파에서 RoPE까지
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
2026-06-26 · 29 분 읽기 #llm#positional-encoding#rope#alibi#long-contextTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cacheKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantizationLLM을 바닥부터 만들어보기 — 스탠퍼드 CS336 스타일 학습 로드맵
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026-06-12 · 27 분 읽기 #llm#transformer#cs336#deep-learning#tokenizer파운데이션 모델 아키텍처 2026 — Transformer 이후 / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 심층 가이드
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochr
2026-05-16 · 34 분 읽기 #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaLLM 랜드마크 논문 2026 완벽 가이드 - Transformer · Scaling Laws · Flash Attention · Mamba · DeepSeek-R1 · Titans 심층 분석
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 ·
2026-05-16 · 34 분 읽기 #llm-papers#transformer#scaling-laws#flash-attention#mambaLLM 랜드마크 논문 가이드 — Attention부터 GPT·LLaMA·DeepSeek·o1·Claude까지 (참고문헌 포함, 2026)
LLM 분야의 진짜 변화는 어떤 논문에서 시작됐는가. 2017년 Attention is All You Need부터 2026년의 추론 모델까지, 반드시 알아야 할 랜드마크 논문 20여 편을 시기·주제별로 정리한다. 각 논문은 '왜 중요한가·한 줄 요약·후속 영향'으로 압축하고, arXiv·블로그 링크를 끝에 모았다. 시간 부족한 엔지니어를 위한 LLM 논문 지도.
2026-05-14 · 22 분 읽기 #llm#research-papers#transformer#gpt#llamaTransformer 아키텍처 완전 가이드 2025: Self-Attention, Positional Encoding, Multi-Head, GPT vs BERT — ChatGPT 뒤의 수학
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
2026-04-15 · 29 분 읽기 #transformer#attention#self-attention#gpt#bertFlashAttention & Efficient Attention Deep Dive — Tiling, Online Softmax, PagedAttention, GQA 완전 정복 (2025)
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HB
2026-04-15 · 32 분 읽기 #flashattention#attention#llm#transformer#gpuLLM 완전 가이드 — Transformer·Attention·RLHF·RAG·Agent·Evaluation (Season 2 Ep 6, 2025)
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의
2026-04-15 · 19 분 읽기 #llm#transformer#attention#rlhf#dpoLLM 처음부터 만들기: 코드로 이해하는 GPT 완전 구현 가이드
대규모 언어 모델(LLM)을 처음부터 직접 구현하며 완전히 이해하는 가이드. 토크나이저부터 Transformer 아키텍처, 사전학습, 파인튜닝까지 PyTorch로 작은 GPT를 완전히 구축합니다.
2026-03-17 · 28 분 읽기 #llm#gpt#transformer#from-scratch#deep-learningTransformer 아키텍처 완전 분석: Attention부터 최신 LLM까지
Transformer 아키텍처를 처음부터 완전히 이해하는 가이드. Self-Attention, Multi-Head Attention, Positional Encoding, Encoder-Decoder 구조부터 Flash Attention, RoPE, GQA까지 수식과 코드로 완벽히 설명합니다.
2026-03-17 · 36 분 읽기 #transformer#attention#deep-learning#nlp#ai자연어 처리(NLP) 완전 정복 가이드: Zero to Hero - 텍스트 처리부터 LLM까지
자연어 처리의 기초부터 최신 LLM까지 완전히 정복하는 가이드. 텍스트 전처리, Word2Vec, RNN/LSTM, Attention, Transformer, BERT, GPT까지 실전 코드와 함께 단계별로 배웁니다.
2026-03-17 · 49 분 읽기 #nlp#natural-language-processing#transformer#bert#gpt딥러닝 시계열 분석 완전 가이드: LSTM, Transformer, PatchTST, TimesFM
딥러닝으로 시계열 데이터를 완전히 마스터하는 가이드. 시계열 전처리, ARIMA, LSTM, Temporal Fusion Transformer, PatchTST, Mamba, TimesFM 같은 최신 파운데이션 모델까지 실전 예제로 배웁니다.
2026-03-17 · 30 분 읽기 #time-series#lstm#transformer#forecasting#deep-learningMixture of Experts(MoE) 아키텍처 논문 심층 분석: GShard에서 DeepSeek-MoE까지
Mixture of Experts 아키텍처의 핵심 논문을 분석하고, GShard, Switch Transformer, Mixtral, DeepSeek-MoE의 라우팅 전략과 학습 안정성 기법을 비교합니다.
2026-03-14 · 34 분 읽기 #ai-papers#moe#transformer#deepseekKV Cache 최적화 심층 분석: GQA·MLA·MHA 어텐션 메커니즘과 메모리 효율화 전략
Transformer Self-Attention의 KV Cache 기본 원리부터 MHA, MQA, GQA(Llama 2/3), MLA(DeepSeek-V2/V3) 메커니즘의 메모리 분석과 비교, KV Cache 압축 기법(양자화, 퇴거 정책, 슬라이딩 윈도우), PagedAttention(vLLM) 구현, PyTorch 코드 예제, OOM 장애 사례와 최적화 체크리스트를 다룹니다.
2026-03-11 · 24 분 읽기 #ai-papers#kv-cache#attention-mechanism#gqa#mla