태그: #ai-papers
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 78 편
RLHF에서 DPO까지: LLM 정렬(Alignment) 기술 논문 심층 분석
LLM 정렬 기술의 핵심 논문들을 심층 분석합니다. InstructGPT의 RLHF 파이프라인, Anthropic의 Constitutional AI, DPO의 수학적 기반, PPO 학습 안정성, 그리고 KTO/IPO/ORPO 등 최신 연구까지 체계적으로 비교하고 실무 적용 방안을 정리합니다.
2026-03-13 · 20 분 읽기 #ai-papers#rlhf#dpo#alignment#ppoRAG 논문 서베이: Retrieval-Augmented Generation의 진화 — RETRO에서 Self-RAG·Corrective-RAG까지
Retrieval-Augmented Generation(RAG) 연구의 진화를 논문 중심으로 추적합니다. 초기 RAG(Lewis et al.)부터 RETRO의 대규모 검색, Self-RAG의 자기 반성, Corrective-RAG의 검색 품질 평가까지 핵심 아키텍처와 벤치마크를 비교 분석합니다.
2026-03-12 · 31 분 읽기 #ai-papers#rag#self-rag#corrective-rag#retroDiffusion Model 논문 서베이: DDPM에서 Stable Diffusion·DiT·SDXL까지 이미지 생성 모델의 진화
DDPM/DDIM의 확산-역확산 이론부터 Score-based 모델, Latent Diffusion(Stable Diffusion)의 VAE+U-Net 아키텍처, Classifier-free Guidance, DiT(Diffusion Transformer)의 adaLN-Zero, SDXL의 이중 텍스트 인코더와 Refiner 파이프라인, ControlNet의 조건부 제어, 학습 파이프라인,
2026-03-12 · 25 분 읽기 #ai-papers#diffusion-model#ddpm#stable-diffusion#ditMixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer에서 Mixtral까지의 발전과 효율적 스케일링 전략
Mixture of Experts(MoE) 아키텍처의 핵심 원리부터 Switch Transformer의 단일 전문가 라우팅, Mixtral 8x7B의 Sparse MoE 구현, DeepSeek-MoE의 세분화 전략까지 심층 분석. 라우팅 메커니즘, 로드 밸런싱 손실, 학습 안정화 기법, 추론 최적화, 장애 사례와 체크리스트를 다룹니다.
2026-03-11 · 28 분 읽기 #ai-papers#moe#switch-transformer#mixtral#model-architectureKV Cache 최적화 심층 분석: GQA·MLA·MHA 어텐션 메커니즘과 메모리 효율화 전략
Transformer Self-Attention의 KV Cache 기본 원리부터 MHA, MQA, GQA(Llama 2/3), MLA(DeepSeek-V2/V3) 메커니즘의 메모리 분석과 비교, KV Cache 압축 기법(양자화, 퇴거 정책, 슬라이딩 윈도우), PagedAttention(vLLM) 구현, PyTorch 코드 예제, OOM 장애 사례와 최적화 체크리스트를 다룹니다.
2026-03-11 · 24 분 읽기 #ai-papers#kv-cache#attention-mechanism#gqa#mlaMixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer부터 Mixtral·DeepSeek까지
Mixture of Experts(MoE) 아키텍처를 심층 분석합니다. Sparse MoE의 수학적 기초부터 Switch Transformer, Mixtral 8x7B, DeepSeek-V3의 라우팅 전략, 학습 안정성 기법, 추론 최적화까지 논문 기반으로 상세히 다룹니다.
2026-03-10 · 23 분 읽기 #ai-papers#moe#transformer#mixtral#deepseekFlashAttention 논문 분석: IO-Aware Exact Attention으로 Transformer 학습·추론 속도 혁신
FlashAttention 시리즈(v1~v3) 핵심 논문 분석. IO-Aware 알고리즘의 tiling 전략, GPU SRAM/HBM 메모리 계층 활용, 역전파 recomputation, FlashAttention-2의 병렬화 개선, FlashAttention-3의 FP8 지원과 비동기 파이프라이닝까지 실전 벤치마크와 함께 다룹니다.
2026-03-09 · 34 분 읽기 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismDPO(Direct Preference Optimization) 논문 심층 분석 — RLHF 없이 LLM 정렬하기
DPO의 수학적 원리부터 구현, RLHF와의 비교, IPO/KTO/ORPO 변형까지 — LLM 선호도 최적화의 핵심을 실무 관점에서 심층 분석합니다.
2026-03-09 · 30 분 읽기 #ai-papers#dpo#rlhf#llm-alignment#preference-optimizationAI/ML 논문 읽기에 필요한 수학 + LaTeX/KaTeX 총정리
AI/ML 논문을 읽을 때 반드시 만나는 수학 개념(선형대수·미적분·확률통계·최적화)과 LaTeX/KaTeX 수식 문법을 실전 예시 중심으로 총정리합니다. 기호 치트시트, 수식 패턴 해설, MDX 블로그 렌더링 팁까지 한 번에 다룹니다.
2026-03-08 · 26 분 읽기 #ai-papers#math#latex#katex#linear-algebraKAN(Kolmogorov-Arnold Networks) 논문 분석: MLP를 대체하는 학습 가능한 활성화 함수 아키텍처
Kolmogorov-Arnold Networks(KAN) 논문을 심층 분석합니다. Kolmogorov-Arnold 표현 정리의 수학적 배경, B-스플라인 활성화 함수, MLP 대비 정확도·해석가능성 비교, 그리고 실전 구현 코드를 다룹니다.
2026-03-08 · 38 분 읽기 #ai-papers#kan#kolmogorov-arnold#neural-network#mlpRing Attention 논문 분석: 분산 환경에서 무한 컨텍스트 윈도우 트레이닝 구현
Ring Attention 논문을 분석하고 분산 환경에서 컨텍스트 길이 제한을 극복하는 방법을 탐구합니다. Blockwise Parallel Transformer와의 연결, 구현 세부사항, 성능 벤치마크, 그리고 프로덕션 적용 시 고려사항까지 다룹니다.
2026-03-08 · 55 분 읽기 #ai-papers#ring-attention#distributed-training#long-context#transformerMamba와 State Space Model 논문 심층 분석: 선택적 SSM부터 Mamba-2까지 Transformer 대안 아키텍처
Mamba 논문의 선택적 State Space Model 메커니즘, S4에서 Mamba-2로의 발전 과정, Transformer 대비 선형 시간 복잡도의 장단점, 그리고 비전·오디오·시계열 분야 적용 사례까지 다루는 SSM 아키텍처 종합 분석.
2026-03-07 · 44 분 읽기 #ai-papers#mamba#state-space-model#ssm#transformerSparse Mixture of Experts(MoE) 아키텍처 심층 분석: 설계 원리부터 DeepSeek-V3·Qwen3까지
Sparse MoE 아키텍처의 수학적 원리, 라우팅 전략, 로드 밸런싱 기법을 분석하고, Switch Transformer에서 DeepSeek-V3·Qwen3-235B까지 최신 MoE 모델의 설계 선택과 실전 학습·추론 최적화를 다룬다.
2026-03-06 · 35 분 읽기 #ai-papers#moe#sparse-model#deepseek#2026-03BitNet 논문 분석: 1-Bit LLM의 시대 — 삼진 가중치부터 CPU 추론까지
Microsoft Research의 BitNet 시리즈(v1, b1.58, a4.8, 2B4T) 논문을 분석하고, 삼진 가중치 학습 원리부터 bitnet.cpp 추론 프레임워크, 실전 벤치마크까지 다루는 종합 가이드.
2026-03-06 · 37 분 읽기 #ai-papers#bitnet#1-bit-llm#quantization#model-efficiencyDPO에서 KTO까지: 인간 피드백 정렬 기법 최신 논문 리뷰와 실전 구현
RLHF의 한계를 극복한 DPO, IPO, KTO 등 최신 인간 피드백 정렬 기법의 논문 리뷰와 TRL 기반 실전 구현 가이드. 알고리즘 비교, 하이퍼파라미터 튜닝, 실패 사례까지.
2026-03-05 · 33 분 읽기 #ai-papers#dpo#kto#alignment#2026-03AI Papers: Test-Time Scaling 핵심 논문 정리 — 추론 예산으로 성능을 끌어올리는 방법
Test-Time Scaling(TTS)은 학습 파라미터를 늘리지 않고 추론 시점의 계산 예산을 늘려 성능을 높이는 접근이다. 이 글은 Best-of-N, Self-Consistency, Tree Search, Verifier/Reranker 기반 방법을 논문 맥락과 실무 적용 관점에서 정리한다.
2026-03-04 · 24 분 읽기 #ai-papers#test-time-scaling#reasoning#inference#llmMixture of Experts(MoE) 아키텍처 논문 리뷰와 실전 스케일링 2026
Mixture of Experts(MoE) 아키텍처 핵심 논문 분석. Switch Transformer, GShard, ST-MoE, Mixtral까지 라우팅 메커니즘, 전문가 병렬화, 로드 밸런싱 전략을 실전 관점에서 정리한다.
2026-03-04 · 33 분 읽기 #ai-papers#2026-03Mamba vs Transformer 실무 비교: 논문에서 제품까지
Mamba vs Transformer 실무 비교: 논문에서 제품까지를 중심으로 Why/How/When, 비교표, 트러블슈팅, 실전 코드, 퀴즈까지 한 번에 정리한 실무형 문서입니다.
2026-03-04 · 20 분 읽기 #ai-papers#practical-guide#productionAI 논문 읽기: Agentic Reasoning 구현 가이드 2026
AI 논문 읽기: Agentic Reasoning 구현 가이드 2026 주제로 Why, How, When, 비교표, 트러블슈팅, 코드 예시, 퀴즈를 포함한 실전 가이드.
2026-03-04 · 23 분 읽기 #ai-papers#2026-03RWKV: Reinventing RNNs for the Transformer Era — v4에서 v7 Goose까지
Transformer의 O(N²) 한계를 극복하는 RWKV 아키텍처를 분석합니다. Linear Attention과 RNN의 융합, 선택적 상태 공간 메커니즘, v7 Goose의 혁신까지 코드와 함께 살펴봅니다.
2026-03-03 · 13 분 읽기 #ai-papers#rwkv#rnn#linear-attention#state-space-model