태그: #training
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 8 편
LoRA rank를 바꾸면 학습률도 바꿔야 하나 — μA(2026)가 가른 두 레짐, 그리고 그 측정의 한계
LoRA에서 rank를 바꾸면 최적 학습률을 다시 찾아야 한다는 통념과, "1/r 스케일링을 쓰면 학습률은 rank와 무관하다"는 통념이 실무에서 동시에 돌아다닙니다. 2026년 2월 arXiv에 올라온 μA(Maximal-Update Adaptation) 논문은 이 둘이 모두 맞다고 말합니다 — 단, 당신이 어떤 α 규약과 어떤 초기화를 쓰느냐에 따라. 이 글은 μA가 유도한 두 레짐(η가
2026-07-16 · 31 분 읽기 #llm#lora#fine-tuning#peft#trainingLLM 학습 데이터 전처리 완전 가이드 — 웹 크롤부터 토큰 패킹까지, 최신 논문과 함께
좋은 모델은 좋은 데이터에서 나오고, 좋은 데이터는 전처리 파이프라인에서 나옵니다. 웹 크롤 수집 → 본문 추출 → 언어 식별 → 휴리스틱·분류기 품질 필터링 → 정확·근사(MinHash) 중복 제거 → PII·독성 처리 → 벤치마크 오염 제거 → 토크나이즈와 시퀀스 패킹까지 사전학습 데이터의 전체 공정을 단계별로 설명하고, SFT 데이터 정제의 요점, datatrove·Dolma·NeMo
2026-07-09 · 13 분 읽기 #ai#llm#data-engineering#preprocessing#trainingAI 모델 개발, 처음부터 끝까지 — 데이터에서 배포까지의 현실적인 생애주기
모델 개발은 사전학습이 아니라 결정 사다리에서 시작합니다 — 프롬프트로 되는가, RAG로 되는가, 파인튜닝이 필요한가. 평가 셋을 먼저 만드는 eval-first 원칙, 데이터 품질과 합성 데이터의 함정, 스케일링 법칙과 분산 학습, LoRA·DPO로 이어지는 파인튜닝 스펙트럼, 양자화·연속 배칭 서빙, 그리고 배포 후의 데이터 플라이휠까지 — AI 모델 개발의 전체 생애주기를 실무 순서로
2026-07-07 · 16 분 읽기 #ai#ml#llm#mlops#trainingVision LLM 학습법 — input과 output을 어떻게 가르치나
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuningLLM을 바닥부터 만들어보기 — 스탠퍼드 CS336 스타일 학습 로드맵
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026-06-12 · 27 분 읽기 #llm#transformer#cs336#deep-learning#tokenizer딥러닝 학습 방법론 완전 정복: 최적화부터 분산 학습까지
딥러닝 모델을 효과적으로 학습시키는 모든 기법을 다루는 완전 가이드. 경사 하강법, 옵티마이저, 학습률 스케줄링, 정규화, 배치 정규화, 전이학습, 파인튜닝, 분산 학습까지 실전 코드와 함께 배웁니다.
2026-03-17 · 42 분 읽기 #deep-learning#training#optimization#regularization#distributed-training딥러닝 디버깅 완전 가이드: 학습 실패 진단부터 성능 최적화까지
딥러닝 모델 학습 실패를 체계적으로 진단하고 해결하는 완전 가이드. Loss NaN, 기울기 소실/폭발, 과적합, 느린 수렴, 메모리 부족 등 모든 일반적인 문제의 원인과 해결책을 실전 코드와 함께 배웁니다.
2026-03-17 · 33 분 읽기 #deep-learning#debugging#pytorch#training#optimizationText-to-Image 모델 학습 방법론 완벽 가이드: GAN에서 Flow Matching까지
GAN, VAE, Diffusion, Flow Matching까지 Text-to-Image 생성 모델의 핵심 아키텍처별 학습 방법론을 논문 기반으로 심층 분석한다. Stable Diffusion, DALL-E, Imagen, Flux 등 주요 모델의 학습 전략과 Fine-tuning 기법을 포괄적으로 다룬다.
2026-03-01 · 63 분 읽기 #deep-learning#text-to-image#diffusion#stable-diffusion#generative-ai