태그: #fine-tuning
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 20 편
100배 싸다는 주장은 과제를 좁혔을 때만 참입니다 — 검증과 손익분기
2026년 8월에 공개된 한 사례 글은 40억 파라미터급 오픈 모델을 강화학습으로 후학습해 검색 과제에서 프론티어 모델과 맞먹으면서 요청당 비용은 자릿수 단위로 낮췄다고 밝힙니다. 이 글은 그 주장을 소개하는 대신 검증합니다. 원문에서 실제로 확인되는 숫자와 확인되지 않는 숫자를 구분하고, 좁은 과제에서만 성립하는 조건이 무엇인지 정리하며, 후학습이 라우팅보다 유리해지는 손익분기를 직접 계산
2026-08-09 · 14 분 읽기 #llm#cost#fine-tuning#retrieval#open-models500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가
2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대
2026-07-31 · 19 분 읽기 #ai#llm#fine-tuning#reinforcement-learning#inference-costRAG · 파인튜닝 · 롱컨텍스트 — 내 문제엔 뭘 써야 하나: 논문이 실제로 잰 것, 그리고 아무도 재지 않은 것
LLM 아키텍처에서 가장 많이 나오는 질문이지만, 대부분의 답은 출처 없는 의사결정 트리입니다. 이 글은 측정된 것만 가지고 답합니다. 파인튜닝은 새 지식을 넣는 데 실패한다는 것이 여러 논문에서 반복 측정됐고(Ovadia 등, Gekhman 등), 정반대로 보이는 농업 사례 연구는 사실 다른 개입(비지도 계속사전학습 vs 지도 Q&A 튜닝)을 잰 것이라 충돌이 아닙니다. 롱컨텍스트는 위치·
2026-07-17 · 43 분 읽기 #rag#llm#fine-tuning#long-context#aiLoRA rank를 바꾸면 학습률도 바꿔야 하나 — μA(2026)가 가른 두 레짐, 그리고 그 측정의 한계
LoRA에서 rank를 바꾸면 최적 학습률을 다시 찾아야 한다는 통념과, "1/r 스케일링을 쓰면 학습률은 rank와 무관하다"는 통념이 실무에서 동시에 돌아다닙니다. 2026년 2월 arXiv에 올라온 μA(Maximal-Update Adaptation) 논문은 이 둘이 모두 맞다고 말합니다 — 단, 당신이 어떤 α 규약과 어떤 초기화를 쓰느냐에 따라. 이 글은 μA가 유도한 두 레짐(η가
2026-07-16 · 31 분 읽기 #llm#lora#fine-tuning#peft#trainingAI Engineer 되는 방법 완벽 가이드 2026 — LLM, RAG, 에이전트, Evals, 커리어 로드맵
AI Engineer가 되기 위한 2026년 완벽 가이드. ML Engineer와의 차이부터 LLM API, 프롬프트 엔지니어링, RAG 설계, 에이전트 구축, LoRA 파인튜닝, vLLM 서빙, Evals 중심 개발, 프레임워크·벡터 DB 선택, 비용 최적화, 포트폴리오 5종, 한국·일본·글로벌 채용 시장과 인터뷰 대비까지 한 번에 정리합니다.
2026-07-02 · 49 분 읽기 #ai-engineer#career#llm#rag#ai-agentsVision LLM 학습법 — input과 output을 어떻게 가르치나
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuning비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detrMLX 심층 분석 — Apple Silicon용 ML 프레임워크, 통합 메모리·지연 그래프·Mac 네이티브 워크플로 (2026 핸즈온)
MLX는 PyTorch와 JAX를 만들었던 Apple 머신러닝 팀이, 이번에는 Apple Silicon만을 위해 다시 쓴 배열 프레임워크다. 핵심 명제는 단순하다 — M 시리즈 GPU는 CPU와 같은 RAM을 쓴다, 즉 호스트/디바이스 복사가 없다(통합 메모리). 이 글은 통합 메모리 명제, 지연(lazy) 계산 그래프, mlx-lm·mlx-vlm·mlx-data 서브패키지, Python과
2026-05-14 · 31 분 읽기 #mlx#apple-silicon#ml-framework#unified-memory#metalRAG 실전 완전 가이드: 검색, 임베딩, 벡터 DB, Fine-tuning의 경계 (2025)
LLM에 외부 지식을 붙이는 가장 실용적인 패턴, RAG. 2025년 시점에서 임베딩 모델 선택, 청킹 전략, 벡터 DB 선택, Rerank, Hybrid Search, 그리고 Fine-tuning과의 경계까지. Notion AI와 Claude의 검색 아키텍처를 해부하고, 한국어 RAG의 특수성과 비용·지연시간 최적화 체크리스트를 한 호흡에 정리합니다.
2026-04-15 · 33 분 읽기 #rag#llm#ai#vector-db#embeddingFine-tuning 완전 가이드: SFT, DPO, LoRA/QLoRA, 합성 데이터, 한국어 모델 (2025)
"Fine-tuning은 죽었다"는 소리도, "RAG로 다 된다"는 소리도 반쯤만 맞다. 2025년 시점에서 SFT/DPO/RLHF의 지형, LoRA·QLoRA로 가볍게 튜닝하는 실전, 합성 데이터 파이프라인, 한국어 모델(Solar, Qwen, Llama) 파인튜닝, 그리고 Fine-tune vs RAG vs Prompt의 경계선을 한 글로 정리합니다.
2026-04-15 · 23 분 읽기 #fine-tuning#llm#ai#lora#qloraAI Engineering 프로덕션 실전 완전 가이드 — RAG·Evals·Fine-tuning·LLMOps·Guardrails·Prompt Caching·비용 최적화까지 2025-2026년 현장 노하우
LLM을 프로토타입에서 프로덕션으로 가져가는 여정은 Jupyter 노트북의 데모와 다르다. RAG 파이프라인 설계, eval harness 구축, fine-tuning 결정 트리, LLMOps 관측 가능성, Guardrails와 안전성, Prompt Caching과 비용 최적화까지 2025-2026년 AI 엔지니어의 현장 가이드를 500줄로 정리한다.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#evaluation#fine-tuningUnsloth로 LLM 파인튜닝 완전 가이드 2025: QLoRA, 4bit 양자화, 2배 빠른 학습
Unsloth로 LLM 파인튜닝의 모든 것! QLoRA/LoRA 원리, 4bit 양자화(bitsandbytes), Unsloth 2x 속도 비밀, Llama 3/Mistral/Qwen 파인튜닝, 데이터 준비, 학습 설정, VRAM 최적화, GGUF/GPTQ 변환, 배포까지.
2026-03-25 · 25 분 읽기 #unsloth#llm#fine-tuning#qlora#loraFine-tuning 실전 가이드: LoRA와 QLoRA로 나만의 모델 만들기
H100 7대 없어도 됩니다. LoRA와 QLoRA를 사용하면 소비자용 GPU 한 장으로 70B 모델을 파인튜닝할 수 있습니다. 실전 코드와 함께 처음부터 끝까지 설명합니다.
2026-03-18 · 12 분 읽기 #fine-tuning#lora#qlora#llm#ai-developmentLLM 파인튜닝 완전 가이드: LoRA, QLoRA, RLHF, DPO 마스터하기
LLM 파인튜닝의 모든 기법을 다루는 완전 가이드. Full Fine-tuning부터 LoRA, QLoRA, RLHF, DPO, Instruction Tuning까지 HuggingFace PEFT와 함께 실전 예제로 마스터합니다.
2026-03-17 · 34 분 읽기 #llm#fine-tuning#lora#qlora#rlhf오픈소스 LLM 생태계 완전 가이드: 2026년 모델, 도구, 배포 전략
2026년 오픈소스 LLM 생태계를 총망라한 가이드. 주요 모델 패밀리(Llama, Mistral, Gemma, Qwen, DeepSeek), 로컬 추론 도구(Ollama, llama.cpp, vLLM), 파인튜닝 기법(LoRA, QLoRA), 그리고 나만의 LLM을 운영하기 위한 실전 배포 전략을 다룹니다.
2026-03-17 · 32 분 읽기 #open-source#llm#llama#mistral#gemmaLLM Fine-tuning 실전 가이드: LoRA, QLoRA, PEFT로 효율적 모델 적응
LLM Fine-tuning의 이론과 실전을 다룹니다. LoRA의 저랭크 분해 원리, QLoRA의 4비트 양자화 기법, PEFT 라이브러리 활용법, 데이터셋 구성 전략, 하이퍼파라미터 튜닝까지 프로덕션 수준의 모델 적응 파이프라인을 구축합니다.
2026-03-13 · 17 분 읽기 #llm#fine-tuning#lora#qlora#peftLLM 파인튜닝 실전 가이드: LoRA·QLoRA·PEFT로 구현하는 효율적 도메인 적응
LLM 파인튜닝의 핵심 기법인 LoRA의 저랭크 분해 원리, QLoRA의 4비트 양자화 파인튜닝, Hugging Face PEFT 라이브러리 활용법을 심층 분석. 데이터셋 준비, 하이퍼파라미터 튜닝, 평가 메트릭, Full Fine-tuning과의 비교, 실패 사례와 복구 절차, 프로덕션 체크리스트를 다룹니다.
2026-03-11 · 21 분 읽기 #llm#fine-tuning#lora#qlora#peftLLM 파인튜닝 실전 — LoRA, QLoRA, PEFT로 나만의 모델 만들기
LLM 파인튜닝의 실전 가이드. LoRA의 수학적 원리부터 QLoRA로 소비자 GPU에서 대형 모델 학습, PEFT 라이브러리 활용법까지 코드 예제로 상세히 다룹니다.
2026-03-02 · 10 분 읽기 #llm#fine-tuning#lora#qlora#peftLoRA: 대규모 언어 모델의 효율적 파인튜닝 논문 분석
LoRA(Low-Rank Adaptation) 논문의 핵심 원리를 수학적으로 분석하고, HuggingFace PEFT를 활용한 실전 적용법을 정리한다.
2026-03-01 · 28 분 읽기 #ai-papers#lora#fine-tuning#llm#peftBERT 논문 완벽 분석: 양방향 Transformer가 NLP의 판도를 바꾼 방법
Google의 BERT 논문을 심층 분석한다. Masked Language Model(MLM)과 Next Sentence Prediction(NSP)을 통한 양방향 사전학습, Fine-tuning 전략, 그리고 11개 NLP 벤치마크를 석권한 아키텍처의 핵심 원리를 수식과 코드 예제로 정리한다.
2026-03-01 · 43 분 읽기 #bert#nlp#transformer#pre-training#fine-tuning