태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
LLM 학습 데이터 전처리 완전 가이드 — 웹 크롤부터 토큰 패킹까지, 최신 논문과 함께
좋은 모델은 좋은 데이터에서 나오고, 좋은 데이터는 전처리 파이프라인에서 나옵니다. 웹 크롤 수집 → 본문 추출 → 언어 식별 → 휴리스틱·분류기 품질 필터링 → 정확·근사(MinHash) 중복 제거 → PII·독성 처리 → 벤치마크 오염 제거 → 토크나이즈와 시퀀스 패킹까지 사전학습 데이터의 전체 공정을 단계별로 설명하고, SFT 데이터 정제의 요점, datatrove·Dolma·NeMo
2026-07-09 · 13 분 읽기 #ai#llm#data-engineering#preprocessing#trainingLLM 캐싱의 원리 — 프롬프트 캐싱과 Prefix Cache는 왜 돈을 아껴주는가
프롬프트 앞부분이 같으면 왜 비용이 10분의 1이 될까요? 답은 트랜스포머 내부의 KV 캐시에 있습니다. 어텐션이 인과적(causal)이라 앞쪽 토큰들의 Key/Value 벡터는 뒤에 무엇이 오든 변하지 않고, 그래서 저장해 뒀다가 재사용할 수 있습니다. prefill과 decode의 구분, KV 캐시의 메모리 수치, vLLM·SGLang의 prefix cache 구현, 그리고 Anthrop
2026-07-08 · 14 분 읽기 #ai#llm#caching#inference#performance최신 LLM 양자화 기술 총정리 — GPTQ·AWQ부터 FP8·MXFP4·KV 캐시 양자화까지
양자화는 모델의 숫자를 더 적은 비트로 표현해 메모리와 비용을 줄이는 기술입니다. 비트가 줄어도 품질이 버티는 이유(이상치와 스케일링), GPTQ와 AWQ의 접근 차이, llama.cpp GGUF의 k-quant, QLoRA의 NF4, 그리고 2026년의 중심축인 FP8과 마이크로스케일링 FP4(MXFP4·NVFP4), 다음 병목인 KV 캐시 양자화까지 — W4A16 같은 표기법 읽는 법과
2026-07-08 · 15 분 읽기 #ai#llm#quantization#inference#optimizationAI 모델 개발, 처음부터 끝까지 — 데이터에서 배포까지의 현실적인 생애주기
모델 개발은 사전학습이 아니라 결정 사다리에서 시작합니다 — 프롬프트로 되는가, RAG로 되는가, 파인튜닝이 필요한가. 평가 셋을 먼저 만드는 eval-first 원칙, 데이터 품질과 합성 데이터의 함정, 스케일링 법칙과 분산 학습, LoRA·DPO로 이어지는 파인튜닝 스펙트럼, 양자화·연속 배칭 서빙, 그리고 배포 후의 데이터 플라이휠까지 — AI 모델 개발의 전체 생애주기를 실무 순서로
2026-07-07 · 16 분 읽기 #ai#ml#llm#mlops#trainingLiteLLM 실전 사용법 — 100개 이상 LLM을 하나의 인터페이스로
LiteLLM으로 OpenAI, Anthropic, Gemini, Bedrock, OpenRouter, 로컬 모델까지 동일한 OpenAI 포맷으로 호출하는 실전 퀵스타트. 설치부터 스트리밍, Router, Proxy Server까지 빠르게 정리한다.
2026-07-06 · 15 분 읽기 #litellm#llm#ai-gateway#python#openai-compatibleOpenRouter 사용법 — 하나의 API로 300개 이상 LLM 쓰기
OpenRouter 하나로 60개 이상 공급자의 300개 이상 모델을 OpenAI 호환 방식으로 호출하는 법 — 키 발급, 첫 curl 요청, SDK 드롭인, 라우팅과 폴백, 스트리밍까지 실무 기준으로 정리한다.
2026-07-06 · 13 분 읽기 #openrouter#llm#ai-gateway#api#openai-compatible관측 가능성 완전 정복: 로그·트레이싱·LLM 모니터링
로그·메트릭·트레이스라는 세 기둥부터 이들이 traceid로 어떻게 엮이는지, Loki와 OpenSearch의 로그 전략 차이, OpenTelemetry를 중심으로 한 분산 트레이싱(Jaeger·Tempo), 그리고 Langfuse로 대표되는 LLM 관측 가능성까지. 실무에서 스택을 어떻게 짜고 무엇을 골라야 하는지 하나씩 대조하며 정리합니다.
2026-07-03 · 27 분 읽기 #observability#opentelemetry#tracing#logging#llmAI Engineer 되는 방법 완벽 가이드 2026 — LLM, RAG, 에이전트, Evals, 커리어 로드맵
AI Engineer가 되기 위한 2026년 완벽 가이드. ML Engineer와의 차이부터 LLM API, 프롬프트 엔지니어링, RAG 설계, 에이전트 구축, LoRA 파인튜닝, vLLM 서빙, Evals 중심 개발, 프레임워크·벡터 DB 선택, 비용 최적화, 포트폴리오 5종, 한국·일본·글로벌 채용 시장과 인터뷰 대비까지 한 번에 정리합니다.
2026-07-02 · 49 분 읽기 #ai-engineer#career#llm#rag#ai-agentsVision LLM 아키텍처 — 이미지가 언어가 되기까지
비전-언어 모델은 이미지를 비전 인코더로 처리한 뒤 프로젝터를 거쳐 LLM이 이해할 수 있는 토큰으로 바꿉니다. 패치 임베딩부터 임의 해상도 처리까지, 이미지가 언어 토큰이 되는 전 과정을 구조적으로 살펴봅니다.
2026-06-26 · 41 분 읽기 #llm#vision-language-model#multimodal#vit#qwen2-vl멀티모달 토크나이제이션과 융합 — 이미지·오디오를 토큰으로
이미지와 오디오, 비디오를 어떻게 토큰으로 바꾸고 텍스트와 하나의 시퀀스로 엮는지 정리합니다. 패치·VQ 기반 이미지 토큰화, 이산 코덱 오디오 토큰화, 프레임 샘플링, 인터리빙과 구분 토큰, 토큰 폭증과 압축, 컨텍스트 비용까지 멀티모달 LLM의 입력 구성을 깊이 다룹니다.
2026-06-26 · 30 분 읽기 #llm#multimodal#tokenization#vision-language#q-former위치 인코딩 완전 이해 — 사인파에서 RoPE까지
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
2026-06-26 · 29 분 읽기 #llm#positional-encoding#rope#alibi#long-contextTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cache어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqaAI로 투자 리서치하기 — 똑똑하게, 그러나 신중하게
AI 도구로 공시 요약, 종목 스크리닝, 번역 같은 투자 리서치를 빠르게 해내는 방법과, 환각과 최신성 한계, 출처 검증, 백테스트 주의, 데이터 편향 같은 함정을 정리합니다. 도구는 거들 뿐, 책임은 투자자 본인에게 있다는 관점에서 실전 워크플로를 제안합니다.
2026-06-18 · 30 분 읽기 #finance#ai#investment-research#llm#due-diligence온디바이스·엣지 AI — AI가 기기 안으로 들어온다
클라우드에 머물던 AI 추론이 스마트폰·PC·임베디드 기기 안으로 이동하고 있습니다. 지연·프라이버시·비용이라는 세 가지 동인과 NPU·온디바이스 LLM의 부상, 그리고 투자·산업 관점의 시사점과 리스크를 균형 있게 정리합니다.
2026-06-18 · 35 분 읽기 #ai#edge-ai#on-device#npu#llmDiffusion LM의 부상 — 자기회귀의 대안이 될 수 있을까
2026년 6월 구글이 DiffusionGemma를 공개하며 텍스트 확산 모델이 GeekNews와 해커뉴스를 달구고 있습니다. 자기회귀 생성의 구조적 한계, 마스킹 기반 디노이징의 원리, 블록 단위 병렬 생성, 4배 빠르다는 주장의 실체와 품질 트레이드오프까지 비판적으로 분석합니다.
2026-06-12 · 32 분 읽기 #llm#diffusion#text-generation#gemma#inferenceLLM을 바닥부터 만들어보기 — 스탠퍼드 CS336 스타일 학습 로드맵
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026-06-12 · 27 분 읽기 #llm#transformer#cs336#deep-learning#tokenizer로컬 LLM 인퍼런스 최적화 — 양자화부터 VRAM 한계 돌파까지
프라이버시와 비용, 그리고 빅테크 피로감 속에 로컬 LLM이 다시 뜨고 있습니다. VRAM 중심의 하드웨어 선택, GGUF와 AWQ 양자화, llama.cpp와 vLLM과 Ollama 비교, KV cache 메모리 산수, VRAM을 스왑으로 쓰는 역발상 해킹까지 로컬 인퍼런스 최적화의 전체 지도를 그립니다.
2026-06-12 · 29 분 읽기 #llm#inference#quantization#llama-cpp#vllm장인과 빌더 — LLM이 커리어를 잠식할 때 개발자가 서야 할 곳
Stack Overflow 블로그의 Artisans and builders와 HN에서 화제가 된 LLMs are eroding my software engineering career라는 두 글을 축으로, AI 시대 개발자 정체성의 재정의를 다룹니다. 빌더의 민주화와 장인 가치의 재조명, 10년차 도메인 전문가의 차별화 전략, 분기별 실천 플랜까지 정리합니다.
2026-06-12 · 43 분 읽기 #career#ai#engineering-culture#llm#senior-engineer컨텍스트 엔지니어링 — AI 에이전트에게 기억을 설계해주는 법
프롬프트 엔지니어링의 시대가 저물고 컨텍스트 엔지니어링이 핵심 역량으로 떠올랐습니다. 컨텍스트 윈도우의 경제학, 메모리 계층 설계, 대화에서 사실을 자동 추출해 사용자 프로필을 구축하는 패턴, RAG와 메모리의 구분, compaction 전략, 평가 방법과 함정까지 실무 관점에서 정리합니다.
2026-06-12 · 31 분 읽기 #ai#context-engineering#llm#ai-agent#memory