태그: #long-context
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 12 편
학습 레시피 — 사전학습에서 후학습까지, 리포트는 무엇을 적는가
Llama 3의 세 단계와 여섯 번의 컨텍스트 확장, Qwen3의 세 단계 사전학습, DeepSeek-V3의 학습률 스케줄과 두 단계 YaRN 확장, Kimi K2의 데이터 재작성 실험을 리포트에 적힌 그대로 비교하고, 학습 단계 기술을 읽는 법을 정리합니다.
2026-08-12 · 12 분 읽기 #ai-papers#model-internals#pretraining#training-recipe#data-mixture위치 인코딩 — RoPE와 컨텍스트 확장의 대가
ropetheta 하나가 문맥 길이에 어떻게 작용하는지 파장 계산으로 보여 주고, Llama 3의 500000, Qwen3의 ABF, DeepSeek-V3와 Kimi K2의 YaRN 설정, GLM-4.5의 부분 회전을 실제 config로 비교합니다. 긴 컨텍스트가 왜 공짜가 아닌지 프리필 연산량과 캐시 비용으로 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rope#positional-encoding#long-contextRAG · 파인튜닝 · 롱컨텍스트 — 내 문제엔 뭘 써야 하나: 논문이 실제로 잰 것, 그리고 아무도 재지 않은 것
LLM 아키텍처에서 가장 많이 나오는 질문이지만, 대부분의 답은 출처 없는 의사결정 트리입니다. 이 글은 측정된 것만 가지고 답합니다. 파인튜닝은 새 지식을 넣는 데 실패한다는 것이 여러 논문에서 반복 측정됐고(Ovadia 등, Gekhman 등), 정반대로 보이는 농업 사례 연구는 사실 다른 개입(비지도 계속사전학습 vs 지도 Q&A 튜닝)을 잰 것이라 충돌이 아닙니다. 롱컨텍스트는 위치·
2026-07-17 · 43 분 읽기 #rag#llm#fine-tuning#long-context#ai컨텍스트 엔지니어링은 프롬프트 엔지니어링을 대체한 말인가 — 측정된 것과 아닌 것
"프롬프트 엔지니어링은 죽었다"는 문장은 이 용어를 만든 어느 1차 출처에도 없습니다. Karpathy는 few-shot 예제와 태스크 설명을 컨텍스트 엔지니어링의 구성요소로 나열했고, Anthropic은 "프롬프트 엔지니어링의 자연스러운 진전(natural progression)"이라고 썼습니다. 즉 대체가 아니라 포함입니다. 그런데도 이게 진짜 다른 일이라는 근거는 있습니다 — Chrom
2026-07-17 · 37 분 읽기 #llm#context-engineering#prompt-engineering#long-context#ai-agent사전학습 체크포인트를 긴 컨텍스트 하이브리드로 — HyLo의 업사이클링 레시피
하이브리드 시퀀스 모델(어텐션 + 선형·SSM 블록)은 긴 컨텍스트에 유리하지만, 지금까지는 대부분 처음부터 새로 사전학습해야 했습니다. 2026년 4월 프리프린트 HyLo는 이미 학습된 Transformer 체크포인트를 값싼 후처리 학습만으로 하이브리드로 "업사이클링"하는 레시피를 제안합니다 — MLA(잠재 어텐션)와 Mamba2·Gated DeltaNet 같은 선형 블록을 섞고, 단계적
2026-07-11 · 11 분 읽기 #ai#llm#long-context#architecture#efficiency위치 인코딩 완전 이해 — 사인파에서 RoPE까지
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
2026-06-26 · 29 분 읽기 #llm#positional-encoding#rope#alibi#long-context어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqaGemini 2.5 개발자 실전 가이드: Pro, Flash, Flash-Lite를 어떻게 고를까
2025년 3월 25일 공개된 Gemini 2.5를 기준으로, Pro, Flash, Flash-Lite 중 무엇을 선택해야 하는지, reasoning 모델이 워크플로를 어떻게 바꾸는지, 그리고 팀이 실제로 무엇을 배포해야 하는지를 실무 관점에서 정리합니다.
2026-04-12 · 11 분 읽기 #google#gemini#gemini-2-5#coding#agentic-codingContext Window 100만 토큰 시대: RAG는 사라지는가?
Gemini 1.5 Pro의 100만 토큰, Claude의 20만 토큰 컨텍스트 윈도우가 등장하면서 "RAG가 필요 없어지는 것 아니냐"는 질문이 많아졌습니다. 실제 비용, 속도, 품질을 비교해서 솔직하게 답합니다.
2026-03-18 · 12 분 읽기 #context-window#rag#llm#long-context#ai-development1M 컨텍스트 윈도우 시대의 LLM 활용 전략: 대규모 문맥 처리의 실전 가이드
2026년 3월 Anthropic이 Claude Opus 4.6/Sonnet 4.6의 1M 토큰 컨텍스트 윈도우를 GA로 발표했다. 기존 128K~200K 제한에서 1M으로의 확장이 가져오는 활용 패러다임의 전환, 실전 활용 패턴 5가지, RAG 대비 트레이드오프, 비용 최적화 전략까지 종합 가이드를 제공한다.
2026-03-15 · 41 분 읽기 #ai-platform#llm#context-window#long-context#claudeRing Attention 논문 분석: 분산 환경에서 무한 컨텍스트 윈도우 트레이닝 구현
Ring Attention 논문을 분석하고 분산 환경에서 컨텍스트 길이 제한을 극복하는 방법을 탐구합니다. Blockwise Parallel Transformer와의 연결, 구현 세부사항, 성능 벤치마크, 그리고 프로덕션 적용 시 고려사항까지 다룹니다.
2026-03-08 · 55 분 읽기 #ai-papers#ring-attention#distributed-training#long-context#transformerLLM 롱 컨텍스트 성능과 KV Cache 최적화 완전 가이드: MQA에서 Ring Attention까지
LLM의 롱 컨텍스트 처리를 가능하게 하는 KV Cache의 원리부터 메모리 소비 분석, MQA·GQA·PagedAttention·슬라이딩 윈도우·Ring Attention 등 최적화 기법, 모델별 컨텍스트 윈도우 비교, Needle-in-a-Haystack 벤치마크까지 실무 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#kv-cache#long-context#multi-query-attention#grouped-query-attention