태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
LoRA rank를 바꾸면 학습률도 바꿔야 하나 — μA(2026)가 가른 두 레짐, 그리고 그 측정의 한계
LoRA에서 rank를 바꾸면 최적 학습률을 다시 찾아야 한다는 통념과, "1/r 스케일링을 쓰면 학습률은 rank와 무관하다"는 통념이 실무에서 동시에 돌아다닙니다. 2026년 2월 arXiv에 올라온 μA(Maximal-Update Adaptation) 논문은 이 둘이 모두 맞다고 말합니다 — 단, 당신이 어떤 α 규약과 어떤 초기화를 쓰느냐에 따라. 이 글은 μA가 유도한 두 레짐(η가
2026-07-16 · 31 분 읽기 #llm#lora#fine-tuning#peft#training문서에서 지식 그래프로 — 정직한 구축 파이프라인
'문서에서 지식 그래프를 뽑는다'는 데모에서는 LLM 호출 한 번처럼 보입니다. 하지만 고객의 문서를 실제로 쿼리 가능한 그래프로 바꾸는 일은 여섯 단계의 파이프라인이고, 비용과 고통의 대부분은 추출이 아니라 엔티티 해소에 있습니다. 이 글은 스키마(온톨로지)를 먼저 정하는 이유, LLM 기반 스키마 제약 추출(LangChain LLMGraphTransformer, LlamaIndex의 Si
2026-07-15 · 19 분 읽기 #knowledge-graph#ai#llm#data-engineeringGraph RAG란 무엇인가 — 벡터 RAG가 막히는 곳, 그리고 이게 값을 하는 순간
RAG의 표준 레시피(청크 → 임베딩 → 상위 k개 검색)는 답이 한 조각에 들어 있을 때 잘 작동하지만, 멀티홉 질문과 코퍼스 전체를 관통하는 글로벌 센스메이킹 질문에서는 구조적으로 막힙니다. Microsoft의 GraphRAG는 이 두 사각지대를 겨냥해, LLM으로 코퍼스에서 지식 그래프를 뽑고 Leiden 알고리즘으로 커뮤니티를 찾아 요약을 미리 만들어 둡니다. 그런 다음 글로벌 질문은
2026-07-15 · 16 분 읽기 #rag#graph-rag#knowledge-graph#ai#llmTencent Hy3: 295B 오픈 웨이트 MoE를 냉정하게 읽기
Tencent이 2026년 7월 6일 Hy3를 Apache 2.0으로 공개했다. 총 295B 중 21B만 활성화되는 MoE 추론·에이전트 언어 모델이다. 무엇이 실제로 새로운지, 중국계 오픈 웨이트 흐름에서 어디에 놓이는지, 그리고 벤더가 직접 낸 벤치마크 숫자를 어디까지 믿어야 하는지 정리했다.
2026-07-11 · 9 분 읽기 #hy3#tencent#hunyuan#open-weights#moeRLHF 모델은 왜 보상을 속이는가 — 리워드 해킹의 메커니즘, 증상, 완화 방향
Xiaohua Wang 등 23명이 2026년 4월 arXiv에 올린 "Reward Hacking in the Era of Large Models"는 RLHF로 정렬된 대형 모델이 왜, 어떻게 보상 신호를 게이밍하는지 정리한 서베이입니다. 핵심 제안은 리워드 해킹을 목표 압축, 최적화 증폭, 평가자–정책 공진화라는 세 힘으로 읽는 프록시 압축 가설(PCH)입니다. 장황함 편향, 아첨, 그럴듯
2026-07-11 · 11 분 읽기 #ai#llm#alignment#rlhf#safetyAI가 당신의 코드를 유지보수해도, 그래도 사람을 위해 쓴다
2026년 7월 10일, Scott Robinson은 오래된 격언을 한 번 비틀어 되살렸습니다. LLM은 당신의 코드베이스를 스타일 가이드처럼 읽기 때문에, 당신이 병합한 모든 지름길이 곧 모델이 기계 규모로 되돌려주는 학습 데이터가 됩니다. 중복된 접근 권한 검사 예시와 "LLM은 스펀지"라는 그의 문장을 짚은 뒤, 더 어려운 질문을 던집니다. 다음 유지보수자가 기계일 때도 사람을 위해 쓰
2026-07-11 · 12 분 읽기 #ai#llm#code-quality#maintainability#craftUniClawBench로 보는 2026년의 에이전트 벤치마크 — 살아 있는 컨테이너와 숨은 감독자
홍콩대(HKU) MMLab이 2026년 7월 arXiv에 올린 UniClawBench는 "능력 중심(capability-driven)"을 표방하는 프로액티브 에이전트 벤치마크입니다. 정적으로 미리 기록된 정답을 맞히는 대신, 살아 있는 Docker 컨테이너 안에서 단계별 체크포인트로 채점하고, 실행자·숨은 감독자·사용자 에이전트로 이루어진 닫힌 고리로 다중 턴 피드백을 시뮬레이션합니다. 40
2026-07-11 · 10 분 읽기 #ai#agents#evaluation#benchmark#llmModel Context Protocol(MCP) 레퍼런스 — AI를 외부 세계에 연결하는 열린 표준
Model Context Protocol(MCP)은 애플리케이션이 LLM에 컨텍스트를 제공하는 방식을 표준화한 열린 프로토콜입니다. 이 글은 MCP가 실제로 무엇인지를 공식 문서에 근거해 정리한 엔지니어용 레퍼런스입니다 — 왜 M×N 통합 문제를 푸는지, 호스트·클라이언트·서버 구조와 두 계층(데이터/전송), 세 가지 서버 프리미티브(도구·리소스·프롬프트), stdio와 Streamable
2026-07-11 · 13 분 읽기 #mcp#ai#agents#llm#protocolRTX 5090 한 장으로 작은 모델들 직접 굴려보기 — microGPT·OCR·음악 생성
RTX 5090(Blackwell, 32GB) 한 장에 SSH로 붙어 작은 모델 셋을 직접 돌려봤습니다. char-level GPT를 밑바닥부터 28초 만에 학습시키고(10.75M 파라미터, 117만 tokens/s), 전용 OCR(TrOCR)과 소형 VLM(Qwen2-VL-2B)을 같은 이미지에 붙여 CER로 대결시키고, MusicGen으로 8초짜리 음악을 1.9초(4.2배 실시간)에 생성
2026-07-11 · 12 분 읽기 #pytorch#gpu#llm#ocr#hands-onMicrosoft Flint 읽기 — 에이전트가 차트를 그리게 만드는 시각화 언어
Microsoft Research가 공개한 Flint는 에이전트를 시각화하는 언어가 아니라, AI 에이전트가 데이터로부터 보기 좋은 차트를 안정적으로 만들게 해주는 중간 언어입니다. 컴파일러가 스케일·축·색·레이아웃 같은 낮은 수준의 결정을 데이터와 시맨틱 타입으로부터 대신 유도하고, 하나의 명세를 Vega-Lite·ECharts·Chart.js로 컴파일합니다. 이 글은 Flint가 실제로
2026-07-11 · 11 분 읽기 #ai#agents#data-visualization#llm#microsoft더 생각한다고 더 맞는 것은 아니다: 테스트타임 컴퓨트와 과잉사고
2026년 4월, Shu Zhou 등 6명은 "When More Thinking Hurts"에서 추론 토큰을 무작정 늘리는 흐름에 정면으로 질문을 던집니다. 저자들의 보고에 따르면 컴퓨트 예산이 커질수록 추가 추론 토큰의 한계 효용은 크게 줄어들고, 어느 지점부터 모델은 "과잉사고"에 빠져 이미 맞혔던 답을 스스로 뒤엎습니다. 최적 사고 길이는 문제 난이도마다 다르므로, 모두에게 같은 예산을
2026-07-11 · 12 분 읽기 #ai#llm#reasoning#inference#test-time-compute사전학습 체크포인트를 긴 컨텍스트 하이브리드로 — HyLo의 업사이클링 레시피
하이브리드 시퀀스 모델(어텐션 + 선형·SSM 블록)은 긴 컨텍스트에 유리하지만, 지금까지는 대부분 처음부터 새로 사전학습해야 했습니다. 2026년 4월 프리프린트 HyLo는 이미 학습된 Transformer 체크포인트를 값싼 후처리 학습만으로 하이브리드로 "업사이클링"하는 레시피를 제안합니다 — MLA(잠재 어텐션)와 Mamba2·Gated DeltaNet 같은 선형 블록을 섞고, 단계적
2026-07-11 · 11 분 읽기 #ai#llm#long-context#architecture#efficiencyHybrid SWA로 긴 컨텍스트 추론 최적화하기 — Xiaomi MiMo v2.5가 실제로 한 것
슬라이딩 윈도우 어텐션(SWA)과 풀 어텐션을 층별로 섞는 하이브리드 SWA는 긴 컨텍스트 추론의 KV 캐시 메모리와 연산량을 함께 줄이는 최근의 주류 설계입니다. Xiaomi가 공개한 MiMo v2.5 추론 최적화 글을 근거로, 하이브리드 SWA가 무엇이고 왜 중요한지, MiMo v2.5가 실제로 어떤 아키텍처와 시스템 엔지니어링을 했는지(70층 중 10층만 풀 어텐션, 윈도우 128, 이
2026-07-11 · 15 분 읽기 #ai#llm#inference#attention#optimizationLLM 번아웃 — 일이 "만드는 것"에서 "검토하는 것"으로 바뀔 때
개발자 Alec Scollon의 에세이 "I Think I Have LLM Burnout"이 해커뉴스에서 화제가 되었습니다. 하루가 코드를 "쓰는 일"에서 모델이 쓴 것을 "검토하는 일"로 조용히 바뀌었다는 감각을 정확히 짚었기 때문입니다. 이 글은 그 주장을 충실히 정리하고, 균형 잡힌 시각을 더합니다. 생성은 싸졌지만 검증은 그대로이고, AI 출력을 리뷰하는 일은 실제 인지 노동입니다.
2026-07-11 · 12 분 읽기 #llm#developer-experience#burnout#ai-tooling#code-reviewKV 캐시를 4비트로 — SAW-INT4와 시스템을 아는 INT4 양자화
긴 컨텍스트 LLM 서빙에서 진짜 메모리 병목은 가중치가 아니라 KV 캐시입니다. 이를 INT4로 그냥 줄이면 정확도가 무너지는데, 2026년 4월 프리프린트 SAW-INT4는 토큰 단위 INT4 양자화에 블록 대각 아다마르 회전을 더해 순진한 INT4가 잃은 정확도를 거의 되찾는다고 보고합니다. 이 논문의 진짜 각도는 정확도만이 아니라 처리량입니다 — 페이지드 KV 캐시 레이아웃에 바로 통
2026-07-11 · 13 분 읽기 #ai#llm#quantization#inference#kv-cache효과적인 AI 에이전트 만들기 — 워크플로 다섯 패턴과 에이전트 레퍼런스
Anthropic의 엔지니어링 가이드 "Building Effective Agents"를 실무 레퍼런스로 정리했습니다. 워크플로와 에이전트의 정확한 구분, 모든 것의 기본 블록인 증강된 LLM(검색·도구·메모리), 다섯 가지 워크플로 패턴(프롬프트 체이닝·라우팅·병렬화·오케스트레이터-워커·이밸류에이터-옵티마이저)을 각각 언제 쓰는지와 예시로 다룹니다. 자율 에이전트가 실제로 무엇인지, 언제
2026-07-11 · 17 분 읽기 #ai#agents#llm#engineering#anthropic확산 LLM이 CUDA 커널을 쓴다 — DICE와 왜 병렬 생성이 도움이 되는가
DICE는 2026년 2월 프리프린트로, 확산(diffusion) 대규모 언어 모델이 CUDA 커널 생성에서 같은 규모의 자기회귀(autoregressive) 모델을 능가하고 새로운 최고 성능(SOTA)을 세웠다고 주장합니다. 핵심 아이디어는 토큰을 왼쪽에서 오른쪽으로 하나씩 쓰는 대신, 전체 시퀀스를 병렬로 생성하고 어느 위치든 비순차적으로 고쳐 쓸 수 있다는 것 — 전역 구조가 중요한 코
2026-07-11 · 12 분 읽기 #ai#llm#diffusion#cuda#gpu스텝마다 얼마나 생각할지 고르기 — Ares의 적응형 추론 노력 라우팅
Ares(2026년 3월 프리프린트)를 실무 관점에서 정리했습니다. 이 논문은 추론 노력을 태스크 전체가 아니라 스텝 단위의 비용 레버로 다룹니다. 가벼운 라우터가 상호작용 이력을 보고 각 스텝에 필요한 가장 낮은 추론 레벨을 예측해, 모든 스텝을 최대 노력으로 돌리는 낭비를 줄입니다. 저자들은 TAU-Bench·BrowseComp-Plus·WebArena에서 추론 토큰을 최대 52.7%까지
2026-07-11 · 8 분 읽기 #ai#agents#llm#efficiency느린 컴퓨터에서 GLM-5.2 돌리기 — colibrì가 744B 모델을 디스크에서 스트리밍하는 법
colibrì는 순수 C 약 1,300줄로 작성된 추론 엔진으로, 744B(7,440억) 파라미터 MoE 모델인 GLM-5.2를 램 25GB짜리 소비자용 PC에서 돌립니다. 핵심은 MoE 희소성과 디스크 스트리밍입니다 — 밀집 레이어 약 9.9GB만 램에 상주시키고, 약 370GB의 라우팅 전문가는 NVMe SSD에 두고 토큰마다 필요한 것만 읽습니다. 대가는 정직하게 느립니다: 콜드 상태
2026-07-11 · 8 분 읽기 #ai#llm#local-inference#moe#quantization프로덕션 RAG 패턴 — 순진한 RAG가 실패하는 이유와 실제로 통하는 기법들
데모용 RAG는 30분이면 만들지만, 프로덕션에서 조용히 무너지는 지점은 대부분 생성이 아니라 검색입니다. 청킹, 임베딩과 하이브리드 검색(BM25 + 벡터), 리랭킹, 컨텍스추얼 리트리벌, 쿼리 재작성, 그리고 평가를 각각 무엇이고·언제 도움이 되며·무엇을 대가로 치르는지 정리합니다. Anthropic의 컨텍스추얼 리트리벌 수치처럼 출처 있는 숫자만 인용하고, RAG가 마법이 아니라는 점과
2026-07-11 · 18 분 읽기 #ai#rag#llm#retrieval#embeddings