태그: #moe
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 16 편
MoE 라우팅 — 전문가는 어떻게 뽑히는가
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#mixture-of-experts#moe#routing텍스트 LLM 기술 리포트, 무엇을 읽을 것인가 — 순위 대신 설계 결정 읽기
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#llm#moe이 모델들은 어떻게 만들어졌나 — 2026년 오픈 웨이트 파이프라인 해부
2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한
2026-08-02 · 32 분 읽기 #llm#pretraining#moe#post-training#quantization26B 모델을 2GB 램으로 돌리는 원리 — 상주 메모리와 워킹셋은 같은 숫자가 아니다
2026년 7월 29일 Show HN에 올라온 TurboFieldfare는 Gemma 4 26B-A4B를 M 시리즈 맥에서 약 2GB 램으로 돌린다고 주장합니다. 디스크에는 14.3GB가 깔리고, 램에 상주하는 것은 1.35GB짜리 공유 코어뿐이며, 토큰마다 필요한 전문가 가중치를 SSD에서 읽어 옵니다. 이 글은 그 숫자들을 직접 유도해 검증합니다 — 4비트 그룹 64 양자화가 왜 가중치당
2026-07-31 · 20 분 읽기 #ai#llm#quantization#apple-silicon#moeDeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스
2026-07-31 · 20 분 읽기 #ai#llm#deepseek#inference-cost#moeTencent Hy3: 295B 오픈 웨이트 MoE를 냉정하게 읽기
Tencent이 2026년 7월 6일 Hy3를 Apache 2.0으로 공개했다. 총 295B 중 21B만 활성화되는 MoE 추론·에이전트 언어 모델이다. 무엇이 실제로 새로운지, 중국계 오픈 웨이트 흐름에서 어디에 놓이는지, 그리고 벤더가 직접 낸 벤치마크 숫자를 어디까지 믿어야 하는지 정리했다.
2026-07-11 · 9 분 읽기 #hy3#tencent#hunyuan#open-weights#moe느린 컴퓨터에서 GLM-5.2 돌리기 — colibrì가 744B 모델을 디스크에서 스트리밍하는 법
colibrì는 순수 C 약 1,300줄로 작성된 추론 엔진으로, 744B(7,440억) 파라미터 MoE 모델인 GLM-5.2를 램 25GB짜리 소비자용 PC에서 돌립니다. 핵심은 MoE 희소성과 디스크 스트리밍입니다 — 밀집 레이어 약 9.9GB만 램에 상주시키고, 약 370GB의 라우팅 전문가는 NVMe SSD에 두고 토큰마다 필요한 것만 읽습니다. 대가는 정직하게 느립니다: 콜드 상태
2026-07-11 · 8 분 읽기 #ai#llm#local-inference#moe#quantizationLLM 논문 큐레이션 2024-2026 - Llama · DeepSeek · Qwen · Mistral · Phi · RLHF · DPO · CoT · RAG · FlashAttention · vLLM 심층 가이드
LLM을 만들고 운영하는 엔지니어를 위한 2024-2026 필독 논문 30+편 큐레이션. 파운데이션 모델(Llama 3/4, DeepSeek-V3/R1, Qwen3, Mistral, Phi-4, Gemma 3), 학습 혁신(MoE, MLA, GQA), 포스트-트레이닝(RLHF, DPO, ORPO, KTO), 추론(CoT, ToT, GRPO), 에이전트(ReAct, SWE-Agent), 검색(
2026-05-16 · 28 분 읽기 #llm#papers#llama#deepseek#qwen파운데이션 모델 아키텍처 2026 — Transformer 이후 / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 심층 가이드
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochr
2026-05-16 · 34 분 읽기 #foundation-models#transformer#attention-is-all-you-need#vaswani#mamba2025 오픈소스 AI 모델 완전 비교: DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral — 누가 왕인가
DeepSeek R1(671B/37B), Llama 4 Scout/Maverick, Qwen 3(235B MoE), Mistral 8x22B — 2025년 오픈소스 AI 모델 4강 완전 비교. 벤치마크, 라이센스, 배포 방법, 비용 분석까지.
2026-03-22 · 32 분 읽기 #open-source#ai#llm#deepseek#llama2025년 AI 논문 트렌딩 총정리: HuggingFace 인기 논문부터 10대 연구 트렌드까지
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.
2026-03-21 · 67 분 읽기 #ai-research#papers#huggingface#reasoning#moeMixture of Experts(MoE) 아키텍처 논문 심층 분석: GShard에서 DeepSeek-MoE까지
Mixture of Experts 아키텍처의 핵심 논문을 분석하고, GShard, Switch Transformer, Mixtral, DeepSeek-MoE의 라우팅 전략과 학습 안정성 기법을 비교합니다.
2026-03-14 · 34 분 읽기 #ai-papers#moe#transformer#deepseekMixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer에서 Mixtral까지의 발전과 효율적 스케일링 전략
Mixture of Experts(MoE) 아키텍처의 핵심 원리부터 Switch Transformer의 단일 전문가 라우팅, Mixtral 8x7B의 Sparse MoE 구현, DeepSeek-MoE의 세분화 전략까지 심층 분석. 라우팅 메커니즘, 로드 밸런싱 손실, 학습 안정화 기법, 추론 최적화, 장애 사례와 체크리스트를 다룹니다.
2026-03-11 · 28 분 읽기 #ai-papers#moe#switch-transformer#mixtral#model-architectureMixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer부터 Mixtral·DeepSeek까지
Mixture of Experts(MoE) 아키텍처를 심층 분석합니다. Sparse MoE의 수학적 기초부터 Switch Transformer, Mixtral 8x7B, DeepSeek-V3의 라우팅 전략, 학습 안정성 기법, 추론 최적화까지 논문 기반으로 상세히 다룹니다.
2026-03-10 · 23 분 읽기 #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE) 아키텍처 심층 분석: 설계 원리부터 DeepSeek-V3·Qwen3까지
Sparse MoE 아키텍처의 수학적 원리, 라우팅 전략, 로드 밸런싱 기법을 분석하고, Switch Transformer에서 DeepSeek-V3·Qwen3-235B까지 최신 MoE 모델의 설계 선택과 실전 학습·추론 최적화를 다룬다.
2026-03-06 · 35 분 읽기 #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE) 아키텍처 완벽 분석
Sparse MoE의 원리부터 Mixtral, DeepSeek-V3의 MoE 구현, routing 전략, load balancing까지 MoE 아키텍처를 완벽 분석합니다.
2026-03-03 · 7 분 읽기 #ai-papers#moe#mixtral#deepseek#2026-03