태그: #deepseek
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 13 편
DeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스
2026-07-31 · 20 분 읽기 #ai#llm#deepseek#inference-cost#moeLLM 논문 큐레이션 2024-2026 - Llama · DeepSeek · Qwen · Mistral · Phi · RLHF · DPO · CoT · RAG · FlashAttention · vLLM 심층 가이드
LLM을 만들고 운영하는 엔지니어를 위한 2024-2026 필독 논문 30+편 큐레이션. 파운데이션 모델(Llama 3/4, DeepSeek-V3/R1, Qwen3, Mistral, Phi-4, Gemma 3), 학습 혁신(MoE, MLA, GQA), 포스트-트레이닝(RLHF, DPO, ORPO, KTO), 추론(CoT, ToT, GRPO), 에이전트(ReAct, SWE-Agent), 검색(
2026-05-16 · 28 분 읽기 #llm#papers#llama#deepseek#qwen오픈소스 LLM 2026 완벽 가이드 - Llama 4 · DeepSeek V3 + R1 · Qwen 3 · Mistral Large 2 · Phi-4 · Gemma 3 · Falcon 3 심층 분석
2026년 봄, 오픈소스 LLM은 더 이상 폐쇄형의 그림자가 아니다. Meta Llama 4(Scout 109B, Maverick 400B MoE, Behemoth 2T), Llama 3.3 70B 마지막 덴스 베이스라인, DeepSeek V3 671B MoE와 R1 추론 모델, Alibaba Qwen 3와 Qwen 2.5 Coder, Mistral Large 2 123B와 Pixtral·C
2026-05-16 · 55 분 읽기 #open-source-llm#llama-4#deepseek#qwen#mistral중국 AI 랩 2026 — DeepSeek·Qwen·Kimi·GLM·Yi·Doubao·Hunyuan 심층 가이드 (오픈 웨이트의 새로운 무게 중심)
2024년 12월 DeepSeek-V3가 671B MoE를 공개하고 2025년 1월 R1이 reasoning까지 오픈 가중치로 풀었을 때, 세상은 잠시 멈췄다. 그 사이 알리바바 Qwen 3는 235B-A22B로 사실상 오픈 웨이트의 새 기준이 됐고, Moonshot의 Kimi K2는 1T MoE와 long-context로 long-form 챔피언이 됐고, Zhipu의 GLM-4.5는 age
2026-05-15 · 40 분 읽기 #ai#china#deepseek#qwen#alibabaLLM 랜드마크 논문 가이드 — Attention부터 GPT·LLaMA·DeepSeek·o1·Claude까지 (참고문헌 포함, 2026)
LLM 분야의 진짜 변화는 어떤 논문에서 시작됐는가. 2017년 Attention is All You Need부터 2026년의 추론 모델까지, 반드시 알아야 할 랜드마크 논문 20여 편을 시기·주제별로 정리한다. 각 논문은 '왜 중요한가·한 줄 요약·후속 영향'으로 압축하고, arXiv·블로그 링크를 끝에 모았다. 시간 부족한 엔지니어를 위한 LLM 논문 지도.
2026-05-14 · 22 분 읽기 #llm#research-papers#transformer#gpt#llama2025 오픈소스 AI 모델 완전 비교: DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral — 누가 왕인가
DeepSeek R1(671B/37B), Llama 4 Scout/Maverick, Qwen 3(235B MoE), Mistral 8x22B — 2025년 오픈소스 AI 모델 4강 완전 비교. 벤치마크, 라이센스, 배포 방법, 비용 분석까지.
2026-03-22 · 32 분 읽기 #open-source#ai#llm#deepseek#llama2025년 3월 테크·AI·K-POP 위클리 다이제스트: GTC부터 BTS 컴백까지
NVIDIA GTC 2025 Blackwell Ultra 발표, Gemini 2.5 Pro 등장, MCP의 업계 표준화, DeepSeek-R1 오픈소스 충격, BTS 5년만의 완전체 컴백, JENNIE 솔로 앨범 밀리언셀러 등 2025년 3월 테크·AI·K-POP 핵심 트렌드를 한눈에 정리합니다.
2026-03-21 · 22 분 읽기 #culture#ai#kpop#nvidia#gtcLLM 사전 학습 & 스케일링 법칙: Chinchilla, Flash Attention, MoE까지
Chinchilla 스케일링 법칙, Common Crawl 데이터 준비, Flash Attention 2, GQA, MoE 아키텍처부터 DeepSeek-V3, Llama 3.1 사전 학습 레시피까지 LLM 사전 학습 완전 가이드입니다.
2026-03-17 · 22 분 읽기 #llm-pretraining#scaling-laws#chinchilla#flash-attention#mixtralmoe오픈소스 LLM 완전 정리: Llama 3, Mistral, DeepSeek, Qwen, Gemma 총정리
2024-2026년 오픈소스 LLM 생태계를 완전히 정리하는 가이드. Meta Llama 3, Mistral/Mixtral, DeepSeek V3/R1, Alibaba Qwen, Google Gemma, Microsoft Phi 시리즈를 아키텍처부터 성능, 라이선스, 활용 방법까지 상세히 비교합니다.
2026-03-17 · 21 분 읽기 #llm#llama#mistral#deepseek#qwenMixture of Experts(MoE) 아키텍처 논문 심층 분석: GShard에서 DeepSeek-MoE까지
Mixture of Experts 아키텍처의 핵심 논문을 분석하고, GShard, Switch Transformer, Mixtral, DeepSeek-MoE의 라우팅 전략과 학습 안정성 기법을 비교합니다.
2026-03-14 · 34 분 읽기 #ai-papers#moe#transformer#deepseekMixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer부터 Mixtral·DeepSeek까지
Mixture of Experts(MoE) 아키텍처를 심층 분석합니다. Sparse MoE의 수학적 기초부터 Switch Transformer, Mixtral 8x7B, DeepSeek-V3의 라우팅 전략, 학습 안정성 기법, 추론 최적화까지 논문 기반으로 상세히 다룹니다.
2026-03-10 · 23 분 읽기 #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE) 아키텍처 심층 분석: 설계 원리부터 DeepSeek-V3·Qwen3까지
Sparse MoE 아키텍처의 수학적 원리, 라우팅 전략, 로드 밸런싱 기법을 분석하고, Switch Transformer에서 DeepSeek-V3·Qwen3-235B까지 최신 MoE 모델의 설계 선택과 실전 학습·추론 최적화를 다룬다.
2026-03-06 · 35 분 읽기 #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE) 아키텍처 완벽 분석
Sparse MoE의 원리부터 Mixtral, DeepSeek-V3의 MoE 구현, routing 전략, load balancing까지 MoE 아키텍처를 완벽 분석합니다.
2026-03-03 · 7 분 읽기 #ai-papers#moe#mixtral#deepseek#2026-03