태그: #mamba
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
파운데이션 모델 아키텍처 2026 — Transformer 이후 / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 심층 가이드
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochr
2026-05-16 · 34 분 읽기 #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaLLM 랜드마크 논문 2026 완벽 가이드 - Transformer · Scaling Laws · Flash Attention · Mamba · DeepSeek-R1 · Titans 심층 분석
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 ·
2026-05-16 · 34 분 읽기 #llm-papers#transformer#scaling-laws#flash-attention#mambaMamba와 상태 공간 모델(SSM) 완전 정복: Transformer를 넘어서
Mamba와 상태 공간 모델(SSM)을 완전히 이해하는 가이드. Transformer의 이차 복잡도 문제를 해결한 S4, H3, Mamba 1/2 아키텍처를 수식과 코드로 깊이 분석하고, MambaFormer와 Jamba 같은 하이브리드 모델까지 다룹니다.
2026-03-17 · 31 분 읽기 #mamba#state-space-model#ssm#deep-learning#sequence-modelingMamba와 State Space Model 논문 심층 분석: 선택적 SSM부터 Mamba-2까지 Transformer 대안 아키텍처
Mamba 논문의 선택적 State Space Model 메커니즘, S4에서 Mamba-2로의 발전 과정, Transformer 대비 선형 시간 복잡도의 장단점, 그리고 비전·오디오·시계열 분야 적용 사례까지 다루는 SSM 아키텍처 종합 분석.
2026-03-07 · 44 분 읽기 #ai-papers#mamba#state-space-model#ssm#transformerMamba 논문 리뷰: Selective State Space Models로 Transformer를 넘어서
Mamba(Selective State Space Models) 논문을 심층 리뷰한다. S4에서 Mamba까지의 발전 과정, Selective Scan 메커니즘, Hardware-Aware 알고리즘, 그리고 Mamba-2의 State Space Duality까지 코드와 함께 분석.
2026-03-02 · 11 분 읽기 #mamba#state-space-model#ssm#transformer#linear-attentionMamba: Linear-Time Sequence Modeling with Selective State Spaces 논문 분석
Transformer의 대안으로 주목받는 Mamba 아키텍처를 깊이 분석합니다. Selective State Space Model의 핵심 아이디어, 하드웨어 최적화 알고리즘, 실험 결과까지 논문의 주요 내용을 코드와 함께 살펴봅니다.
2026-03-02 · 11 분 읽기 #ai-papers#mamba#ssm#state-space-model#transformer