태그: #rwkv
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
파운데이션 모델 아키텍처 2026 — Transformer 이후 / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 심층 가이드
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochr
2026-05-16 · 34 분 읽기 #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaRWKV: Reinventing RNNs for the Transformer Era — v4에서 v7 Goose까지
Transformer의 O(N²) 한계를 극복하는 RWKV 아키텍처를 분석합니다. Linear Attention과 RNN의 융합, 선택적 상태 공간 메커니즘, v7 Goose의 혁신까지 코드와 함께 살펴봅니다.
2026-03-03 · 13 분 읽기 #ai-papers#rwkv#rnn#linear-attention#state-space-modelRWKV-7 "Goose" 아키텍처 분석 — Transformer를 넘어서는 선형 시간 모델
RWKV-7 Goose의 Dynamic State Evolution 메커니즘, TC0 한계 돌파, Transformer 대비 성능 비교를 논문 기반으로 분석합니다. 상수 메모리 + 선형 시간 추론이 가능한 차세대 아키텍처입니다.
2026-03-03 · 10 분 읽기 #ai-papers#rwkv#linear-attention#sequence-modeling#2026-03