태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
모방 기계는 발견할 수 없는가 — Rich Sutton의 도발과 RL의 반격
강화학습의 대부 Rich Sutton이 지도학습 기반 생성 AI는 모방 모델이라 새로운 과학적 발견에 한계가 있다고 주장하며 2026년 6월 커뮤니티를 달궜습니다. Bitter Lesson의 맥락에서 그의 주장을 해부하고, 모방 학습과 강화학습의 본질적 차이, 반론, 그리고 에이전트 설계에 주는 실무적 교훈을 정리합니다.
2026-06-12 · 44 분 읽기 #ai#reinforcement-learning#llm#research#ai-agentLLM 논문 큐레이션 2024-2026 - Llama · DeepSeek · Qwen · Mistral · Phi · RLHF · DPO · CoT · RAG · FlashAttention · vLLM 심층 가이드
LLM을 만들고 운영하는 엔지니어를 위한 2024-2026 필독 논문 30+편 큐레이션. 파운데이션 모델(Llama 3/4, DeepSeek-V3/R1, Qwen3, Mistral, Phi-4, Gemma 3), 학습 혁신(MoE, MLA, GQA), 포스트-트레이닝(RLHF, DPO, ORPO, KTO), 추론(CoT, ToT, GRPO), 에이전트(ReAct, SWE-Agent), 검색(
2026-05-16 · 28 분 읽기 #llm#papers#llama#deepseek#qwenLLM 파인튜닝 프레임워크 2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 심층 가이드
2026년 LLM 파인튜닝 생태계를 한 번에 정리한다. Axolotl·Unsloth·LLaMA-Factory·TRL·PEFT·TorchTune 같은 오픈소스 프레임워크부터 LLM Foundry(MosaicML, Databricks 인수), Modal·Together·OpenAI·Anthropic·Cohere의 클라우드 파인튜닝 API까지. QLoRA·FSDP·DeepSpeed Zero 같은
2026-05-16 · 44 분 읽기 #llm#finetuning#axolotl#unsloth#llama-factoryAI 에이전트 프레임워크 2026 완벽 가이드 - LangGraph · AutoGen · CrewAI · Semantic Kernel · OpenAI Agents SDK · Claude Agent SDK · Pydantic AI 심층 분석
2026년 5월 기준, 프로덕션 AI 에이전트 시장을 주도하는 10개 프레임워크의 아키텍처, API, 멀티 에이전트 패턴, 관측성, 채택 시그널을 비교한다. LangGraph 0.3, AutoGen 0.4, CrewAI Flows, Semantic Kernel Agent Framework, OpenAI Agents SDK, Claude Agent SDK, Pydantic AI, Smol Ag
2026-05-16 · 27 분 읽기 #ai-agent#langgraph#autogen#crewai#semantic-kernelLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cppSlack 봇으로 AI 팀원 만들기 — Claude·Gemini·OpenClaw 연동 + MCP로 도구 확장 (2026 핸즈온)
AI를 가장 레버리지 높게 배포하는 표면은 IDE가 아니라 Slack이다 — 팀 전체가, 일이 일어나는 곳에서 쓴다. 이 글은 따라 하는 핸즈온이다. Slack 앱을 만들고, Bolt SDK로 멘션에 응답하는 최소 봇을 띄우고, Claude·Gemini·OpenClaw 게이트웨이를 연동하고, 스레드 컨텍스트를 다루고, MCP로 봇에 GitHub·Jira·DB 같은 도구를 쥐여주고, 스트리밍
2026-05-14 · 23 분 읽기 #slack-bot#llm#claude#gemini#openclaw추론 모델(reasoning models) 2026 가이드 — o3·o4·DeepSeek R1·Claude Thinking·Gemini Deep Think·QwQ 심층 비교
o1이 2024년 9월에 test-time compute라는 새로운 축을 열고 1년 반이 지났다. 2026년 현재 '추론 모델(reasoning model)'은 별도의 모델군이 아니라, 모든 프론티어 모델의 한 상태(mode)가 됐다. OpenAI o3·o3-pro·o4, DeepSeek R1·R1-0528·V3.1 reasoner, Anthropic Claude Sonnet 4.5·Opus
2026-05-14 · 32 분 읽기 #reasoning-models#o3#o4#deepseek-r1#claude-thinkingLLM 랜드마크 논문 가이드 — Attention부터 GPT·LLaMA·DeepSeek·o1·Claude까지 (참고문헌 포함, 2026)
LLM 분야의 진짜 변화는 어떤 논문에서 시작됐는가. 2017년 Attention is All You Need부터 2026년의 추론 모델까지, 반드시 알아야 할 랜드마크 논문 20여 편을 시기·주제별로 정리한다. 각 논문은 '왜 중요한가·한 줄 요약·후속 영향'으로 압축하고, arXiv·블로그 링크를 끝에 모았다. 시간 부족한 엔지니어를 위한 LLM 논문 지도.
2026-05-14 · 22 분 읽기 #llm#research-papers#transformer#gpt#llamaAI 하네스 해부 — 모델을 에이전트로 만드는 스캐폴딩 (루프·도구·컨텍스트, 그리고 직접 만들기)
모델은 엔진이고, 하네스는 차다. 같은 엔진에 다른 차를 얹으면 주행 경험이 완전히 달라진다. 2026년 AI 엔지니어링의 진짜 무게중심은 모델이 아니라 그 모델을 둘러싼 스캐폴딩 — 하네스 — 에 있다. 에이전트 루프의 해부, 도구 실행 계층, 컨텍스트 관리와 context rot, System Prompt의 역할, 제어 흐름(서브에이전트·훅·권한 게이트), 실패 모드와 복원, 실제 하네스
2026-05-14 · 26 분 읽기 #ai-harness#ai-agent#llm#agent-loop#tool-execution2026년 기술 지형 완전 예측 — LLM Next Wave·Agents·Physical AI·BCI·양자·AR·CRISPR·에너지·거버넌스까지 엔지니어가 알아야 할 모든 것
2025년은 Agent 원년이자 Physical AI 태동의 해였다. 2026년 이후 기술 지형을 LLM Next Wave, Agents 주류화, 로봇·Physical AI, BCI, 양자 컴퓨팅, AR 2.0, CRISPR·합성생물학, Space Compute, 에너지 전환, AI 거버넌스까지 — 엔지니어가 지금 준비해야 할 5가지 역량과 함께 완전 해부한다.
2026-04-15 · 31 분 읽기 #tech-trend#llm#ai-agent#robotics#bciTransformer 아키텍처 완전 가이드 2025: Self-Attention, Positional Encoding, Multi-Head, GPT vs BERT — ChatGPT 뒤의 수학
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
2026-04-15 · 29 분 읽기 #transformer#attention#self-attention#gpt#bertMCP (Model Context Protocol) 완전 해부: 스펙, 전송, 보안, 서버 만들기, 엔터프라이즈 (2025)
Anthropic이 2024년 말 공개하고 2025년에 사실상 표준이 된 MCP. Resources·Tools·Prompts·Sampling 스펙과 전송 계층, OAuth 2.1 인증, 주요 서버(GitHub/Slack/Linear/Chrome/Playwright), 직접 서버 만들기, 보안 공격 벡터, 엔터프라이즈 운영까지. "LLM 시대의 USB-C"를 한 글로 해부합니다.
2026-04-15 · 21 분 읽기 #mcp#llm#ai#claude#protocolRAG 실전 완전 가이드: 검색, 임베딩, 벡터 DB, Fine-tuning의 경계 (2025)
LLM에 외부 지식을 붙이는 가장 실용적인 패턴, RAG. 2025년 시점에서 임베딩 모델 선택, 청킹 전략, 벡터 DB 선택, Rerank, Hybrid Search, 그리고 Fine-tuning과의 경계까지. Notion AI와 Claude의 검색 아키텍처를 해부하고, 한국어 RAG의 특수성과 비용·지연시간 최적화 체크리스트를 한 호흡에 정리합니다.
2026-04-15 · 33 분 읽기 #rag#llm#ai#vector-db#embedding프롬프트 엔지니어링의 과학: CoT, Self-consistency, DSPy, 구조화 출력, 자동 최적화까지 (2025)
2023년엔 "주문"이었고, 2024년엔 "기술"이었고, 2025년엔 "과학"이 된 프롬프트 엔지니어링. Chain-of-Thought, Self-consistency, Tree-of-Thoughts, DSPy 자동 최적화, Structured Output, 프롬프트 버저닝, 모델 간 이관까지. 실전 운영 관점에서 한 글로 정리합니다.
2026-04-15 · 25 분 읽기 #prompt-engineering#llm#ai#dspy#cotFlashAttention & Efficient Attention Deep Dive — Tiling, Online Softmax, PagedAttention, GQA 완전 정복 (2025)
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HB
2026-04-15 · 32 분 읽기 #flashattention#attention#llm#transformer#gpuLLM 완전 가이드 — Transformer·Attention·RLHF·RAG·Agent·Evaluation (Season 2 Ep 6, 2025)
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의
2026-04-15 · 19 분 읽기 #llm#transformer#attention#rlhf#dpoFine-tuning 완전 가이드: SFT, DPO, LoRA/QLoRA, 합성 데이터, 한국어 모델 (2025)
"Fine-tuning은 죽었다"는 소리도, "RAG로 다 된다"는 소리도 반쯤만 맞다. 2025년 시점에서 SFT/DPO/RLHF의 지형, LoRA·QLoRA로 가볍게 튜닝하는 실전, 합성 데이터 파이프라인, 한국어 모델(Solar, Qwen, Llama) 파인튜닝, 그리고 Fine-tune vs RAG vs Prompt의 경계선을 한 글로 정리합니다.
2026-04-15 · 23 분 읽기 #fine-tuning#llm#ai#lora#qloraANN 알고리즘 완전 가이드 2025: HNSW, IVF, Product Quantization, LSH — 벡터 DB의 내부는 어떻게 작동하는가
Pinecone, Weaviate, Qdrant, pgvector가 수억 벡터에서 밀리초 만에 유사 항목을 찾는 비결. HNSW, IVF, Product Quantization, LSH 등 ANN 알고리즘의 수학과 구현을 720줄로 깊이 있게 파헤친다.
2026-04-15 · 40 분 읽기 #ann#hnsw#ivf#product-quantization#lshAI 엔지니어링 실전 — LLM API, RAG, 에이전트, LoRA/DPO, 벡터 DB, 평가, 관측, Prompt Injection 완전 가이드 (2025)
LLM API 프로덕션 호출의 진짜 어려움, RAG가 단순 조회가 아닌 이유, 에이전트 패턴(ReAct/Plan-Execute/ReWOO), 파인튜닝 언제/언제 하지 말까(LoRA/QLoRA/DPO), 벡터 DB 선택 매트릭스, LLM 평가의 근본적 어려움, 비용 최적화, Prompt Injection 방어까지. 데모가 아닌 '진짜 프로덕션' AI 앱을 만드는 법.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#ai-agent#loraAI Engineering 프로덕션 실전 완전 가이드 — RAG·Evals·Fine-tuning·LLMOps·Guardrails·Prompt Caching·비용 최적화까지 2025-2026년 현장 노하우
LLM을 프로토타입에서 프로덕션으로 가져가는 여정은 Jupyter 노트북의 데모와 다르다. RAG 파이프라인 설계, eval harness 구축, fine-tuning 결정 트리, LLMOps 관측 가능성, Guardrails와 안전성, Prompt Caching과 비용 최적화까지 2025-2026년 AI 엔지니어의 현장 가이드를 500줄로 정리한다.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#evaluation#fine-tuning