태그: #rag
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 63 편
문서 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 심층 가이드
2026년의 문서 AI는 더 이상 "Tesseract로 텍스트 뽑기"가 아니다. Mistral OCR(2025.3) 같은 전용 API, Marker / Surya / Docling / OlmoOCR 같은 오픈소스 PDF-to-Markdown 엔진, LayoutLMv3·Donut 같은 사전학습 문서 모델, Pixtral 12B·Florence-2 같은 멀티모달 LLM이 모두 같은 문제(스캔된
2026-05-15 · 35 분 읽기 #ocr#document-ai#pdf#mistral-ocr#marker벡터 DB 지형 2026 — Pinecone Serverless·Turbopuffer·pgvectorscale·Qdrant·Weaviate·Vespa 한 장에 정리하는 딥다이브
2024년에 쓴 '벡터 DB 비교' 글은 이미 낡았다. Pinecone Serverless의 가격 붕괴, Turbopuffer가 S3 위에 띄운 2.5조 벡터, pgvectorscale의 StreamingDiskANN, Qdrant의 RocksDB 제거, Weaviate의 ColBERT 멀티벡터, Milvus 2.6의 GPU 인덱스, Vespa가 Spotify에서 돌리는 실시간 하이브리드,
2026-05-14 · 29 분 읽기 #vector-database#pinecone#turbopuffer#pgvector#qdrantPostgreSQL이 다시 1위가 된 이유 심화 가이드 — pgvector, HNSW, JSONB, MVCC, Supabase, Neon, TimescaleDB, AI 시대의 DB 전략 (2025)
1996년 Ingres 계보에서 파생된 PostgreSQL이 2024년 StackOverflow 개발자 설문 1위에 올랐다. pgvector가 Pinecone을 위협하고, JSONB가 MongoDB를 위협하고, Supabase/Neon이 Firebase를 위협한다. "하나의 DB로 모든 것"이라는 오래된 꿈이 현실이 된 배경 — MVCC의 우아함, Write-Ahead Logging, 확장
2026-04-15 · 25 분 읽기 #postgresql#pgvector#hnsw#jsonb#mvccRAG 실전 완전 가이드: 검색, 임베딩, 벡터 DB, Fine-tuning의 경계 (2025)
LLM에 외부 지식을 붙이는 가장 실용적인 패턴, RAG. 2025년 시점에서 임베딩 모델 선택, 청킹 전략, 벡터 DB 선택, Rerank, Hybrid Search, 그리고 Fine-tuning과의 경계까지. Notion AI와 Claude의 검색 아키텍처를 해부하고, 한국어 RAG의 특수성과 비용·지연시간 최적화 체크리스트를 한 호흡에 정리합니다.
2026-04-15 · 33 분 읽기 #rag#llm#ai#vector-db#embeddingLLM 완전 가이드 — Transformer·Attention·RLHF·RAG·Agent·Evaluation (Season 2 Ep 6, 2025)
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의
2026-04-15 · 19 분 읽기 #llm#transformer#attention#rlhf#dpoANN 알고리즘 완전 가이드 2025: HNSW, IVF, Product Quantization, LSH — 벡터 DB의 내부는 어떻게 작동하는가
Pinecone, Weaviate, Qdrant, pgvector가 수억 벡터에서 밀리초 만에 유사 항목을 찾는 비결. HNSW, IVF, Product Quantization, LSH 등 ANN 알고리즘의 수학과 구현을 720줄로 깊이 있게 파헤친다.
2026-04-15 · 40 분 읽기 #ann#hnsw#ivf#product-quantization#lshAI 엔지니어링 실전 — LLM API, RAG, 에이전트, LoRA/DPO, 벡터 DB, 평가, 관측, Prompt Injection 완전 가이드 (2025)
LLM API 프로덕션 호출의 진짜 어려움, RAG가 단순 조회가 아닌 이유, 에이전트 패턴(ReAct/Plan-Execute/ReWOO), 파인튜닝 언제/언제 하지 말까(LoRA/QLoRA/DPO), 벡터 DB 선택 매트릭스, LLM 평가의 근본적 어려움, 비용 최적화, Prompt Injection 방어까지. 데모가 아닌 '진짜 프로덕션' AI 앱을 만드는 법.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#ai-agent#loraElasticsearch와 OpenSearch, Lucene의 내부 — Inverted Index, BM25, Sharding, Vector Search, Hybrid RAG까지 (2025)
검색은 왜 어렵나? Lucene의 Segment와 Merge, Inverted Index의 수학, BM25가 TF-IDF를 어떻게 이겼나, primary/replica shard와 routing, Ingest 파이프라인, Query DSL의 미로, kNN과 HNSW, 2021년 Elastic vs AWS 라이선스 전쟁과 OpenSearch 포크, Hybrid Search로 완성되는 RAG 시
2026-04-15 · 20 분 읽기 #elasticsearch#opensearch#lucene#search#vector-searchAI Engineering 프로덕션 실전 완전 가이드 — RAG·Evals·Fine-tuning·LLMOps·Guardrails·Prompt Caching·비용 최적화까지 2025-2026년 현장 노하우
LLM을 프로토타입에서 프로덕션으로 가져가는 여정은 Jupyter 노트북의 데모와 다르다. RAG 파이프라인 설계, eval harness 구축, fine-tuning 결정 트리, LLMOps 관측 가능성, Guardrails와 안전성, Prompt Caching과 비용 최적화까지 2025-2026년 AI 엔지니어의 현장 가이드를 500줄로 정리한다.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#evaluation#fine-tuningAdvanced RAG 파이프라인 완전 가이드 2025: 청킹 전략, 리랭킹, 에이전틱 RAG, 평가
Advanced RAG의 모든 것! 문서 청킹 전략(Semantic/Recursive/Agentic), 리랭킹(Cohere/ColBERT/Cross-encoder), Query Transformation, 에이전틱 RAG(Self-RAG/CRAG), Multi-modal RAG, 평가(RAGAS/TruLens), 프로덕션 최적화.
2026-04-13 · 36 분 읽기 #rag#chunking#reranking#agentic-rag#evaluationLlamaIndex Workflows 실전 가이드: 이벤트 기반 에이전트와 RAG를 프로덕션으로 옮기는 법
LlamaIndex Workflows를 이벤트 기반 설계, observability, human-in-the-loop, LlamaDeploy 관점에서 정리한 실전 가이드입니다. 언제 쓰고 어떻게 운영에 올릴지까지 함께 다룹니다.
2026-04-12 · 11 분 읽기 #llamaindex#workflows#agent-workflow#rag#observabilityMastra 실전 가이드: 2026년 TypeScript 팀이 프로덕션 AI 에이전트에 채택하는 이유
오픈소스 TypeScript 스택 안에서 에이전트, 메모리, 워크플로, 관측 가능성, 평가, 프로덕션 배포를 함께 다뤄야 하는 팀을 위한 Mastra 실전 가이드입니다.
2026-04-12 · 12 분 읽기 #mastra#typescript#ai-agent#mcp#memoryVector Database 엔지니어 커리어 가이드: Pinecone·Weaviate·Milvus·pgvector 완전 비교와 RAG 시대의 필수 역량
RAG 시대의 핵심 인프라 Vector Database를 완전 분석합니다. Pinecone, Weaviate, Milvus, Qdrant, pgvector, Chroma 6대 벡터 DB 아키텍처/성능/비용 비교, 임베딩 모델 선택, ANN 알고리즘(HNSW/IVF), 하이브리드 검색, 프로덕션 운영 가이드.
2026-03-23 · 55 분 읽기 #vector-database#pinecone#weaviate#milvus#qdrantOpenAI AI Deployment Engineer (Seoul) 합격 가이드: GPT 엔터프라이즈 배포 전문가가 되는 완벽 로드맵
OpenAI Seoul의 AI Deployment Engineer JD를 완전 분석합니다. Fortune 500 기업에 GPT를 배포하는 역할 — Python, K8s, RAG, LangGraph, 에이전틱 워크플로우, 모델 파인튜닝까지 기술스택 딥다이브 + 면접 3단계 공략법 + 8개월 학습 로드맵. TC $350K-$550K.
2026-03-23 · 45 분 읽기 #openai#ai-deployment-engineer#python#kubernetes#ragDatabricks AI Engineer (FDE) 합격 가이드: Spark, Unity Catalog, RAG부터 고객 배포까지
Databricks AI Engineer (FDE) JD를 완전 분석합니다. Spark/Delta Lake/Unity Catalog 기술 스택, Lakehouse 아키텍처, RAG 파이프라인 구축, 고객 현장 배포 역량까지 — 면접 예상 질문 25선과 8개월 학습 로드맵.
2026-03-23 · 59 분 읽기 #databricks#fde#spark#delta-lake#unity-catalogRAGAS 완전 가이드: RAG 시스템을 어떻게 정량적으로 평가하는가
RAGAS의 4가지 핵심 지표(Faithfulness, Answer Relevancy, Context Precision, Context Recall)를 이해하고, 실제 Python 코드로 RAG 시스템을 평가하는 방법을 설명합니다. 자동 평가 파이프라인 구축과 테스트셋 생성까지 실전 중심으로 다룹니다.
2026-03-18 · 15 분 읽기 #ragas#RAG평가#LLM평가#ai-development#품질관리LLM 환각(Hallucination) 완전 해부: 왜 AI는 거짓말을 하고, 어떻게 막는가
LLM이 왜 사실이 아닌 것을 자신있게 말하는지 기술적 원인을 분석하고, RAG, 자기비판, Chain of Verification 등 5가지 실전 해결 전략을 코드와 함께 설명합니다.
2026-03-18 · 15 분 읽기 #환각#hallucination#llm#AI신뢰성#ai-developmentContext Window 100만 토큰 시대: RAG는 사라지는가?
Gemini 1.5 Pro의 100만 토큰, Claude의 20만 토큰 컨텍스트 윈도우가 등장하면서 "RAG가 필요 없어지는 것 아니냐"는 질문이 많아졌습니다. 실제 비용, 속도, 품질을 비교해서 솔직하게 답합니다.
2026-03-18 · 12 분 읽기 #context-window#rag#llm#long-context#ai-developmentGraphRAG 완전 가이드: 지식 그래프가 RAG의 한계를 어떻게 넘는가
일반 RAG가 답하지 못하는 "이 문서들의 주요 패턴은?"같은 전역 질문. Microsoft Research의 GraphRAG가 어떻게 이 문제를 해결하는지, 실제 코드와 비용까지 솔직하게 설명합니다.
2026-03-18 · 13 분 읽기 #graphrag#knowledge-graph#rag#microsoft#ai-developmentRAG 청킹 전략 완전 가이드: 나이브 분할부터 RAPTOR까지
RAG 시스템 품질의 70%를 결정하는 청킹 전략을 5가지 방법론과 실제 코드로 완전 정리합니다. Fixed-size부터 Semantic, Parent-Child, RAPTOR까지 — 각각 언제 쓰는지, 실전 평가 방법까지 다룹니다.
2026-03-18 · 14 분 읽기 #rag#청킹#텍스트분할#langchain#raptor