태그: #rag
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 63 편
지금 주목받는 오픈소스 (1) AI 에이전트와 LLM 도구
LLM 애플리케이션 스택은 추론 서버, 오케스트레이션, 게이트웨이, 에이전트, RAG로 층이 갈라졌습니다. 각 층에서 실제로 쓰이는 오픈소스 12개를 스타 순위가 아니라 역할별로 묶어 소개합니다. 프로젝트마다 무엇을 대체하는지, 성숙도가 어느 정도인지, 어떤 상황에서 쓰면 안 되는지를 함께 정리했고, 저장소 경로와 라이선스, 스타 수, 최근 푸시 날짜는 2026년 8월 12일 GitHub에서
2026-08-12 · 10 분 읽기 #open-source#llm#ai-agent#ai-platform#rag국내 개발 블로그 명글 큐레이션 3 — AI와 ML 실무, 직접 열어 확인한 14편
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기,
2026-08-12 · 23 분 읽기 #curation#큐레이션#ai#llm#rag임베딩과 리랭커, RAG에서 실제로 중요한 것
RAG를 만들 때 임베딩 모델 선택을 좌우하는 것은 리더보드 순위가 아니라 차원, 최대 입력 길이, 접두어 규약, 다국어 표기, 그리고 리랭커와의 역할 분담입니다. 이 글은 2026-08-12에 확인한 임베딩·리랭커 모델들의 실제 카드 값을 정리하고, MTEB 점수가 무엇을 말해 주지 않는지, 한국어 문서를 다룰 때 무엇을 직접 재야 하는지를 설명합니다. 오픈 모델 가이드 시리즈 3편입니다.
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#embedding사내 지식베이스를 LLM으로 만든다는 것 — 권한 인지 검색, 신선도, 그리고 출시 전 평가셋
Cerebras가 2026년 7월 15일에 공개한 사내 지식베이스 구축기는 하루 15,000건 넘는 질의를 사람과 자동화와 에이전트가 함께 던지는 시스템의 내부 구조를 드러냅니다. 하지만 사내 지식베이스에서 팀이 실제로 과소평가하는 부분은 청킹이나 리랭킹이 아니라 권한, 신선도, 삭제 전파, 그리고 진실 공급원 충돌입니다. HR 문서를 흘리는 검색은 없는 것만 못하고, 이미 폐기한 런북을 자
2026-07-31 · 26 분 읽기 #ai#rag#enterprise-search#llm#platform-engineeringLLM API 비용 최적화 — 출력 토큰, 프롬프트 캐싱, 라우팅의 손익분기 계산
LLM API 청구서를 절반으로 줄이는 작업은 감이 아니라 산수입니다. 출력 토큰 단가가 입력의 몇 배라는 구조 때문에 가장 큰 레버는 거의 항상 출력 길이 통제이고, 그다음이 프롬프트 캐싱입니다. 캐싱이 접두사만 잡는다는 제약이 프롬프트 배치 순서를 어떻게 강제하는지, RAG와 전체 컨텍스트의 손익분기가 어디인지, 모델 라우팅의 절감률 공식과 그에 따르는 정확도 손실을 어떻게 같은 단위로
2026-07-26 · 20 분 읽기 #llm#cost-optimization#prompt-caching#rag#model-routingRAG가 엉뚱한 답을 할 때 — 검색 실패와 생성 실패를 가르는 디버깅 절차
RAG가 틀린 답을 내면 대부분 프롬프트부터 고치는데, 실제 원인의 다수는 검색 단계에 있습니다. 정답 청크를 손으로 넣어 보는 한 번의 실험으로 검색 실패와 생성 실패를 가르는 절차부터 시작해, 청킹이 왜 가장 흔한 범인인지, 임베딩 유사도가 의미 유사도와 갈라지는 지점과 BM25 혼합이 자주 이기는 이유, 재순위화가 값을 하는 조건, 청크에 문서 제목과 메타데이터를 붙였을 때의 효과를 정
2026-07-26 · 22 분 읽기 #llm#rag#retrieval#chunking#evaluationRAG · 파인튜닝 · 롱컨텍스트 — 내 문제엔 뭘 써야 하나: 논문이 실제로 잰 것, 그리고 아무도 재지 않은 것
LLM 아키텍처에서 가장 많이 나오는 질문이지만, 대부분의 답은 출처 없는 의사결정 트리입니다. 이 글은 측정된 것만 가지고 답합니다. 파인튜닝은 새 지식을 넣는 데 실패한다는 것이 여러 논문에서 반복 측정됐고(Ovadia 등, Gekhman 등), 정반대로 보이는 농업 사례 연구는 사실 다른 개입(비지도 계속사전학습 vs 지도 Q&A 튜닝)을 잰 것이라 충돌이 아닙니다. 롱컨텍스트는 위치·
2026-07-17 · 43 분 읽기 #rag#llm#fine-tuning#long-context#aiGraph RAG란 무엇인가 — 벡터 RAG가 막히는 곳, 그리고 이게 값을 하는 순간
RAG의 표준 레시피(청크 → 임베딩 → 상위 k개 검색)는 답이 한 조각에 들어 있을 때 잘 작동하지만, 멀티홉 질문과 코퍼스 전체를 관통하는 글로벌 센스메이킹 질문에서는 구조적으로 막힙니다. Microsoft의 GraphRAG는 이 두 사각지대를 겨냥해, LLM으로 코퍼스에서 지식 그래프를 뽑고 Leiden 알고리즘으로 커뮤니티를 찾아 요약을 미리 만들어 둡니다. 그런 다음 글로벌 질문은
2026-07-15 · 16 분 읽기 #rag#graph-rag#knowledge-graph#ai#llm프로덕션 RAG 패턴 — 순진한 RAG가 실패하는 이유와 실제로 통하는 기법들
데모용 RAG는 30분이면 만들지만, 프로덕션에서 조용히 무너지는 지점은 대부분 생성이 아니라 검색입니다. 청킹, 임베딩과 하이브리드 검색(BM25 + 벡터), 리랭킹, 컨텍스추얼 리트리벌, 쿼리 재작성, 그리고 평가를 각각 무엇이고·언제 도움이 되며·무엇을 대가로 치르는지 정리합니다. Anthropic의 컨텍스추얼 리트리벌 수치처럼 출처 있는 숫자만 인용하고, RAG가 마법이 아니라는 점과
2026-07-11 · 18 분 읽기 #ai#rag#llm#retrieval#embeddingsAI Engineer 되는 방법 완벽 가이드 2026 — LLM, RAG, 에이전트, Evals, 커리어 로드맵
AI Engineer가 되기 위한 2026년 완벽 가이드. ML Engineer와의 차이부터 LLM API, 프롬프트 엔지니어링, RAG 설계, 에이전트 구축, LoRA 파인튜닝, vLLM 서빙, Evals 중심 개발, 프레임워크·벡터 DB 선택, 비용 최적화, 포트폴리오 5종, 한국·일본·글로벌 채용 시장과 인터뷰 대비까지 한 번에 정리합니다.
2026-07-02 · 49 분 읽기 #ai-engineer#career#llm#rag#ai-agentsSOTA 텍스트 임베딩 모델 분석 — 검색과 RAG의 심장
텍스트 임베딩은 검색과 RAG 시스템의 심장입니다. 대조학습과 InfoNCE, 이중 인코더, 하드 네거티브, E5/BGE/GTE 계열, Matryoshka 표현학습, MTEB 벤치마크까지 최신 임베딩 모델의 원리와 실무 적용을 정리합니다.
2026-06-30 · 35 분 읽기 #ai-papers#embedding#retrieval#rag#contrastive-learning컨텍스트 엔지니어링 — AI 에이전트에게 기억을 설계해주는 법
프롬프트 엔지니어링의 시대가 저물고 컨텍스트 엔지니어링이 핵심 역량으로 떠올랐습니다. 컨텍스트 윈도우의 경제학, 메모리 계층 설계, 대화에서 사실을 자동 추출해 사용자 프로필을 구축하는 패턴, RAG와 메모리의 구분, compaction 전략, 평가 방법과 함정까지 실무 관점에서 정리합니다.
2026-06-12 · 31 분 읽기 #ai#context-engineering#llm#ai-agent#memoryAI의 말은 누구의 말인가 — 독일 법원의 Google AI Overviews 책임 판결
2026년 6월 독일 법원이 Google AI Overviews를 검색 결과의 나열이 아닌 Google 자신의 발화로 분류하고, 허위 답변에 대한 직접 책임을 인정했습니다. 판결 논리를 해부하고, 기존 플랫폼 면책 법리와의 충돌, AI 답변 엔진을 만드는 개발자와 기업이 지금 점검해야 할 것들을 정리합니다.
2026-06-12 · 41 분 읽기 #ai#law#liability#rag#governance벡터 데이터베이스 2026 완벽 가이드 - Pinecone · Weaviate · Qdrant · Milvus · pgvector · LanceDB · Chroma · FAISS · DiskANN 심층 분석
2026년 5월 기준 RAG와 시맨틱 검색을 지탱하는 벡터 DB 생태계를 끝까지 본다. Pinecone Serverless v3, Weaviate, Qdrant(Rust), Milvus 2.5 + Zilliz, Chroma, LanceDB, pgvector + pgvectorscale + ParadeDB, Vespa, OpenSearch k-NN, Redis Vector, MongoDB At
2026-05-16 · 29 분 읽기 #vector-database#pinecone#weaviate#qdrant#milvusLLM 논문 큐레이션 2024-2026 - Llama · DeepSeek · Qwen · Mistral · Phi · RLHF · DPO · CoT · RAG · FlashAttention · vLLM 심층 가이드
LLM을 만들고 운영하는 엔지니어를 위한 2024-2026 필독 논문 30+편 큐레이션. 파운데이션 모델(Llama 3/4, DeepSeek-V3/R1, Qwen3, Mistral, Phi-4, Gemma 3), 학습 혁신(MoE, MLA, GQA), 포스트-트레이닝(RLHF, DPO, ORPO, KTO), 추론(CoT, ToT, GRPO), 에이전트(ReAct, SWE-Agent), 검색(
2026-05-16 · 28 분 읽기 #llm#papers#llama#deepseek#qwen그래프 DB & 지식 그래프 2026 완벽 가이드 — Neo4j 5 · ArangoDB · Memgraph · TigerGraph · Amazon Neptune · Apache AGE · Kuzu · FalkorDB · Dgraph · GraphRAG 심층 분석
2026년 5월 기준 그래프 데이터베이스와 지식 그래프 생태계를 한 번에 정리합니다. Neo4j 5, ArangoDB, Memgraph, TigerGraph, Amazon Neptune, Apache AGE, Kuzu, FalkorDB, Dgraph 같은 그래프 DB와 GraphDB·Stardog·Virtuoso·Apache Jena 같은 RDF 트리플 스토어, Cypher·GQL·Greml
2026-05-16 · 37 분 읽기 #graph-database#knowledge-graph#neo4j#arangodb#memgraph로컬 AI & 온디바이스 LLM 2026 완벽 가이드 — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 심층 분석
2026년, 로컬 AI는 더 이상 "취미"가 아니다. M4 Max MacBook Pro에서 Llama 4 Scout 109B MoE가 24토큰/초로 도는 시대다. Ollama, LM Studio, Jan, Msty 같은 데스크탑 런타임이 GUI/CLI를 통일하고, Open WebUI, AnythingLLM, LibreChat이 ChatGPT급 인터페이스를 제공한다. 백엔드는 llama.cpp
2026-05-16 · 36 분 읽기 #local-ai#on-device-llm#ollama#lm-studio#jan벡터 데이터베이스 2026 완벽 가이드 - Pinecone · Weaviate · Milvus · Qdrant · Chroma · LanceDB · pgvector · Vespa · Turbopuffer 심층 분석
2026년 벡터 데이터베이스 시장은 캄브리아기 폭발 그 자체다. Pinecone serverless, Weaviate 1.27, Milvus 2.5, Qdrant 1.13, Chroma 0.5, LanceDB 0.20, pgvector 0.8, Vespa, Turbopuffer까지 — 10개 이상의 진영이 각자의 의견을 들고 시장에 들어왔다. HNSW와 DiskANN, IVF·PQ·SQ 같은
2026-05-16 · 46 분 읽기 #vector-database#pinecone#weaviate#milvus#qdrant노코드 AI 빌더 2026 완벽 가이드 - Flowise · Langflow · Dify · Coze · n8n AI · Rivet · Vectara · Promptflow · LlamaIndex 심층 분석
2026년 5월 기준 노코드/로우코드 AI 빌더 생태계를 한 글에 정리합니다. Flowise · Langflow · Dify · Coze 같은 그래프형 LLM 빌더부터 Microsoft Promptflow · Vectara · LlamaIndex · Stack AI · Voiceflow · Botpress · Vellum · Humanloop, 그리고 LangSmith · Langfuse ·
2026-05-16 · 59 분 읽기 #no-code-ai#flowise#langflow#dify#coze엔터프라이즈 AI 검색 & 지식 플랫폼 2026 완벽 가이드 - Glean·Guru·Coveo·Atlassian Rovo·Notion Atlas·Microsoft 365 Copilot·Slack AI 심층 분석
2026년 엔터프라이즈 AI 검색 시장 전체 지도. 사내 지식이 Slack·Confluence·Drive·Notion·Jira·Salesforce에 흩어진 시대에, RAG over corporate data가 어떻게 직원 생산성을 바꾸는가. Glean(2024년 $260M, $4.6B 밸류), Microsoft 365 Copilot(시트당 월 $30), Atlassian Rovo, Notio
2026-05-16 · 33 분 읽기 #enterprise-search#glean#guru#coveo#atlassian-rovo