태그: #retrieval
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
연습의 구조: 잘되는 연습과 남는 연습이 다른 이유
간격 두기, 인출 연습, 섞어서 연습하기. 학습 연구에서 근거가 비교적 튼튼한 세 가지를 효과 크기와 함께 정리했습니다. 그리고 이 분야의 핵심 역설을 다룹니다. 연습 도중의 수행을 가장 좋게 만드는 조건과 나중까지 남는 것을 가장 많게 만드는 조건이 서로 다르다는 것. 스스로 하는 연습이 기분은 좋은데 잘 늘지 않는 이유가 여기에 있습니다.
2026-08-16 · 24 분 읽기 #mindset#learning#practice#retrieval#spacing분류하지 말고 지어내라는 기법과 그 검증 — 가짜 레이블이 원본 질의보다 나은 이유
수백 개짜리 분류 체계를 프롬프트에 넣는 대신, 작은 모델에게 그럴듯한 가짜 분류를 지어내게 하고 그것을 임베딩으로 실제 분류에 붙이는 기법이 논의됐습니다. 왜 이것이 동작할 수 있는지는 임베딩 공간의 비대칭성으로 설명됩니다. 다만 원문에는 측정 결과가 없고, 댓글에는 이 기법이 정말 원본 질의를 직접 임베딩하는 것보다 나은지 묻는 정확한 반론과 더 싼 대안이 함께 나왔습니다. 무엇을 어떻게
2026-08-14 · 13 분 읽기 #llm#embedding#classification#search#retrieval100배 싸다는 주장은 과제를 좁혔을 때만 참입니다 — 검증과 손익분기
2026년 8월에 공개된 한 사례 글은 40억 파라미터급 오픈 모델을 강화학습으로 후학습해 검색 과제에서 프론티어 모델과 맞먹으면서 요청당 비용은 자릿수 단위로 낮췄다고 밝힙니다. 이 글은 그 주장을 소개하는 대신 검증합니다. 원문에서 실제로 확인되는 숫자와 확인되지 않는 숫자를 구분하고, 좁은 과제에서만 성립하는 조건이 무엇인지 정리하며, 후학습이 라우팅보다 유리해지는 손익분기를 직접 계산
2026-08-09 · 14 분 읽기 #llm#cost#fine-tuning#retrieval#open-modelsRAG가 엉뚱한 답을 할 때 — 검색 실패와 생성 실패를 가르는 디버깅 절차
RAG가 틀린 답을 내면 대부분 프롬프트부터 고치는데, 실제 원인의 다수는 검색 단계에 있습니다. 정답 청크를 손으로 넣어 보는 한 번의 실험으로 검색 실패와 생성 실패를 가르는 절차부터 시작해, 청킹이 왜 가장 흔한 범인인지, 임베딩 유사도가 의미 유사도와 갈라지는 지점과 BM25 혼합이 자주 이기는 이유, 재순위화가 값을 하는 조건, 청크에 문서 제목과 메타데이터를 붙였을 때의 효과를 정
2026-07-26 · 22 분 읽기 #llm#rag#retrieval#chunking#evaluation프로덕션 RAG 패턴 — 순진한 RAG가 실패하는 이유와 실제로 통하는 기법들
데모용 RAG는 30분이면 만들지만, 프로덕션에서 조용히 무너지는 지점은 대부분 생성이 아니라 검색입니다. 청킹, 임베딩과 하이브리드 검색(BM25 + 벡터), 리랭킹, 컨텍스추얼 리트리벌, 쿼리 재작성, 그리고 평가를 각각 무엇이고·언제 도움이 되며·무엇을 대가로 치르는지 정리합니다. Anthropic의 컨텍스추얼 리트리벌 수치처럼 출처 있는 숫자만 인용하고, RAG가 마법이 아니라는 점과
2026-07-11 · 18 분 읽기 #ai#rag#llm#retrieval#embeddingsSOTA 텍스트 임베딩 모델 분석 — 검색과 RAG의 심장
텍스트 임베딩은 검색과 RAG 시스템의 심장입니다. 대조학습과 InfoNCE, 이중 인코더, 하드 네거티브, E5/BGE/GTE 계열, Matryoshka 표현학습, MTEB 벤치마크까지 최신 임베딩 모델의 원리와 실무 적용을 정리합니다.
2026-06-30 · 35 분 읽기 #ai-papers#embedding#retrieval#rag#contrastive-learningRAG 파이프라인 프로덕션 구축 가이드: 벡터 DB 선택부터 청킹·리랭킹·평가까지
RAG(Retrieval-Augmented Generation) 파이프라인의 프로덕션 구축을 체계적으로 다룹니다. 임베딩 모델 비교, 벡터 DB 선택(Pinecone·Milvus·Weaviate·Qdrant·Chroma), 청킹 전략, 하이브리드 검색, 리랭킹, RAGAS 평가 메트릭, 장애 대응까지 실전 운영 노하우를 제공합니다.
2026-03-11 · 25 분 읽기 #llm#rag#vector-database#retrieval#embedding