标签: #rag
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 16 篇
用 LLM 搭建企业内部知识库这件事 —— 权限感知检索、新鲜度,以及上线前必须准备的评测集
Cerebras 在 2026 年 7 月 15 日公开的内部知识库搭建记录,揭示了一个日均处理超过 15,000 次查询、由人、自动化脚本和智能体共同调用的系统的内部结构。但企业内部知识库中团队真正容易低估的部分,并不是分块(chunking)或重排(reranking),而是权限、新鲜度、删除传播,以及真相来源(source of truth)的冲突。一个会泄露 HR 文档的搜索,还不如没有搜索;一个自信地引用已经作废的运维手册(r
2026-07-31 · 23 分钟阅读 #ai#rag#enterprise-search#llm#platform-engineeringRAG 答非所问时 — 区分检索失败与生成失败的调试流程
RAG 给出错误答案时,多数人先去改提示,但真实原因大多出在检索阶段。本文先给出一次实验就能把检索失败与生成失败切开的流程——把正确分块直接手动喂进去,然后讲清为什么分块是最常见的凶手、嵌入相似度与语义相似度分道扬镳的地方、混入 BM25 常常获胜的理由、重排序值回票价的条件,以及给分块加上文档标题和元数据后的效果。最后附上构建黄金集并测量 recall@k 与答案包含率的代码。
2026-07-26 · 18 分钟阅读 #llm#rag#retrieval#chunking#evaluationLLM API 成本优化 — 输出 token、prompt caching 与路由的盈亏平衡计算
把 LLM API 账单砍掉一半靠的是算术,不是感觉。由于输出 token 的单价是输入的数倍,最大的杠杆几乎总是控制输出长度,其次才是 prompt caching。本文整理了缓存只命中前缀这一约束如何强制决定提示的排列顺序、RAG 与全文塞入的盈亏平衡点在哪里、模型路由的节省公式以及随之而来的精度损失该如何用同一把尺子衡量,并给出模拟月度成本的代码,以及 token 估算与实际账单对不上的五个原因。
2026-07-26 · 17 分钟阅读 #llm#cost-optimization#prompt-caching#rag#model-routingRAG · 微调 · 长上下文 — 我的问题该用哪个:论文实际测量了什么,以及没有人测量过什么
这是 LLM 架构领域被问得最多的问题,但大多数答案是没有任何出处的决策树。本文只用测量过的东西来回答。微调无法注入新知识,这一点已被多篇论文反复测量(Ovadia 等、Gekhman 等);看起来正相反的农业案例研究,实际测的是另一种干预(无监督持续预训练 vs 有监督 Q&A 微调),因此并不冲突。长上下文在位置、长度、词汇三条轴上各自崩塌(lost-in-the-middle、Databricks 对 20 个模型的测量、NoLi
2026-07-17 · 34 分钟阅读 #rag#llm#fine-tuning#long-context#aiGraph RAG 是什么 — 向量 RAG 卡壳的地方,以及它值回成本的那一刻
RAG 的标准配方(分块 → 嵌入 → 检索前 k 个)在答案完整落在某一个片段里时很好用,但在多跳问题、以及贯穿整个语料库的全局「意义建构」问题上会结构性地卡住。Microsoft 的 GraphRAG 正是瞄准这两处盲区 — 用 LLM 从语料库里抽取知识图谱,用 Leiden 算法找出社区并预先生成摘要。此后,全局问题用社区摘要的映射-归约来回答,局部问题则用以实体为中心的图探索来回答。本文梳理了向量 RAG 卡住的地方、Grap
2026-07-15 · 14 分钟阅读 #rag#graph-rag#knowledge-graph#ai#llm生产级 RAG 模式 — 朴素 RAG 为何失败,以及真正管用的技法
演示版 RAG 半小时就能做出来,但在生产环境中悄然崩坏的地方,大多不是生成,而是检索。本文把分块、嵌入与混合检索(BM25 + 向量)、重排序、上下文检索、查询改写以及评估逐一梳理,讲清每一项各自是什么、何时有用、又要付出什么代价。只引用像 Anthropic 上下文检索数值那样有出处的数字,并坦率地指出 RAG 并非魔法、最终终究要用自己的数据来评估。
2026-07-11 · 15 分钟阅读 #ai#rag#llm#retrieval#embeddingsSOTA 文本嵌入模型解析 — 检索与 RAG 的心脏
文本嵌入是检索与 RAG 系统的心脏。本文梳理对比学习与 InfoNCE、双编码器、难负例、E5/BGE/GTE 系列、Matryoshka 表征学习、MTEB 基准,直至最新嵌入模型的原理与实务应用。
2026-06-30 · 29 分钟阅读 #ai-papers#embedding#retrieval#rag#contrastive-learningMastra 实战指南:2026 年 TypeScript 团队为什么在生产 AI 智能体中采用它
面向需要在一套开源 TypeScript 技术栈中同时处理智能体、记忆、工作流、可观测性、评估与生产部署的团队,这是一份 Mastra 实战指南。
2026-04-12 · 10 分钟阅读 #mastra#typescript#ai-agent#mcp#memoryLlamaIndex Workflows 实战指南:把事件驱动 agent 与 RAG 带到生产环境的方法
LlamaIndex Workflows 实战指南 —— 从事件驱动设计、observability、human-in-the-loop、LlamaDeploy 的角度进行整理,同时涵盖该在什么时候使用、以及如何落地到生产环境。
2026-04-12 · 9 分钟阅读 #llamaindex#workflows#agent-workflow#rag#observabilityRAG 系统完全指南:检索增强生成的一切
全面掌握 RAG(检索增强生成)系统的指南。从基础 RAG 到 Self-RAG、Corrective-RAG、HyDE 等高级架构,涵盖向量数据库、嵌入模型、分块策略、重排序,并配有可直接用于生产的代码示例。
2026-03-17 · 34 分钟阅读 #rag#llm#vector-database#langchain#embeddingNLP 与文本处理完全指南:从 BERT 微调到 RAG 系统、多语言处理
涵盖 BPE 分词、Word2Vec、BERT 微调、RAG 流水线、韩语形态素分析的 NLP 与文本处理完全指南。
2026-03-17 · 24 分钟阅读 #nlp#bert#임베딩#rag#korean-nlpLLM 应用开发指南:从原型到生产环境
从原型到生产环境构建基于 LLM 的应用的综合指南。涵盖提示词工程、RAG 架构、工具使用、流式传输、评估、成本优化,以及实战 AI 应用的部署模式。
2026-03-17 · 27 分钟阅读 #llm#application-development#langchain#openai#prompt-engineering数据库工程完全指南:从 SQL 到向量数据库、AI RAG 系统
从 SQL 高级技巧到 pgvector 向量检索、Pinecone、RAG 系统搭建 — 一份 AI 时代的数据库工程完全指南。
2026-03-17 · 26 分钟阅读 #database#postgresql#vector-database#pgvector#ragRAG 论文综述:Retrieval-Augmented Generation 的演进 — 从 RETRO 到 Self-RAG、Corrective-RAG
以论文为线索追溯 Retrieval-Augmented Generation(RAG)研究的演进。从早期 RAG(Lewis 等)出发,比较分析 RETRO 的大规模检索、Self-RAG 的自我反思、Corrective-RAG 的检索质量评估等核心架构与基准测试。
2026-03-12 · 28 分钟阅读 #ai-papers#rag#self-rag#corrective-rag#retroPostgreSQL + pgvector 向量检索实战指南:从 RAG 到混合检索
用 PostgreSQL pgvector 扩展实现向量相似度检索。从安装到 HNSW/IVFFlat 索引、混合检索(向量+全文检索)、RAG 流水线集成,附带实战代码。
2026-03-02 · 9 分钟阅读 #postgresql#pgvector#vector-search#embedding#ragRAG:Retrieval-Augmented Generation 论文解析与生产架构
解析 RAG 论文的核心概念,梳理 Chunking 策略、Vector DB 选型、Advanced RAG 模式等生产级 RAG 系统设计。
2026-03-01 · 31 分钟阅读 #ai-papers#rag#llm#vector-database#langchain