标签: #retrieval
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
练习的结构:做起来顺的练习和留得下来的练习为什么不一样
拉开间隔、提取练习、混合起来练。学习研究中依据相对结实的三件事,连同效应量一起梳理了出来。然后处理这个领域的核心悖论:让练习过程中的表现最好的条件,和让后来留下最多的条件,是互相不同的。自己安排的练习感觉良好却不太见长,原因就在这里。
2026-08-16 · 20 分钟阅读 #mindset#learning#practice#retrieval#spacing「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-modelsRAG 答非所问时 — 区分检索失败与生成失败的调试流程
RAG 给出错误答案时,多数人先去改提示,但真实原因大多出在检索阶段。本文先给出一次实验就能把检索失败与生成失败切开的流程——把正确分块直接手动喂进去,然后讲清为什么分块是最常见的凶手、嵌入相似度与语义相似度分道扬镳的地方、混入 BM25 常常获胜的理由、重排序值回票价的条件,以及给分块加上文档标题和元数据后的效果。最后附上构建黄金集并测量 recall@k 与答案包含率的代码。
2026-07-26 · 18 分钟阅读 #llm#rag#retrieval#chunking#evaluation生产级 RAG 模式 — 朴素 RAG 为何失败,以及真正管用的技法
演示版 RAG 半小时就能做出来,但在生产环境中悄然崩坏的地方,大多不是生成,而是检索。本文把分块、嵌入与混合检索(BM25 + 向量)、重排序、上下文检索、查询改写以及评估逐一梳理,讲清每一项各自是什么、何时有用、又要付出什么代价。只引用像 Anthropic 上下文检索数值那样有出处的数字,并坦率地指出 RAG 并非魔法、最终终究要用自己的数据来评估。
2026-07-11 · 15 分钟阅读 #ai#rag#llm#retrieval#embeddingsSOTA 文本嵌入模型解析 — 检索与 RAG 的心脏
文本嵌入是检索与 RAG 系统的心脏。本文梳理对比学习与 InfoNCE、双编码器、难负例、E5/BGE/GTE 系列、Matryoshka 表征学习、MTEB 基准,直至最新嵌入模型的原理与实务应用。
2026-06-30 · 29 分钟阅读 #ai-papers#embedding#retrieval#rag#contrastive-learning