标签: #long-context
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
RAG · 微调 · 长上下文 — 我的问题该用哪个:论文实际测量了什么,以及没有人测量过什么
这是 LLM 架构领域被问得最多的问题,但大多数答案是没有任何出处的决策树。本文只用测量过的东西来回答。微调无法注入新知识,这一点已被多篇论文反复测量(Ovadia 等、Gekhman 等);看起来正相反的农业案例研究,实际测的是另一种干预(无监督持续预训练 vs 有监督 Q&A 微调),因此并不冲突。长上下文在位置、长度、词汇三条轴上各自崩塌(lost-in-the-middle、Databricks 对 20 个模型的测量、NoLi
2026-07-17 · 34 分钟阅读 #rag#llm#fine-tuning#long-context#ai上下文工程取代了提示词工程吗 — 哪些被测量过,哪些没有
「提示词工程已死」这句话,在创造这个术语的任何一手来源里都不存在。Karpathy 把 few-shot 示例和任务描述列为上下文工程的组成部分,Anthropic 则写道这是「提示词工程的自然演进(natural progression)」。也就是说,不是替代,而是包含。尽管如此,「这确实是一件不同的工作」是有证据的 — Chroma 的 LongMemEval 实验把问题和措辞原样保留,只把周围上下文从 300 token 增加到
2026-07-17 · 30 分钟阅读 #llm#context-engineering#prompt-engineering#long-context#ai-agent把预训练检查点变成长上下文混合模型 — HyLo 的升级改造配方
混合序列模型(注意力 + 线性·SSM 块)在长上下文上更有优势,但迄今为止大多需要从头重新预训练。2026 年 4 月的预印本 HyLo 提出了一份配方:只用廉价的后处理训练,就把已经训练好的 Transformer 检查点"升级改造"成混合模型 — 混入 MLA(潜在注意力)和 Mamba2、Gated DeltaNet 这类线性块,再叠加分阶段的长上下文训练与教师蒸馏。作者报告称,在把上下文最多拉长到 32 倍的同时,KV 缓存内
2026-07-11 · 9 分钟阅读 #ai#llm#long-context#architecture#efficiencyGemini 2.5 开发者实战指南:如何选择 Pro、Flash 与 Flash-Lite
本文以 2025 年 3 月 25 日发布的 Gemini 2.5 为基准,从实务角度梳理 Pro、Flash、Flash-Lite 该如何选择、reasoning 模型如何改变工作流,以及团队实际应该部署什么。
2026-04-12 · 9 分钟阅读 #google#gemini#gemini-2-5#coding#agentic-coding1M 上下文窗口时代的 LLM 应用策略: 大规模上下文处理实战指南
2026 年 3 月 Anthropic 宣布 Claude Opus 4.6/Sonnet 4.6 的 1M token 上下文窗口正式 GA。本文综合讲解从原有 128K~200K 上限扩展到 1M 所带来的应用范式转变、五种实战应用模式、相对于 RAG 的权衡取舍,以及成本优化策略。
2026-03-15 · 37 分钟阅读 #ai-platform#llm#context-window#long-context#claudeRing Attention 论文解析:在分布式环境中实现无限上下文窗口训练
解析 Ring Attention 论文,探讨在分布式环境中克服上下文长度限制的方法。涵盖与 Blockwise Parallel Transformer 的关联、实现细节、性能基准,以及生产环境应用时需要考虑的问题。
2026-03-08 · 46 分钟阅读 #ai-papers#ring-attention#distributed-training#long-context#transformer