标签: #fine-tuning
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-models用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-costRAG · 微调 · 长上下文 — 我的问题该用哪个:论文实际测量了什么,以及没有人测量过什么
这是 LLM 架构领域被问得最多的问题,但大多数答案是没有任何出处的决策树。本文只用测量过的东西来回答。微调无法注入新知识,这一点已被多篇论文反复测量(Ovadia 等、Gekhman 等);看起来正相反的农业案例研究,实际测的是另一种干预(无监督持续预训练 vs 有监督 Q&A 微调),因此并不冲突。长上下文在位置、长度、词汇三条轴上各自崩塌(lost-in-the-middle、Databricks 对 20 个模型的测量、NoLi
2026-07-17 · 34 分钟阅读 #rag#llm#fine-tuning#long-context#ai改变 LoRA 的 rank 就要跟着改学习率吗 — μA(2026) 划出的两种机制,以及这个测量结果的边界
LoRA 中改变 rank 就必须重新寻找最优学习率的说法,和「用 1/r 缩放,学习率就与 rank 无关」的说法,在实务中同时流传。2026 年 2 月挂上 arXiv 的 μA(Maximal-Update Adaptation) 论文说,这两种说法都对 — 只是取决于你用的是哪种 α 约定、哪种初始化。本文梳理 μA 推导出的两种机制(η 与 rank 的 -1/2 次方成正比的情形,vs 与 rank 无关的情形),以及论文主
2026-07-16 · 28 分钟阅读 #llm#lora#fine-tuning#peft#training开源 LLM 生态完全指南:2026 年的模型、工具与部署策略
全面梳理 2026 年开源 LLM 生态的实战指南。涵盖主要模型家族(Llama、Mistral、Gemma、Qwen、DeepSeek)、本地推理工具(Ollama、llama.cpp、vLLM)、微调技术(LoRA、QLoRA),以及运营自有 LLM 所需的实战部署策略。
2026-03-17 · 28 分钟阅读 #open-source#llm#llama#mistral#gemmaLoRA: 大规模语言模型的高效微调论文解析
对 LoRA(Low-Rank Adaptation)论文的核心原理进行数学分析,并系统整理基于 HuggingFace PEFT 库的实战应用方法。
2026-03-01 · 23 分钟阅读 #ai-papers#lora#fine-tuning#llm#peftBERT 论文完全解析:双向 Transformer 如何改变 NLP 格局
深入分析 Google 的 BERT 论文。通过公式与代码示例,梳理 Masked Language Model(MLM)与 Next Sentence Prediction(NSP)实现的双向预训练、微调策略,以及横扫 11 个 NLP 基准的架构核心原理。
2026-03-01 · 37 分钟阅读 #bert#nlp#transformer#pre-training#fine-tuning