标签: #llm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 90 篇
LLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationAI 模型开发,从头到尾 — 从数据到部署的现实生命周期
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#trainingOpenRouter 使用指南 — 用一个 API 调用 300+ 个 LLM
如何用 OpenRouter 一个入口,以兼容 OpenAI 的方式调用来自 60+ 家供应商的 300+ 个模型 — 从申请密钥、发出第一个 curl 请求,到 SDK 无缝替换、路由与回退、流式输出,按实务标准梳理一遍。
2026-07-06 · 11 分钟阅读 #openrouter#llm#ai-gateway#api#openai-compatibleLiteLLM 实战指南 — 用一个接口调用 100+ 个 LLM
一份实战速成指南:用同一套 OpenAI 格式调用 OpenAI、Anthropic、Gemini、Bedrock、OpenRouter 以及本地模型。从安装到流式输出、Router、Proxy Server,快速梳理一遍 LiteLLM。
2026-07-06 · 13 分钟阅读 #litellm#llm#ai-gateway#python#openai-compatible可观测性完全指南:日志、链路追踪与 LLM 监控
从日志、指标、链路追踪这三大支柱出发,梳理它们如何通过 traceid 相互关联,再对比 Loki 与 OpenSearch 的日志策略差异、以 OpenTelemetry 为中心的分布式链路追踪(Jaeger、Tempo),最后延伸到以 Langfuse 为代表的 LLM 可观测性。逐项对照实务中该如何搭建技术栈、又该如何取舍。
2026-07-03 · 22 分钟阅读 #observability#opentelemetry#tracing#logging#llmTorch-Titan 完全指南:PyTorch 大规模分布式训练全解析
一份掌握 PyTorch Titan(torchtitan)大规模 LLM 分布式训练的完全指南。涵盖 FSDP2、流水线并行、张量并行、4D 并行、Flash Attention 与混合精度,并配有实战示例。
2026-03-17 · 27 分钟阅读 #torch-titan#distributed-training#pytorch#fsdp#deep-learning深度学习推荐系统完全指南:从协同过滤到基于 LLM 的推荐
从推荐系统基础到最新深度学习技术的完全精通指南。通过实战代码,掌握协同过滤、Matrix Factorization、NCF、Two-Tower 模型、序列推荐、基于 GNN 的推荐,直至 LLM 推荐。
2026-03-17 · 30 分钟阅读 #recommendation-system#collaborative-filtering#deep-learning#two-tower#llmRAG 系统完全指南:检索增强生成的一切
全面掌握 RAG(检索增强生成)系统的指南。从基础 RAG 到 Self-RAG、Corrective-RAG、HyDE 等高级架构,涵盖向量数据库、嵌入模型、分块策略、重排序,并配有可直接用于生产的代码示例。
2026-03-17 · 34 分钟阅读 #rag#llm#vector-database#langchain#embedding提示词工程完全指南:CoT、DSPy、结构化输出与提示词安全
从 Zero-shot 到 Chain-of-Thought、Tree-of-Thought、DSPy 自动优化、Pydantic 结构化输出,直至提示词注入防御 —— 一份 2026 年提示词工程完全指南。
2026-03-17 · 39 分钟阅读 #prompt-engineering#chainofthought#dspy#llm#구조화출력开源 LLM 生态完全指南:2026 年的模型、工具与部署策略
全面梳理 2026 年开源 LLM 生态的实战指南。涵盖主要模型家族(Llama、Mistral、Gemma、Qwen、DeepSeek)、本地推理工具(Ollama、llama.cpp、vLLM)、微调技术(LoRA、QLoRA),以及运营自有 LLM 所需的实战部署策略。
2026-03-17 · 28 分钟阅读 #open-source#llm#llama#mistral#gemmaLLM、Tool Calling、Embedding 基准完全解析:每个基准到底衡量什么
MMLU、HellaSwag、HumanEval、BFCL、MTEB 等主要 AI 基准到底衡量什么、各项分数的含义与局限,以及在实际使用时该参考哪个基准,本文逐一完整解析。
2026-03-17 · 37 分钟阅读 #llm#benchmark#mmlu#mteb#bfclLLM 应用开发指南:从原型到生产环境
从原型到生产环境构建基于 LLM 的应用的综合指南。涵盖提示词工程、RAG 架构、工具使用、流式传输、评估、成本优化,以及实战 AI 应用的部署模式。
2026-03-17 · 27 分钟阅读 #llm#application-development#langchain#openai#prompt-engineering大规模模型训练完全指南:100B+ 参数 LLM 预训练策略
训练数百亿参数 LLM 的策略与技巧完全指南。从缩放定律(Chinchilla)、Megatron-LM、3D 并行化、检查点策略、训练稳定性到数据混合策略,全部结合实战讲解。
2026-03-17 · 27 分钟阅读 #large-scale-training#llm#megatron-lm#distributed-training#scaling-lawsDeepSpeed 完全指南:ZeRO 优化与大规模模型训练
全面掌握 Microsoft DeepSpeed 的实战指南。涵盖 ZeRO-1/2/3 优化、Offload、流水线并行、混合精度、MoE、DeepSpeed Inference,配有实战配置和代码示例。
2026-03-17 · 21 分钟阅读 #deepspeed#zero-optimization#distributed-training#llm#pytorchAI 伦理、安全性与对齐(Alignment)完全指南:负责任的 AI 开发
全面理解 AI 伦理、安全性与对齐(Alignment)的指南。涵盖幻觉(Hallucination)、偏见、隐私、RLHF、Constitutional AI,直至 AI 安全研究前沿——AI 开发者必须掌握的全部内容。
2026-03-17 · 34 分钟阅读 #ai-ethics#ai-safety#alignment#responsible-ai#llm深度学习模型量化完全指南:精通 INT8、INT4、GPTQ、AWQ、GGUF
一份让你彻底掌握深度学习模型量化的指南。通过实战示例,完整理解从 FP32 到 INT8、INT4 的量化原理,以及 GPTQ、AWQ、GGUF、bitsandbytes、AutoGPTQ、llama.cpp 的用法。
2026-03-17 · 35 分钟阅读 #quantization#model-compression#gptq#awq#ggufLLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decodingHuggingFace 生态系统完全指南:精通 Transformers、Datasets、PEFT 与 Accelerate
全面掌握 HuggingFace 整个生态系统的指南。通过实战示例系统学习 Transformers、Datasets、Tokenizers、PEFT、Accelerate、Diffusers 以及 Hub API。
2026-03-17 · 22 分钟阅读 #huggingface#transformers#peft#accelerate#nlpAI 系统设计完全指南:从 LLM 服务到 MLOps 架构
将 AI 系统设计到生产级水准的完全指南。通过实战架构学习实时推理系统、向量检索基础设施、LLM 服务架构、数据管道、监控系统设计。
2026-03-17 · 34 分钟阅读 #system-design#ai-infrastructure#llm#mlops#architecture