博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
LLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decoding图神经网络(GNN)完全指南:从 GCN、GAT、GraphSAGE 到分子设计
图神经网络(GNN)从基础到前沿研究的完全指南。涵盖图论、GCN、GraphSAGE、GAT、Graph Transformer、分子设计、社交网络分析,并使用 PyTorch Geometric 完成实战实现。
2026-03-17 · 29 分钟阅读 #gnn#graph-neural-network#gcn#gat#pytorch-geometricHuggingFace 生态系统完全指南:精通 Transformers、Datasets、PEFT 与 Accelerate
全面掌握 HuggingFace 整个生态系统的指南。通过实战示例系统学习 Transformers、Datasets、Tokenizers、PEFT、Accelerate、Diffusers 以及 Hub API。
2026-03-17 · 22 分钟阅读 #huggingface#transformers#peft#accelerate#nlp生成式AI完全指南:精通 GAN、VAE 与扩散模型
彻底掌握生成式AI核心架构的指南。通过数学公式与 PyTorch 代码,完整理解 VAE(变分自编码器)、GAN(生成对抗网络)、DDPM(扩散模型)直至 Stable Diffusion。
2026-03-17 · 30 分钟阅读 #generative-ai#gan#vae#diffusion-model#stable-diffusion边缘 AI 与端侧 ML 完全指南:TFLite、ONNX、Core ML、llama.cpp
在边缘设备上运行 AI 模型的完全指南。通过 TensorFlow Lite、ONNX Runtime、Core ML、MediaPipe、llama.cpp、Whisper.cpp,实战学习在移动端和边缘环境中部署经过优化的 AI 的方法。
2026-03-17 · 32 分钟阅读 #edge-ai#on-device-ml#tflite#onnx#core-ml深度学习训练方法完全指南:从优化到分布式训练
一份系统讲解深度学习模型高效训练全部技巧的完整指南。通过实战代码学习梯度下降法、优化器、学习率调度、正则化、批归一化、迁移学习、微调,直至分布式训练。
2026-03-17 · 38 分钟阅读 #deep-learning#training#optimization#regularization#distributed-training深度学习调试完全指南:从训练失败诊断到性能优化
系统性诊断和解决深度学习模型训练失败的完全指南。涵盖 Loss NaN、梯度消失/爆炸、过拟合、收敛缓慢、显存不足等所有常见问题的原因与解决方案,并配有实战代码。
2026-03-17 · 30 分钟阅读 #deep-learning#debugging#pytorch#training#optimizationAI 系统设计完全指南:从 LLM 服务到 MLOps 架构
将 AI 系统设计到生产级水准的完全指南。通过实战架构学习实时推理系统、向量检索基础设施、LLM 服务架构、数据管道、监控系统设计。
2026-03-17 · 34 分钟阅读 #system-design#ai-infrastructure#llm#mlops#architectureAI 智能体完全指南 — 用 LangChain、LangGraph、CrewAI 构建自主 AI 系统
一份让你彻底掌握 AI 智能体系统的指南。从 ReAct、Tool Use、Function Calling 到 LangChain 智能体、LangGraph 工作流、CrewAI 多智能体协作,通过实战示例构建自主 AI 系统。
2026-03-17 · 34 分钟阅读 #ai-agent#langchain#langgraph#crewai#autonomous-ai1M 上下文窗口时代的 LLM 应用策略: 大规模上下文处理实战指南
2026 年 3 月 Anthropic 宣布 Claude Opus 4.6/Sonnet 4.6 的 1M token 上下文窗口正式 GA。本文综合讲解从原有 128K~200K 上限扩展到 1M 所带来的应用范式转变、五种实战应用模式、相对于 RAG 的权衡取舍,以及成本优化策略。
2026-03-15 · 37 分钟阅读 #ai-platform#llm#context-window#long-context#claudeVibe Coding 与 2026 AI 开发工具生态:生产力革命的光与影
分析 Andrej Karpathy 提出的 Vibe Coding 概念一年后的现实。涵盖 2026 年 AI 编程工具生态的现状、生产力数据、局限性,以及工程师应当准备的策略。
2026-03-14 · 24 分钟阅读 #vibe-coding#ai-tools#developer-productivity#ai-platform#trend-analysisAI 编码智能体沙箱化:安全代码执行隔离与安全运维指南
随着 2026 年 AI 编码智能体的自主性不断提高,安全隔离已成为必需。本文涵盖 macOS sandbox-exec、基于容器的隔离、MicroVM 等实战沙箱化技术与运维指南。
2026-03-14 · 20 分钟阅读 #ai-agent#sandboxing#security#ai-platform#devopsMixture of Experts (MoE) 架构论文深度解析:从 GShard 到 DeepSeek-MoE
分析 Mixture of Experts 架构的核心论文,比较 GShard、Switch Transformer、Mixtral、DeepSeek-MoE 的路由策略与训练稳定性技巧。
2026-03-14 · 28 分钟阅读 #ai-papers#moe#transformer#deepseekKubernetes Network Policy 与 Service Mesh 完全指南(Istio、Cilium、Calico 对比)
对比分析在 Kubernetes 环境中利用 Network Policy 实现微服务间流量控制的方法,以及 Istio、Cilium Service Mesh 的架构、实现与运维策略。
2026-03-14 · 23 分钟阅读 #kubernetes#network-policy#service-mesh#istio#ciliumStaff Engineer 的技术领导力与影响力扩展策略
Staff/Principal Engineer 的角色定义、技术决策(RFC/ADR)、影响力扩展、辅导(mentoring)、技术债务管理、工程文化建设等,面向资深以上工程师的职业成长策略。
2026-03-14 · 19 分钟阅读 #ai-platform#staff-engineer#technical-leadership#career-growth#engineering-cultureAI Agent 多智能体编排模式:层级式·流水线·蜂群架构实战指南
从单一智能体到多智能体协作 — 梳理层级式、流水线、蜂群模式的设计原则,以及 LangGraph、CrewAI、AutoGen 各框架的实现方法,并附实战代码。
2026-03-14 · 23 分钟阅读 #ai-platform#ai-agent#multi-agent#orchestration#workflowLLMOps 平台构建指南:模型部署、监控与 A/B 测试实战架构
本文讲解 LLMOps 平台的设计与实现。涵盖基于 vLLM/TGI 的模型服务、token 使用量/延迟/质量监控、提示词版本管理、A/B 测试框架、护栏(Guardrails)集成,用代码构建生产环境 LLM 运维的完整生命周期。
2026-03-13 · 20 分钟阅读 #ai-platform#llmops#model-serving#monitoring#ab-testing从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppoFeature Store 设计与运维指南:基于 Feast 构建 Online/Offline Store 与 ML 特征流水线自动化
从 Feature Store 的核心概念(Online/Offline Serving、Feature Freshness、Point-in-Time Correctness)出发,涵盖 Feast 架构、Feature 定义与 Entity 设计、Materialization 流水线、Online Store 后端(Redis、DynamoDB)、Offline Store(BigQuery、Redshift)、Training-
2026-03-12 · 16 分钟阅读 #ai-platform#feature-store#feast#mlops#online-storeKServe 模型服务完全指南:InferenceService、Canary 部署、Transformer、InferenceGraph 生产运维
本文讲解基于 Kubernetes、使用 KServe 进行模型服务的实践。涵盖用 InferenceService CRD 部署模型、用 Canary 策略实现安全上线、用 Transformer 搭建前后处理流水线、用 InferenceGraph 构建基于 DAG 的复合推理,并配合代码给出生产运维策略的落地实现。
2026-03-12 · 22 分钟阅读 #ai-platform#kserve#model-serving#kubernetes#inference-graph