博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
NVIDIA Triton Inference Server 生产指南:GPU 模型服务优化策略
基于 NVIDIA Triton Inference Server 的 GPU 模型服务优化指南。涵盖 Dynamic Batching、Model Ensemble、TensorRT 集成、多模型服务、Kubernetes 部署、性能画像分析与生产环境故障排查。
2026-03-08 · 38 分钟阅读 #ai-platform#triton#inference-server#gpu#model-serving开源实时对话式语音聊天机器人构建指南:Barge-In(应答中断)支持架构与实现
仅用开源工具实现实时语音聊天机器人的综合指南。涵盖用 Silero VAD、faster-whisper、Ollama、Piper TTS 组合而成的流水线中实现 barge-in(用户发话时立即中断应答)功能的状态机设计、Python 示例代码、延迟优化,直至韩语质量改善技巧。
2026-03-08 · 32 分钟阅读 #ai-platform#voice-chatbot#barge-in#realtime-audio#sttWeights & Biases(W&B)实验管理实战指南:从实验追踪到 Model Registry 与生产环境监控
基于 Weights & Biases(W&B)的 ML 实验管理实战指南。涵盖实验追踪、Sweeps 超参数调优、Artifacts 版本管理、Model Registry、团队协作功能,并结合与 MLflow 的对比,通过代码示例逐一讲解。
2026-03-08 · 27 分钟阅读 #ai-platform#wandb#experiment-tracking#model-registry#mlopsRing Attention 论文解析:在分布式环境中实现无限上下文窗口训练
解析 Ring Attention 论文,探讨在分布式环境中克服上下文长度限制的方法。涵盖与 Blockwise Parallel Transformer 的关联、实现细节、性能基准,以及生产环境应用时需要考虑的问题。
2026-03-08 · 46 分钟阅读 #ai-papers#ring-attention#distributed-training#long-context#transformer值得向 NotebookLM 提问的主题:研究playbook(2026-03 更新)
把迄今为止推荐过的 NotebookLM 研究主题一次性整理成的指南。收录了可扩展到技术、历史、产业、国际局势、生活素养等领域的提问框架。
2026-03-07 · 9 分钟阅读 #notebooklm#research#ai#study#prompt-ideasForward Deployed Engineer 职业指南:AI 时代成长最快的问题解决型工程师岗位
基于最新招聘公告和行业案例,梳理 Forward Deployed Engineer(FDE)的实际角色、与普通软件工程师/解决方案架构师的区别、所需能力、职业成长路径,以及 90 天准备路线图。
2026-03-07 · 12 分钟阅读 #ai-platform#forward-deployed-engineer#career#llm#enterprise-aiMamba 与 State Space Model 论文深度解析:从选择性 SSM 到 Mamba-2 的 Transformer 替代架构
涵盖 Mamba 论文的选择性 State Space Model 机制、从 S4 到 Mamba-2 的发展过程、相对于 Transformer 的线性时间复杂度的优缺点,以及视觉、音频、时间序列领域应用案例的 SSM 架构综合分析。
2026-03-07 · 38 分钟阅读 #ai-papers#mamba#state-space-model#ssm#transformer分语言调试实战指南:在 Python · JavaScript/TypeScript · Go · Java 中从断点、运行到性能剖析
以 Python、JavaScript/TypeScript(Node.js)、Go、Java 为基准,一次性梳理调试的运行方式、断点策略,以及各语言代表性的剖析工具(py-spy、cProfile、--inspect、pprof、JFR/async-profiler)。
2026-03-07 · 17 分钟阅读 #devops#debugging#python#javascript#typescript各框架调试实战:Spring Boot · Django/FastAPI · React/Next.js 中的断点、运行与性能分析
以后端(Spring Boot、Django、FastAPI)和前端(React、Next.js)中真正高频出现的故障为线索,梳理断点位置、运行与复现方法,以及 APM 和性能分析的观测点。
2026-03-07 · 19 分钟阅读 #devops#debugging#spring#django#fastapiFeast Feature Store 实战运维指南:从特征工程到实时服务与训练-服务偏差防治
一份涵盖 Feast Feature Store 架构、离线/在线存储设计、特征定义与实体管理、实时服务流水线搭建、训练-服务偏差(Training-Serving Skew)防治策略,以及生产环境运维故障排查的综合指南。
2026-03-07 · 32 分钟阅读 #ai-platform#feast#feature-store#feature-engineering#mlopsKubeflow Pipelines v2 ML 工作流自动化与运维指南
从 KFP v2 架构,到用 KFP SDK 构建 ML 流水线、缓存、制品管理、CI/CD 集成,再到生产环境运维排障。
2026-03-06 · 19 分钟阅读 #ai-platform#kubeflow#ml-pipeline#mlops#2026-03ML 模型监控与漂移检测:Evidently AI + MLflow 生产运维指南
一份综合指南,涵盖用 Evidently AI 与 MLflow 构建 ML 模型生产监控流水线、数据/概念漂移检测、自动再训练触发,直至运维故障排查。
2026-03-06 · 33 分钟阅读 #ai-platform#model-monitoring#drift-detection#evidently-ai#mlflowSparse Mixture of Experts(MoE)架构深度解析:从设计原理到 DeepSeek-V3、Qwen3
分析 Sparse MoE 架构的数学原理、路由策略与负载均衡技术,涵盖从 Switch Transformer 到 DeepSeek-V3、Qwen3-235B 等最新 MoE 模型的设计选择,以及训练与推理的实战优化策略。
2026-03-06 · 30 分钟阅读 #ai-papers#moe#sparse-model#deepseek#2026-03BitNet 论文解析:1-Bit LLM 的时代 — 从三值权重到 CPU 推理
Microsoft Research 的 BitNet 系列(v1、b1.58、a4.8、2B4T)论文解析,从三值权重训练原理到 bitnet.cpp 推理框架、实战基准测试的综合指南。
2026-03-06 · 33 分钟阅读 #ai-papers#bitnet#1-bit-llm#quantization#model-efficiency从 DPO 到 KTO:人类反馈对齐技术最新论文综述与实战实现
综述克服 RLHF 局限的 DPO、IPO、KTO 等最新人类反馈对齐技术论文,并提供基于 TRL 的实战实现指南。涵盖算法对比、超参数调优,直至失败案例。
2026-03-05 · 31 分钟阅读 #ai-papers#dpo#kto#alignment#2026-03MLflow 2.x 实验追踪与模型注册表运维指南
从 MLflow 2.x 的实验追踪设计到模型注册表运维、Artifact 管理、CI/CD 集成、多租户、生产部署的实战指南。
2026-03-05 · 22 分钟阅读 #ai-platform#mlflow#model-registry#2026-03PostgreSQL 17 性能实验室:查询、索引与运维调优
以 PostgreSQL 17 性能实验室:查询、索引与运维调优为中心,把 Why/How/When、对比表、故障排查、实战代码与测验一次性整理完毕的实务型文档。
2026-03-04 · 17 分钟阅读 #database#practical-guide#productionAI Platform Feature Store 同步设计
AI Platform Feature Store 同步设计 - 以 2026 年为基准的实务应用指南
2026-03-04 · 14 分钟阅读 #ai-platform#feature-store#2026-03AI 平台技术栈设计:Kubeflow、MLflow、KServe 集成运维
本文围绕 AI 平台技术栈设计:Kubeflow、MLflow、KServe 集成运维展开,一次性整理了 Why/How/When、对比表、故障排查、实战代码和测验的实务型文档。
2026-03-04 · 13 分钟阅读 #ai-platform#practical-guide#productionAI 平台:Feature Store 与 RAGOps 蓝图 2026
AI 平台:以 Feature Store 与 RAGOps 蓝图 2026 为主题,包含 Why、How、When、对比表、故障排查、代码示例与测验的实战指南。
2026-03-04 · 18 分钟阅读 #ai-platform#2026-03