博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
容器与 Docker 内部完全攻略 — Namespace、cgroups、OverlayFS、seccomp、Capabilities 直到 Kubernetes(2025)
“容器不是轻量级 VM。”在 docker run 这一行命令的背后,运行着 7 种 Linux namespace、cgroups v2、OverlayFS 层、seccomp 过滤器和 Linux capabilities。从 2008 年的 LXC 到 2013 年 Docker 登场、2015 年 OCI 标准化,再到 2024 年现代运行时的演进 — 容器如何在没有 VM 的情况下做出隔离,为什么 Docker 比 VM 快
2026-04-15 · 19 分钟阅读 #docker#container#namespace#cgroups#overlayfsVoice AI 实战完全指南:实时 STT/TTS、语音 LLM、Turn-taking、深度伪造防御(2025)
“没有屏幕的 AI”为什么会成为 2025 年最火的产品类别。实时语音流水线(VAD/STT/LLM/TTS)、语音 LLM(GPT-4o realtime/Gemini Live/Moshi)、Turn-taking 与打断、情感与语调控制、电话・浏览器・移动端的实战、深度伪造防御与安全,以及韩语语音产品的特殊性。
2026-04-15 · 16 分钟阅读 #voice-ai#stt#tts#gpt-4o-realtime#moshiObservability 2025 完全指南:OpenTelemetry、Grafana / Datadog / Honeycomb / SigNoz、SLO 与 Error Budget、LLM 可观测性(2025)
Season 5 Ep 8。没有可观测性就没有运维,没有运维就没有产品。OpenTelemetry 三大信号(Metric、Log、Trace)的统一,Grafana 技术栈(Prometheus、Loki、Tempo、Mimir)与 Datadog、New Relic、Splunk 的比较,SigNoz、Honeycomb、Axiom 这一新世代,SLO、SLI、Error Budget 的运营,LLM 可观测性(LangFuse、L
2026-04-15 · 15 分钟阅读 #observability#opentelemetry#grafana#datadog#honeycombLLMOps 完全指南:模型 · 提示词 · 评测集三轴版本管理、Canary、成本控制、平台团队 (2025)
把 LLM 产品做出来的方法已经变简单了,难的是让它可持续地跑下去。模型 · 提示词 · 评测集的三轴版本管理,Shadow/Canary/Blue-Green 发布,用 token、缓存与模型路由做成本控制,组织结构(AI 平台/Model 平台/Product AI),失败案例,直到 KPI 与 on-call。它是 MLOps 的延长线,同时正面处理 LLM 特有的课题。
2026-04-15 · 15 分钟阅读 #llmops#mlops#devops#canary#cost-controlFeature Store 与 Vector·Graph·时序 DB 融合指南: Feast·Tecton·Pinecone·Weaviate·Milvus·Neo4j·TimescaleDB (2025)
Season 5 Ep 6。ML 的语言是特征,AI 的语言是向量,关系的语言是图,运维的语言是时序。2025 年,每个 DB 品类都在越过自己的边界,向 Lakehouse 与 Postgres 收敛。Feature Store 的重新定义、Online-Offline skew、Vector DB 的地形、Graph DB 与知识图谱、时序 DB 的现状、“Unified DB”的登场、AI 给 DB 地形带来的冲击,以及韩国企业的
2026-04-15 · 15 分钟阅读 #feature-store#vector-db#graph-db#timeseries-db#feast工程师的哲学完全指南: 认识论、伦理学、自由意志、斯多葛、佛教、波普尔、实用主义、技术伦理 (2025~2026)
为工程师一生都要面对的“为什么、对不对、真不真”这三类问题准备的系统性哲学指南。认识论的基本(从柏拉图到波普尔)、伦理学的三大传统(功利主义、义务论、德性伦理学)、自由意志与决定论、斯多葛派的实战应用、佛教与无常给软件带来的东西、实用主义(杜威、詹姆斯)、波普尔的可证伪性与开放社会、AI 伦理与算法偏见 — 一份让工程师在技术之外拥有真正世界观的完整手册。
2026-04-15 · 18 分钟阅读 #philosophy#epistemology#ethics#free-will#stoic数据治理・Lineage・PII 完全指南:OpenLineage、Collibra・Atlan・DataHub、Unity・Polaris、GDPR 与韩国个人信息保护法(2025)
Season 5 Ep 7。数据越多,“谁在用、在哪里用、为什么用、用了多少”就越不清楚。涵盖 OpenLineage 标准、四大数据目录(Collibra・Atlan・DataHub・Alation)、Unity Catalog・Polaris・Glue 的治理能力、PII 的识别与脱敏与令牌化、GDPR 与韩国个人信息保护法下的数据主体权利、多云治理、AI 时代的治理扩展,以及韩国企业的现实情况。
2026-04-15 · 17 分钟阅读 #data-governance#lineage#pii#openlineage#collibraGit 精通指南 — 从基础到 rebase、cherry-pick、bisect、worktree
从 Git 的内部结构,到高级命令(rebase、cherry-pick、bisect、worktree)、分支策略、PR 评审、Monorepo 管理 — Git 的一切。
2026-04-12 · 20 分钟阅读 #devops#git#version-control#github#branchingDocker & Kubernetes 入门完全指南 — 从容器到编排
Docker 的原理、Dockerfile 写法、Kubernetes 的核心概念(Pod/Service/Deployment)、Helm 以及实战部署,容器的一切都在这里。
2026-04-12 · 19 分钟阅读 #devops#docker#kubernetes#container#orchestrationPydanticAI 实战指南:2026 年 Python 团队为什么在生产级智能体中采用它
面向需要 Python 优先的智能体系统、模型可移植性、持久化工作流、可观测性与评估体系的团队的 PydanticAI 实战指南。
2026-04-12 · 10 分钟阅读 #pydantic#pydantic-ai#python#ai-agent#mcpGoogle Agent Development Kit 实践指南:ADK 为何适合企业级智能体
面向评估 Google Agent Development Kit 的团队的实践指南,围绕上下文管理、callbacks、多智能体组合与上线判断标准展开。
2026-04-12 · 9 分钟阅读 #google-adk#agent-development-kit#ai-agent#multi-agent#session-stateMastra 实战指南:2026 年 TypeScript 团队为什么在生产 AI 智能体中采用它
面向需要在一套开源 TypeScript 技术栈中同时处理智能体、记忆、工作流、可观测性、评估与生产部署的团队,这是一份 Mastra 实战指南。
2026-04-12 · 10 分钟阅读 #mastra#typescript#ai-agent#mcp#memory浏览器·计算机使用代理实战指南:2026 年团队可以立即落地的架构、防护机制与检查清单
直接操作浏览器和虚拟计算机的代理为什么在此刻变得重要、应该按什么架构来设计、自动化到哪一步该停下来 —— 本文按实务标准做了梳理。
2026-04-12 · 15 分钟阅读 #ai-platform#ai-agent#browser-agent#computer-use#automationCursor 实战指南:把 Background Agent、Memories、Bugbot、worktree 变成团队习惯的方法
Cursor 实战指南 — 围绕 Background Agent、Memories、Bugbot、worktree,把 Cursor 真正落地到日常开发中。涵盖引入判断、团队规则、rollout 策略。
2026-04-12 · 7 分钟阅读 #cursor#background-agent#bugbot#memories#worktreeLlamaIndex Workflows 实战指南:把事件驱动 agent 与 RAG 带到生产环境的方法
LlamaIndex Workflows 实战指南 —— 从事件驱动设计、observability、human-in-the-loop、LlamaDeploy 的角度进行整理,同时涵盖该在什么时候使用、以及如何落地到生产环境。
2026-04-12 · 9 分钟阅读 #llamaindex#workflows#agent-workflow#rag#observabilityOpenAI、Azure、AWS 企业级 Agent 可观测性与评估比较指南
对比 OpenAI、Azure、AWS 在 Agent 可观测性、评估、仪表盘、OpenTelemetry 集成上的差异,并为平台、产品、基础设施团队整理了一份做出上线决策的实务指南。
2026-04-12 · 5 分钟阅读 #openai#azure#aws#observability#evaluation用 Cloudflare Agents 与 Durable Objects 构建 AI 应用的实战指南
一篇 2026 年的实战指南,讲清楚 Cloudflare Agents 与 Durable Objects 如何应用在 AI 产品上、为什么状态与长时间运行的任务如此重要、它与 stateless serverless 有何不同,以及一份可直接落地的上线检查清单。
2026-04-12 · 13 分钟阅读 #cloudflare#cloudflare-agents#durable-objects#ai-agent#mcp托管智能体平台对比指南:OpenAI AgentKit vs Azure AI Foundry Agent Service vs Amazon Bedrock AgentCore
基于官方文档,对截至 2026-04-12 的三个托管智能体平台进行实用对比,涵盖产品适配、治理、工具链、部署与上线检查清单。
2026-04-12 · 7 分钟阅读 #ai-platform#managed-agents#agent-platform#comparison#openaiCloudflare AI Gateway 实战指南: 观测和控制 AI 流量最快的方法
以 2026 年 4 月为基准,从实务角度梳理为什么要用 Cloudflare AI Gateway、能做哪些控制、以及应该如何搭配使用 Dynamic Routing 与自动重试。
2026-04-12 · 9 分钟阅读 #ai-platform#cloudflare#ai-gateway#observability#cachingOpenAI Responses API 与 Agents SDK 实战指南:2026 年团队重新规划架构的方法
以 2025 年 3 月 11 日发布的 OpenAI Responses API 与 Agents SDK 为基准,从实务角度梳理哪些团队应该继续使用 Chat Completions、哪些团队应该转向 Responses API,以及 Assistants API 用户该在何时准备好哪些工作。
2026-04-12 · 17 分钟阅读 #openai#responses-api#agents-sdk#ai-agent#chat-completions