标签: #opentelemetry
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 8 篇
把观测数据放进 ClickHouse 意味着什么 — schema、rollup、TTL 与职责划分
当 trace 和日志每天膨胀到数 TB 规模,单靠一个搜索引擎或时序数据库就很难撑住了。本文从列式存储、压缩与排序键的角度,梳理 ClickHouse 为什么适合观测数据,并用真实的 DDL 设计 trace 表和日志表。文中讲清属性该用 Map 还是 JSON 类型的判断标准、如何用物化视图做 rollup、如何用分区和 TTL 控制成本。最后整理在已经用着 Prometheus 和 OpenSearch 的前提下,三者的职责该怎么
2026-08-02 · 22 分钟阅读 #observability#clickhouse#opentelemetry#data-modeling#cost给应用接上 OpenTelemetry —— 从自动埋点到手动 span,以及为什么要放一个 collector
埋点不是安装一个 SDK 那么简单,而是要遵守一个顺序。本文用自动埋点在一天内搭好骨架,先把 resource 属性定下来,再讲清只在 self time 大的区间加手动 span 这个顺序,全程用一个真实服务从头到尾地埋点做示范。文中还原并修复了上下文传播断裂的四个地方:线程池、消息队列、后台任务,以及会剥掉请求头的代理。最后整理出把 collector 放在应用和后端之间的五个理由,并盘点埋点反而把应用搞坏的那些失效模式。
2026-08-02 · 22 分钟阅读 #observability#opentelemetry#instrumentation#otel-collector#tracing分布式追踪真正回答的问题 — 跨度、采样,以及时间到底花在哪里
当「慢」的反馈不断进来、却不知道十个服务里谁是凶手时,你需要的就是追踪。本文从追踪、跨度与上下文传播的结构讲起,梳理出日志和指标在原理上回答不了的问题是什么。文中结合采集器配置,讲清自动埋点覆盖到哪里、哪些位置必须补上手动跨度、头部采样为什么会优先丢掉你最需要的追踪,以及尾部采样如何解决这一点、代价又是什么。接着讲跨消息队列传播上下文时为什么要用链接而不是父子关系,最后给出在真实追踪界面上到底该找什么的排查顺序。
2026-07-26 · 21 分钟阅读 #observability#distributed-tracing#opentelemetry#tail-sampling#performance结构化日志设计 — 做出故障时真正派得上用场的日志
如果你曾在故障正中间 grep 日志 grep 到放弃,那说明日志设计错了。本文讲如何把给人看的日志和给机器看的日志分开,确定每一行都必须包含的字段,并立起判断日志级别的唯一标准。文中用真实代码整理了用 W3C traceparent 跨服务边界追踪请求的方法、把个人信息与密钥过滤掉的脱敏配置、不会把故事切碎的请求级采样,以及基数与成本的计算。最后给出日志、指标、追踪各自应该在什么时候看的顺序。
2026-07-26 · 16 分钟阅读 #observability#logging#structured-logging#opentelemetry#incident-responseOTel 的 Kubernetes 属性变成 stable 了 — 在 k8sattributes 默认值翻转之前要做的事
OpenTelemetry 的 Kubernetes 语义约定已经在 2026 年 6 月 12 日的 semconv v1.42.0 中晋升为 stable。但 Collector 的 k8sattributes 处理器目前默认值仍是旧模式(v0),所以大多数人什么都没感觉到。问题在于这不是永久的 — 按照 Collector RFC 制定的推进路线,一旦特性开关升到 beta,默认行为就会翻转为仅 v1,k8s.pod.labels
2026-07-16 · 18 分钟阅读 #opentelemetry#observability#kubernetes#semantic-conventions#telemetry-pipeline可观测性完全指南:日志、链路追踪与 LLM 监控
从日志、指标、链路追踪这三大支柱出发,梳理它们如何通过 traceid 相互关联,再对比 Loki 与 OpenSearch 的日志策略差异、以 OpenTelemetry 为中心的分布式链路追踪(Jaeger、Tempo),最后延伸到以 Langfuse 为代表的 LLM 可观测性。逐项对照实务中该如何搭建技术栈、又该如何取舍。
2026-07-03 · 22 分钟阅读 #observability#opentelemetry#tracing#logging#llmObservability 2025 完全指南:OpenTelemetry、Grafana / Datadog / Honeycomb / SigNoz、SLO 与 Error Budget、LLM 可观测性(2025)
Season 5 Ep 8。没有可观测性就没有运维,没有运维就没有产品。OpenTelemetry 三大信号(Metric、Log、Trace)的统一,Grafana 技术栈(Prometheus、Loki、Tempo、Mimir)与 Datadog、New Relic、Splunk 的比较,SigNoz、Honeycomb、Axiom 这一新世代,SLO、SLI、Error Budget 的运营,LLM 可观测性(LangFuse、L
2026-04-15 · 15 分钟阅读 #observability#opentelemetry#grafana#datadog#honeycombOpenAI、Azure、AWS 企业级 Agent 可观测性与评估比较指南
对比 OpenAI、Azure、AWS 在 Agent 可观测性、评估、仪表盘、OpenTelemetry 集成上的差异,并为平台、产品、基础设施团队整理了一份做出上线决策的实务指南。
2026-04-12 · 5 分钟阅读 #openai#azure#aws#observability#evaluation