标签: #logging
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
让日志可搜索,同时别把公司搜穷 — 结构化、映射爆炸、保留期与真实成本
日志成本超过计算成本的那一天,会降临在大多数组织身上。真正决定这一天能推迟多久的,不是压缩率,而是「把什么定义成字段」这个决策。本文讲结构化日志的字段设计、OpenSearch 映射爆炸拖垮集群的真实路径、用索引模板和 ISM 控制生命周期的方法,以及有原则的采样和保留分层。最后用数字算一算,用日志去模拟指标到底要付出多大代价。内容以 OpenSearch 3.5 和 OpenTelemetry Collector v0.157.0 为
2026-08-02 · 21 分钟阅读 #observability#logging#opensearch#elasticsearch#cost结构化日志设计 — 做出故障时真正派得上用场的日志
如果你曾在故障正中间 grep 日志 grep 到放弃,那说明日志设计错了。本文讲如何把给人看的日志和给机器看的日志分开,确定每一行都必须包含的字段,并立起判断日志级别的唯一标准。文中用真实代码整理了用 W3C traceparent 跨服务边界追踪请求的方法、把个人信息与密钥过滤掉的脱敏配置、不会把故事切碎的请求级采样,以及基数与成本的计算。最后给出日志、指标、追踪各自应该在什么时候看的顺序。
2026-07-26 · 16 分钟阅读 #observability#logging#structured-logging#opentelemetry#incident-response可观测性完全指南:日志、链路追踪与 LLM 监控
从日志、指标、链路追踪这三大支柱出发,梳理它们如何通过 traceid 相互关联,再对比 Loki 与 OpenSearch 的日志策略差异、以 OpenTelemetry 为中心的分布式链路追踪(Jaeger、Tempo),最后延伸到以 Langfuse 为代表的 LLM 可观测性。逐项对照实务中该如何搭建技术栈、又该如何取舍。
2026-07-03 · 22 分钟阅读 #observability#opentelemetry#tracing#logging#llm像侦探一样读懂日志和堆栈跟踪
堆栈跟踪是案发现场,日志是目击者证词。从上到下读懂堆栈跟踪的方法(一端是出事的地方,一端是起因)、追踪 "caused by" 链条、结构化·JSON 日志、关联 ID 与 traceid、用 grep·jq·ripgrep 挖掘日志,直到日志级别与采样。把日志和跟踪当作证据来对待的侦探技术。
2026-06-28 · 19 分钟阅读 #logging#debugging#stack-trace#observability