测验:日志怎么读
我在日志中统计了 103 个错误。接下来必须获得什么值?
- 错误的平均响应时间
- 出现错误的唯一 IP 数量
- 占总请求的百分比
- 正常情况下的错误次数(不包括事故部分)
部署后,仅 4xx 增加,5xx 保持不变。最可能的解释是什么?
- 服务器内部处理被破坏
- API 合同已更改,客户端请求不再适用
- 客户端网络不稳定
- 部署使数据库变慢
5xx在6小时内均匀传播和在1分钟内集中传播有什么区别?
- 前者是长期缺陷,后者是当时的一个事件,所以调查的方向完全不同。
- 如果错误总数相同,则问题相同。
- 后者,集中在某一时刻,总是更加严重。
- 散射电子可以忽略不计。
错误并不集中在某一特定端点,而是分布在所有路径上。你怀疑什么?
- 数据库、身份验证和网络等常见依赖项
- 函数代码本身存在缺陷
- 特定客户端版本的问题
- 日志收集端错误
平均响应时间为1380ms。我们可以从这个值中学到什么?
- 你几乎什么也看不到——即使大多数人速度很快而少数人很慢,你仍然得到相同的值。
- 大多数用户等待约 1.4 秒
- 系统整体速度较慢
- p99约为1380ms
仪表板的平均响应时间是正常的,尽管客户称它“偶尔会冻结几秒钟”。这种情况怎么办?
- 这并不矛盾——他们都是真实的,而且他们看到了不同的东西
- 客户失误或客户方网络问题
- 测量工具坏了
- 由于缓存,服务器指标失真