测验:聚合与关联
在调查故障时,有什么比“错误何时开始?”更好的问题呢?
- 谁分发的?
- 有多少人受到影响?
- 什么时候开始不再正常了?
- 什么时候会恢复?
来自两种服务的日志无法在一条时间线上对齐。首先要检查什么?
- 日志级别统一了吗?
- 时间戳是否包含 UTC 偏移量?
- 有request_id吗?
- 两台服务器的NTP同步
部署时间为 03:19,第一个错误发生在 03:27。这是否证实分布是原因?
- 可以确认。因为时间顺序很清楚
- 该命令只是必要条件,回滚后应检查症状是否消失。
- 8分钟的间隔太长而且无关紧要。
- 如果没有其他分布,则确认。
当一个日志行中有service.version字段时会发生什么?
- “是因为部署吗?”这个问题只能通过日志来回答,没有任何单独的部署历史记录。
- 日志容量减少
- 搜索速度加快
- 您可以通过按版本划分来进一步延长日志保留期限。
如果您必须选择一个指标,哪一个会比平均延迟更好?
- 测量部分的最大延迟
- 超过阈值(例如 1 秒)的请求数
- 测量部分的最小延迟
- 收到的请求总数
从单行错误消息db query timeout: table=payments中您可以立即注意到什么?
- 导致该问题的代码的文件名和行号
- 受影响的用户数量
- 预计恢复时间
- 层次结构(数据)、症状(超时)、目标(付款表)