测验:从事故复现里学到的
为什么实验中创建的检查脚本必须读取 dump,而不是读取文件?
- 因为文件经常会因权限问题而无法读取
- 因为 dump 的响应速度远快于文件
- 因为文件中仍原样保留着预期内容
- 因为文件格式会随版本变化,难以解析
为什么只在节点 status 中写入 nvidia.com/gpu 的数量,也能复现调度行为?
- 因为 kubelet 稍后会重新检查设备是否存在
- 因为扩展资源可以在每个节点上任意定义
- 因为调度器会打开设备并核对数量
- 因为调度器的判断依据不是设备本身,而是该数值
为什么实验要求把 Pod 处于 Pending 状态的原因保存到文件中?
- 因为状态一旦变化,条件和事件就会消失
- 因为评分器无法访问集群
- 因为同一原因在不同节点上会有不同结果
- 因为 Pod 会被自动删除,之后无法查询
在时隙计算表中把保证内存写为 0,意味着什么?
- 获得时隙的 Pod 完全无法使用内存
- 一个 Pod 用尽内存后,其余 Pod 就会失败
- 无法通过指标测量内存使用量
- 必须为每个 Pod 单独设置内存上限
在滚动更新停滞的集群中,首先应该做什么?
- 彻底查明新规约无法启动的原因
- 提高允许同时中断的数量,强行推进滚动更新
- 回退到旧规约,让所有节点恢复为同一状态
- 排空停滞的节点并将其移出集群
在这个实验环境中无法实际验证、只能作为概念讲解的是哪一项?
- 没有资源时 Pod 等待的行为
- DaemonSet 滚动更新停滞的行为
- RuntimeClass 对象被保存的行为
- 必须重启后才会注册 runtime handler 的行为