测验:识破小模型的夸大性能宣传
当时间样本为 [1, 2, 100] µs 时,指定的 p95 计算结果是什么?
- 100 µs:ceil(3×0.95)th 值
- 2 µs:三个样本的中值
- 大约 34.3 µs:三个样本的平均值
- 51 µs:前两个样本的平均值
运行批处理 32 300 次的总时间为 3,000,000 µs。吞吐量是多少?
- 100次/秒:将300次分为3秒。
- 3,200 个项目/秒:9,600 个项目除以 3 秒
- 32/秒:按原样使用批量大小
- 9,600/秒:使用图像总数
模型文件为 24KB,VmHWM 为 62MB。最合理的解释是什么?
- 测量失败,因为文件大小和内存必须相同。
- 全部区别在于分配给图形设备的内存。
- HWM 还包括解释器和运行时。
- 由于进程内存较大,权重仍然是FP32
我创建了一个新的 Candidate.onnx 并提交了旧的 benchmark.json。首先要看什么?
- 新文件是否与之前同名
- 老款p95是你喜欢的值吗?
- 记录测量时间的星期几
- 测量报告中的模型哈希值和当前文件哈希值
包含 300 个原始时间和哈希值的报告不能证明什么?
- 事实上,作者并没有真正测量或操纵时间。
- 指定的原始时间的中位数与摘要相匹配。
- 报告中写入的hash是否与提交的模型相同
- 提交的时间是否包含0或类似值?
INT8 在这个容器中速度很快。在release.json中写的正确结论是什么?
- 它在所有 CPU 和 NPU 上都很快,因此省略了目标设备测试。
- 记录需要单独测试目标设备的性能
- 由于模型文件较小,进程 RSS 也会减少相同的百分比。
- 由于评价分数相同,因此字段输入的准确性也相同。