测验:脏数据诊断
优化脚本必须输出什么?
- 处理时间
- 内存使用情况
- 输入文件的哈希值
- 丢弃的行数
我们通过使用“如果电子邮件相同则重复”规则对它们进行分组来组织它们。如果电子邮件有空行怎么办?
- 空值被归为一组并删除,只留下一个不同的客户。
- 空值会自动排除
- 发生错误并中止
- 空值的处理方式不同。
删除前导和尾随空格后,客户名称已标准化为小写。该值的正确用途是什么?
- 如果值相同,则无条件合并为同一个客户。
- 用这个值覆盖原来的值
- 仅用于排序
- 用于比较匹配,但不作为最终合并的依据
在 226 行中,有 180 行违反了规则。什么是正确的决定?
- 放宽平板电脑规则
- 手动修正180行
- 继续处理符合规则的 46 行。
- 这可能是数据提取本身需要重做而不是纯化的情况。
谁决定如何处理“4 行负数”?
- 询问负责人并同意
- FDE根据技术判断做出决定
- 根据大多数情况自动决策
- 暂时排除并稍后通知
数据清理的正确顺序是什么?
- 计数→分类→共识→提炼
- 精炼→计数→报告
- 分级→纯化→计数
- 共识→细化→分类