标签: #scraping
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
访客统计里只看得见 0.5% 的流量 —— 防机器人要看来源,而不是自我声明
以一个 150 万页面的站点抵御爬虫一整年的记录为依据,梳理应对机器人流量的原则。基于 JavaScript 的分析工具数不到机器人,所以必须去看服务器日志;规则也不能建立在 User-Agent 这类自我声明的值上,而要建立在 ASN、地理位置、是否为经密码学验证的机器人这些难以伪造的来源信息上。文中还会谈到每次抓取带来多少访客这个指标、Cloudflare 公布的比率与单站实测值为何会分歧、防御装置本身吃掉性能预算的案例,以及在住宅
2026-08-09 · 17 分钟阅读 #network#bot#cloudflare#waf#scraping