标签: #ai-crawlers
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
爬虫如今来自数百万个家庭 IP — residential proxy 与开源基础设施的消耗战
2026年7月10日,LWN 的 Jonathan Corbet 发布了一篇爬虫现状的更新。核心有两点 — residential proxy(家庭代理)几乎让基于 IP 的封禁彻底失效,而 AI 爬虫的激增填满了这份需求。在一次攻击中,数小时内数百万个不同的 IP 各自只敲击站点两三次。本文诚实地梳理为什么封禁在结构上注定失败、开源 git 仓库为什么最先中招(以及 Anubis 为什么在那里诞生),以及工作量证明、CAPTCHA、数
2026-07-11 · 10 分钟阅读 #web-scraping#residential-proxy#ai-crawlers#anubis#infrastructure