独立站要不要屏蔽AI爬虫?Robots.txt、服务器、CDN、WAF到底选哪个?一文讲透(附代码与决策清单)


大家好,我是Neo。

过去一年,至少有几十个老板问过我同一个问题:“Neo,AI爬虫天天来扫我的站,既不给我流量还烧我带宽,我要不要把它们全屏蔽了?”

我的回答一直是:先别急着“全屏蔽”,你要先想清楚挡的是谁、在哪一层挡、挡完的代价是什么

刚好这两天,Search Engine Journal的“Ask An SEO”专栏发了一篇非常系统的文章,标题叫《Should I Block AI Crawlers At Robots.txt Or Server Level?》(屏蔽AI爬虫,用robots.txt还是服务器层面?),把这笔账算得很清楚。再叠加Cloudflare 2026年9月刚落地的AI爬虫分类新政,现在正是理清这件事的最好时机。

今天这篇文章,我把“要不要挡、怎么挡、在哪挡”一次讲透:先讲两类屏蔽方式的本质区别,再拆Cloudflare的三类爬虫新政,最后给你一份可以直接照抄的决策清单和配置代码。

一、先搞懂本质:robots.txt是“君子协定”,服务器层是“物理锁”

屏蔽AI爬虫,业界就两条技术路线,理解它们的区别是全部决策的基础。

路线A:robots.txt——礼貌的“禁止入内”牌子。

原理极其简单:在网站根目录的robots.txt里,按爬虫名(User-agent)声明Disallow规则。比如不让OpenAI的GPTBot爬你的站:

User-agent: GPTBot
Disallow: /

只挡某些目录也可以:

User-agent: GPTBot
Disallow: /products/

OpenAI的GPTBot和OAI-SearchBot、Anthropic的ClaudeBot、谷歌的Google-Extended、Perplexity的PerplexityBot等主流AI公司,官方都声明遵守robots.txt协议

路线B:服务器/CDN/WAF——直接上锁。

在服务器、CDN或WAF层面,收到请求时直接根据IP、User-Agent、请求行为等特征,对指定爬虫执行拒绝(deny)或拦截。

  • 服务器层:读到请求后按你的规则拒绝指定Agent。
  • CDN层:在请求到达服务器之前就拦截,爬虫根本碰不到你的源站,省带宽的效果最好。Cloudflare等CDN还提供预设的AI机器人拦截开关。
  • WAF层:最严格。它不只读请求头,还能分析请求行为——连那些伪装成其他User-Agent、试图蒙混过关的“狡猾”爬虫都能识别。Cloudflare WAF、AWS WAF都属于这一类。

一句话总结两者的本质差异,我特别喜欢SEJ原文的比喻:

**robots.txt是篱笆上的“禁止入内”牌子,服务器/CDN/WAF是栅栏上的锁。**牌子靠的是爬虫自觉遵守;锁不需要爬虫配合——它检测到爬虫就直接拦下,不管对方愿不愿意。

二、两类方式的优缺点全对比

robots.txt的优点:

  1. **可及性最高。**懂点SEO的都能自己改,不用求开发。
  2. **主流AI公司官方支持。**GPTBot、ClaudeBot、Google-Extended、PerplexityBot等都明确表态遵守。
  3. **颗粒度细。**可以精确到具体爬虫、具体目录,还能随时调整。

robots.txt的缺点:

  1. **遵守全凭自觉。**robots.txt本质上只是“请求”不是“封锁”——OpenAI自己都承认,它的某些抓取机器人未必严格遵守robots.txt。真有爬虫无视规则,你一点办法没有。
  2. **容易误伤。**CMS里robots.txt控制做得很傻瓜化,非技术人员手一抖,可能写出下面这种“封全站”的灾难规则,把谷歌等正经搜索引擎也一起挡了:
User-agent: *
Disallow: /
  1. **不自动更新。**每出来一个新AI爬虫(现在已超过170个),都要手动加一条规则,维护成本越来越高。

服务器/CDN/WAF的优点:

  1. **是真封锁。**不需要爬虫“配合”,检测到就拦,从物理上杜绝访问。
  2. **省带宽。**CDN层拦截发生在请求到达源站之前,爬虫根本消耗不到你的服务器资源。
  3. 有日志、有数据。被拦截的尝试都会被记录,你可以清楚地看到到底是谁在什么时间想爬你的站——这些记录在跟爬虫所属公司交涉(甚至法律层面)时都是证据。

服务器/CDN/WAF的缺点:

  1. **维护门槛高。**改规则基本要走开发,尤其是服务器由第三方代管时,每次调整都有时间、人力、金钱成本。
  2. **没有绝对防御。**再强的WAF也可能被高级爬虫绕过——只是概率问题。所以“完全屏蔽AI爬虫”在技术上从来不存在,只有“屏蔽掉绝大多数”。

三、2026年最关键的变化:Cloudflare把AI爬虫分成了三类

光讲老概念还不够,2026年屏蔽AI爬虫最大的变量是Cloudflare的新分类体系。今年7月,Cloudflare把AI相关流量正式分成三类,每一类都可以独立设置“放行/屏蔽”:

类别 是什么 典型爬虫 价值判断
Search(搜索) 抓取你的内容用于“稍后回答用户问题”,会给你带回流量 OAI-SearchBot、Claude-SearchBot、PerplexityBot 通常该放行——这是你在AI搜索里被引用的来源
Agent(代理) 代表真人实时执行任务的自动化行为(聊天助手实时抓页、浏览器型Agent) ChatGPT-User、Gemini/Claude驱动的浏览器 争议最大——既是“潜在客户在浏览你”也是“白嫖”
Training(训练) 抓你的内容去训练/微调模型,内容被永久吸收 GPTBot、ClaudeBot、Google-Extended 最该考虑屏蔽——只索取不回报

**这里有一个坑中之坑,必须重点提醒:**Cloudflare官方明确,像Googlebot、Applebot、BingBot这种“多功能爬虫”(既做搜索索引又可能用于训练),是按它的所有行为归类判断的——也就是说,**如果你的站点屏蔽了Training类,Googlebot也会被一并挡掉,除非你单独设置放行搜索类。**这是多少卖家屏蔽AI爬虫后莫名其妙丢了谷歌收录的头号原因。

2026年9月15日起的默认规则(Cloudflare官方博客已确认):

9月15日起,所有新接入Cloudflare的域名,Training和Agent两类默认在“带广告的页面”上被屏蔽,Search类默认保持放行。官方逻辑是:带广告的页面意味着站主想让人来看、来产生收益——所以只放行能带来流量的Search,挡掉只消耗不出力的Training和Agent。

Cloudflare官方的背景数据也很吓人:**2026年6月,AI训练类爬虫已占全部爬虫请求的52%(2025年春季只有22%);自动化机器人贡献的流量早就超过人类流量一半以上。**训练爬虫在“索取-回报”比上极其夸张——有数据显示ClaudeBot每带回1次推荐引用,要爬1万多个页面;而Googlebot的回报比大约5:1。这就是“训练爬虫最该挡”的底气所在。

顺带提一句:Cloudflare从2025年起就在推它的“按爬取付费(Pay Per Crawl)”市场,本质上想把“AI用你的内容”变成“AI为你的内容付费”——对内容型独立站,这可能是比“一刀切屏蔽”更聪明的长期选项,不过目前还处在早期,暂不展开。

四、别急着挡:三类AI流量,价值完全不同

技术讲完,回到决策本身。**很多人的错误是“把所有AI爬虫当成一个整体”。**但按上面的三类分法,它们的商业价值完全不同:

第一类:AI搜索爬虫(Search)——这是你未来的“谷歌蜘蛛”,别挡。

OAI-SearchBot、Claude-SearchBot、PerplexityBot这类,负责抓取你的页面,让你出现在ChatGPT、Perplexity等AI搜索的引用里。这已经是独立站不可忽视的流量入口。已经有数据证明:屏蔽GPTBot的网站,88.2%依然会出现在AI回答里(因为AI搜索走的是另一套抓取通道)——但如果你把Search类也一起挡了,那就是亲手把自己从AI搜索结果里除名。

一句话:**你可以讨厌“被训练”,但别拒绝“被搜索”。**训练是白嫖你的过去,搜索是带你走向未来。

第二类:训练爬虫(Training)——最纯粹的“白嫖”,优先考虑屏蔽。

GPTBot、ClaudeBot、Google-Extended……它们把你的内容永久吸进模型参数,不给流量不给钱。对内容型独立站(博客、教程、资料站),这类爬虫是纯损耗。除非你想让你的内容成为某个模型的训练语料(有些站长确实把这当品牌曝光策略,另当别论),否则训练类是最该挡的。

第三类:Agent(代理)——最纠结的一类,建议先观察。

ChatGPT-User这类“实时代理”抓取,可能是一个真人用户在跟ChatGPT对话时,ChatGPT替他实时查看你的页面。**这一刻它可能就是你的潜在客户。**一刀切挡掉,等于在客户进店前关门。但如果是被恶意Agent批量调用(刷接口、抢库存、恶意下单),那就是攻击了。我的建议:先用日志观察一段时间,如果你的Agent流量里真实对话占比高,就放行;如果主要是异常高频调用,再在WAF层单独加规则。

**那到底选哪种方式屏蔽?**SEJ原文的建议我基本认同,给你一个优先级:

  1. 只有一两个主流AI爬虫想挡(比如只挡GPTBot训练爬)→ 先用robots.txt,成本最低。
  2. 有明确的内容保护需求 → 尽量往服务器栈上层走:WAF优先,其次CDN,最后才是服务器——挡得越早,省得越多。
  3. 用了Cloudflare → 直接在Dashboard的 Security → Bots → AI Crawl Control 里按三类分别设置,比手写规则省心得多,免费套餐就有。
  4. 不管用哪种方式,都建议开着日志监测——定期看看robots.txt拦住的爬虫,有没有实际还在访问你的站(有就是对方不守规矩,需要升级到服务器层拦截)。

五、附一份可直接抄的配置:只挡训练、放行搜索

如果你用的是Cloudflare,直接在后台按上面的三类设置就行。如果你自己管理robots.txt和服务器,我给你一份“挡训练、放行AI搜索”的参考配置:

# 允许所有常规爬虫(保持默认)
User-agent: *
Allow: /

# 屏蔽AI训练类爬虫
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /

# 放行AI搜索/引用类爬虫(让AI搜索能引用你)
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /

注意上面Google-Extended的坑:谷歌的Google-Extended专门管“训练用途”,而Googlebot管搜索——两者分开,屏蔽Google-Extended不会影响你的谷歌收录。真正危险的是Cloudflare那种按“多功能爬虫整体行为”归类的场景(上文第三节的坑),那才需要你单独确认Search放行。

如果用Nginx在服务器层拦截(适合不听话的爬虫),核心思路是在server块里匹配User-Agent返回403,这里不展开完整代码,你需要的话评论区喊我,改天单独写一篇Nginx拦截AI爬虫的实操。

六、Neo的解读:独立站卖家到底该怎么定策略?

最后给你我的判断,分三种站型,对号入座:

内容/博客型独立站(靠广告、靠收录、靠AI引用吃饭):训练爬虫可以挡,但Search类一定放行——AI搜索引用正在成为这类网站的第二增长曲线。同时认真关注Cloudflare的Pay Per Crawl模式,那可能是比“屏蔽”更值钱的答案。

**电商/产品型独立站(靠真实买家下单):**Agent类流量要慎重——那里面藏着真实的购买意图。建议只挡训练类,Search和Agent先放行,用日志观察一个月再调整。你的核心诉求是“别让我的产品文案进训练集”,不是“别让任何人来我店里”。

**靠“内容护城河”吃饭的站(教程、数据、独家资料是核心竞争力):**防护等级拉满:robots.txt挡训练 + WAF层拦截 + 密切监控。这类站的内容一旦被大规模吸走,护城河就没了,值得投入成本做物理层防护。

不管哪种站型,记住三个原则:

第一,别一刀切。“全屏蔽AI”听起来解气,代价是你在AI搜索、AI推荐里同步消失。分清Search/Agent/Training再动手。

**第二,先软后硬。**先用robots.txt(零成本、可逆),发现有不守规矩的爬虫再升级到服务器层。别一上来就把服务器配置搞复杂——你90%的诉求robots.txt就能解决。

**第三,屏蔽要留证据。**服务器层的拦截日志是你的武器库——真有爬虫无视规则硬闯,那些日志是你跟对方交涉甚至维权的底牌。

最后说句掏心窝的:2026年了,**“你的内容被AI读”这件事本身不可怕,可怕的是“你的内容被AI白嫖、而你的品牌在AI里毫无存在”。**屏蔽训练爬虫,是为了保护你内容的价值;放行搜索爬虫,是为了让AI在回答里提到你。一个守,一个攻,两手都要抓。

想清楚你挡的是“训练”而不是“搜索”,你的屏蔽策略就成功了一大半。

我是Neo,一个专注独立站SEO的博主。动手配置完的老板,欢迎回来聊聊你的拦截日志里都发现了什么妖魔鬼怪。