去年 10 月,一个客户打电话给我,非常惊慌。他的托管仪表板显示三周内爬虫流量激增 34%,他确信自己遭到了爬虫攻击。我查看了他的服务器日志。不是爬虫。是 ClaudeBot 和 GPTBot,每隔几天就像时钟一样爬取他的 800 页 WooCommerce 目录。他根本不知道这些东西的存在。
这样的对话现在到处都在发生。人们在网上得到的建议五花八门:屏蔽所有内容、允许所有内容、无关紧要、非常重要。大多数是由几个月没看过服务器日志的人写的。
我看过。在 Seahawk Media 建立的 12,000 多个网站以及我自己的客户组合中,我现在对实际发生的情况和对不同类型网站的正确做法有了相当清晰的认识。让我为你讲解一下。
ClaudeBot 和 GPTBot 实际上是什么
首先需要澄清一点,因为人们常常混淆这些。
GPTBot 是 OpenAI 的爬虫。它用于收集未来 GPT 模型的训练数据,自 2023 年中期以来一直活跃。OpenAI 发布了他们的 GPTBot 文档并明确指出屏蔽它不会影响 ChatGPT 如何回答关于你现有内容的问题,这纯粹是为了未来的训练。
ClaudeBot 是 Anthropic 的等效产品,用于训练 Claude 模型。基本故事相同。它在你的日志中显示为 ClaudeBot 用户代理字符串并诚实地标识自己,我为此给他们点赞。
还有其他的。Google 的 Google-Extended 专门用于 Gemini 训练,与 Googlebot 分开。CCBot(Common Crawl)已经存在多年。ByteDance 的 Bytespider。这个列表还在增长。
但关键是:这些爬虫的行为并不完全相同。GPTBot 和 ClaudeBot 尊重你的 robots.txt。Bytespider...根据我的经验,不太可靠。
屏蔽机制:robots.txt 以及它实际上做什么
如果你想屏蔽 GPTBot,你在 robots.txt 中添加这些:
`` User-agent: GPTBot Disallow: / ``
ClaudeBot、Google-Extended 等也遵循相同的模式。很简单。在任何像 Yoast 或 Rank Math 这样的 WordPress 插件中花费三十秒,或者直接编辑文件。
但这实际上意味着什么:这是一个礼貌的请求,不是一把锁。来自具有法律和声誉利益的公司(OpenAI、Anthropic、Google)的合法爬虫确实尊重它。构建竞争工具的可疑爬虫?他们完全忽视它。所以如果你关心的是防止坏人的数据盗窃,robots.txt 不是你的防线。你需要 Cloudflare 的机器人管理或服务器级别的 IP 屏蔽。
我见过网站所有者花两小时配置 robots.txt 规则来屏蔽一些无名 AI 爬虫,这爬虫绝对不会听从。浪费时间。把你的精力集中在合法爬虫上,因为那是你真正的选择所在。
没人谈论的真实权衡
好吧。这是大多数讨论陷入困境的地方。
屏蔽的论点是这样的:"他们正在用我的内容训练他们的模型,我什么都得不到。"公平。真的。如果你是拥有原创编辑内容、法律数据库、深入教程库的出版商,那是你的知识产权,价值交换充其量是不清楚的。
允许的论证是这样的:"在AI答案中被引用是新型反向链接。你想被纳入训练数据。"也有一定道理。但比人们承认的更不稳定,因为训练数据和AI引用之间的关系没那么直接。
看了这件事在客户网站上演变一年多后,这是我的实际看法。
问题不是全局"屏蔽或允许"。而是"哪些内容、哪些爬虫,以及我实际上需要保护什么?"
SaaS博客的存在是为了提高知名度。屏蔽GPTBot?你在切断一个潜在的分发渠道,得不到任何实际好处。付费食谱数据库或高级研究档案?情况完全相反。
在2024年初,我和一个经营订阅制行业报告服务的客户合作。流量不错,每月约40,000访客,大部分被设为付费墙。他们完全允许所有AI爬虫,因为"更多曝光"。我查看了机器人实际可以爬取的内容,其中包括18个月的完整文本高级报告,而Google被告知不索引这些。我们屏蔽了AI爬虫对这些目录的访问。花了二十分钟。公开营销页面保持开放。
这是从简单的"屏蔽所有"或"允许所有"论调中缺失的细微差别。
这如何影响SEO(以及如何不影响)
我直说:屏蔽ClaudeBot和GPTBot对你的Google排名没有任何影响。一点都没有。Googlebot是完全独立的系统。GPTBot和ClaudeBot不会进入Google Search。不要让任何人告诉你相反的说法。
它可能影响的是你在AI生成答案中的可见性。ChatGPT、Claude、Perplexity。特别是Perplexity进行实时网络检索,所以这是一个不同于训练数据的机制。
新兴的AEO角度
Answer Engine Optimisation是人们现在追踪的真实存在的事物。在AI响应中作为来源被引用比18个月前更重要,尽管仍然难以清晰衡量。理论是训练数据中的内容帮助模型熟悉你的品牌或网站,这可能随时间影响引用。这是合理的。但未被证实。
我不会纯粹基于这种推测做出屏蔽决定。要基于你的内容的性质和商业敏感性。
服务器负载:小型主机商的合理关切
这是在哲学辩论中被忽视的无趣实践问题。
ClaudeBot和GPTBot在他们感兴趣的网站上可能是激进的爬虫。我提到的那个800页WooCommerce客户?他的共享主机真的感受到了。我们通过Cloudflare的bot fight mode设置爬取率限制,而不是直接屏蔽,这平稳地解决了问题,同时没有完全切断他们。
如果你在有大型网站的便宜共享主机上,检查你的日志。实际查看。你可以在cPanel中的"Raw Access"下做这件事,或通过GoAccess之类的工具,它免费且可以快速解析访问日志。如果AI爬虫出现在前10位请求者,而你的资源有限,那这值得认真讨论。
在VPS或配置合理的专用服务器上?可能不是问题。但不要假设。
平台特定说明
WordPress 网站
Yoast SEO和Rank Math都让你在不直接接触文件的情况下编辑robots.txt。Yoast在SEO > Tools > File Editor下的界面可以用于此。Rank Math的路径类似,在General Settings > Edit robots.txt。
如果你想要更细粒度的控制,Yoast Premium中的Crawl Optimization设置让你全面减少不必要的爬取表面,这对所有机器人都有帮助。
Shopify和托管平台
Shopify自动生成你的robots.txt.liquid,它已更新为包含一些AI爬虫规则,但你的控制权有限。自2021年以来,有一条robots.txt.liquid定制路径可用,但它需要主题编辑。不总是显而易见。
静态网站 (Gatsby、Astro、Next.js)
完全控制权。只需在你的 public 目录中以静态文件的形式维护 robots.txt,就完成了。没有借口说这个配置不是有意设置的。
我目前的推荐框架
不同的网站需要不同的默认设置。以下是我现在的思考方式:
默认允许爬虫,如果:
- 你的内容主要是营销、教育或品牌宣传性质,不涉及付费内容。
- 你是一个小企业,想在尽可能多的地方增加品牌曝光。
- 你发布自由可用的信息,并且会真正受益于更广泛的传播。
- 你没有足够的技术资源来维护复杂的屏蔽策略。
屏蔽或限制爬虫,如果:
- 你有技术上可以爬取的付费内容(常见的疏漏)。
- 你运营出版社、新闻机构或数据库,内容本身就是你的产品。
- 爬虫造成的服务器负载在有限的托管条件下明显影响了性能。
- 你有法律原因需要限制数据收集(在受监管的环境中处理医疗、法律或金融内容)。
值得考虑的中间路线:
- 屏蔽 AI 训练爬虫访问高价值内容目录,但允许访问博客和营销部分。
- 如果问题是负载,使用 Cloudflare 限流而不是完全屏蔽。
- 每季度重新评估一次。这个领域变化很快,今天有意义的做法明天可能会改变。
如何实际检查他们现在是否在爬取你的网站
不要猜测。直接查看。
- Cloudflare Analytics(免费版)显示机器人流量分类,你可以按 user-agent 过滤。
- 针对原始访问日志运行 GoAccess 是最快的方式,可以准确看到哪些机器人在访问什么。
- Google Search Console 不会显示 AI 爬虫数据,但它为你提供了爬取基线用于对比。
- 直接在
access.log文件中搜索"GPTBot"或"ClaudeBot":`grep -i "GPTBot" /var/log/nginx/access.log | wc -l` 可以快速告诉你某个日志文件中有多少个请求。
Seahawk 今年早些时候有一个项目,客户确信 AI 爬虫是导致他们性能问题的原因。我们运行了日志分析。GPTBot 在 30 天内只发出了 47 个请求。完全无关。真正的罪魁祸首是一个配置错误的备份插件,每 6 小时运行一次完整网站扫描。不要让机器人的舆论干扰你对实际日志的分析。
FAQ
屏蔽GPTBot会影响我在ChatGPT中的可见性吗?
对于已编入索引和训练数据中的内容,不会。现在屏蔽GPTBot只会影响未来的训练运行。ChatGPT的现有知识不会因为你今天添加了robots.txt规则而改变。而且ChatGPT的浏览插件无论如何都会进行实时网页检索,这受不同机制的控制。
如果我允许ClaudeBot,Anthropic会给我的网站署名吗?
不会自动署名。训练数据的使用不附带署名。如果Claude在回复中引用了你的网站,那是基于它的训练方式和实时检索到的内容,而不是你允许爬虫访问的直接合同结果。
我可以只屏蔽AI爬虫的特定目录吗?
可以,绝对可以。你的robots.txt可以精细到你想要的程度。为GPTBot添加Disallow: /premium/,同时保持/blog/对其开放,这在语法上完全有效。这实际上是我对大多数内容业务的建议。
要求AI公司不在我的内容上训练有法律依据吗?
这个领域确实悬而未决。纽约时报诉OpenAI案是目前最突出的推进这一问题的案件。目前,robots.txt是可用的实际机制。法律框架远滞后于技术发展。
所有AI爬虫都遵守robots.txt吗?
来自资金充足、信誉突出的大公司的爬虫(OpenAI、Anthropic、Google)通常遵守。较小、不那么负责任的爬虫通常不遵守。robots.txt是一种君子协议,而不是技术壁垒。
---
听着,这里没有普遍正确的答案。我为有些客户屏蔽了AI爬虫,也为其他客户明确开放了通道,有时甚至在同一天内。这个决定应该纳入关于你的内容策略和托管设置的同一对话中,而不是基于你上周在Twitter上读到的任何内容制定的笼统政策。
检查你的日志。了解什么在爬取你的网站。然后做出有意识的选择,而不是继承一个你从未设置过的默认设置。
