一万个网站的 robots.txt 暴露了一个盲区:大家都在封训练爬虫,却忘了答案爬虫
AIAI Summary (BLUF)
Cloudflare推出按答案付费,但网站robots.txt规则大多只屏蔽训练爬虫,忽略了答案爬虫。对1万个网站的分析显示,38%的GPTBot规则写于2023年第四季度,而答案爬虫规则增长缓慢。网站需要更新规则以应对AI答案时代。
核心洞察
这篇文章最有意思的地方,是它用一万个网站的 robots.txtA text file that instructs web crawlers which pages or files to access or ignore on a website. 数据戳破了一个大家心照不宣的假设:网站主们以为自己在"管理 AI 策略",其实只是在反复重写 2023 年那份恐慌清单。真正的问题不在于他们封了什么,而在于那个决定"要不要让 AI 现场抓页面回答问题"的开关,绝大多数人压根没碰过。
2026 年 7 月 1 日,Cloudflare云服务提供商,支持边缘函数、静态资源部署等,Astro 项目可通过 @astrojs/cloudflare 集成部署。 宣布了一件事:网站主可以在 AI 机器人抓取页面的那一刻收费。不是等几个月后模型训练完了再收,而是它当场抓、当场答、当场计费。这事还在早期实验阶段,而且不止 Cloudflare 一家在做,x402一种开放支付协议,旨在实现机器对机器的微支付,可用于AI爬虫按次付费。 这类开放支付协议也在往同一个方向走。过去网站有办法封禁抓取,现在开始有办法对抓取收费了。回答正在变成一笔交易。
给这个交易建收费站,本身就挺奇怪。因为互联网给 AI 定的规则手册里,几乎不承认这个时刻存在。
我们不想凭感觉说事,就做了件很枯燥的活:抓取 Tranco 排名前一万个网站的 robots.txt,看它们各自声明了什么。注意,是声明,不是服务器实际怎么响应,也不是边缘节点偷偷拦了什么,因为从外面根本看不到那些。我们只读每个网站挂在自己门口的那份规则手册。其中 5577 个网站有我们能读的文件。这份研究看的就是这本规则手册对"回答时代"说了什么。简短版:它是为另一场战争写的。
核心结论
在 Tranco 前一万个网站中,5577 个有可读的 robots.txt;其中 1197 个完全封禁了至少一个主要 AI 爬虫,但只有 351 个有效禁止了所有"回答时抓取"机器人,绝大多数网站的答题之门仍然敞开。
AI 规则高度集中在 2023 年第四季度:861 个可确定日期的 GPTBotOpenAI's web crawler used to collect data for training AI models like ChatGPT and GPT-4. 规则中有 323 个(38%)首次出现于该季度,是第二高季度的三倍;一半(430 个)写于 GPTBot 上线后约半年内。
网站普遍只封训练爬虫、漏掉回答时抓取器:封禁 Anthropic 训练爬虫的网站中 71%(598/840)对 Claude 的回答时机器人没有任何规则,OpenAI 为 53%(493/932),Perplexity 为 50%(229/461)。
"封训练、放回答"这一立场在现实中极为稀有:明确 Allow 回答时机器人的比例仅为 OpenAI 4.0%(37/932)、Anthropic 1.9%(16/840)、Perplexity 0.9%(4/461);5577 个网站中只有 144 个对至少一个回答时机器人写了明确的 Allow。
这些文件被持续维护但方向单一:430 个恐慌期 GPTBot 封禁者中 87% 后来新增了机器人规则,但新增几乎全是训练爬虫(ClaudeBotAnthropic 的训练数据收集爬虫,用于 Claude 模型。 671 个网站、PerplexityBotPerplexity's web crawler used to collect data for training its AI search engine. 540 个),回答时机器人只分到一小部分注意力。
规则手册是一座战争纪念碑
最先注意到的是日期。把这些文件里的 AI 规则和它们第一次被写下的时间对齐,它们并没有均匀分布在 AI 时代。它们全堆在开头。在我们能确定日期的 861 个 GPTBot 规则里,38% 写于同一个季度——2023 年最后三个月(323 个网站,是第二高季度的三倍)。一半写于爬虫上线后大约半年内(861 个里的 430 个)。
那个季度不是巧合。OpenAI 2023 年 8 月上线 GPTBot,八周后纽约时报起诉了 OpenAI。如果你那年秋天运营着一个网站,你被结结实实吓到了,然后做出了理性反应:往一个文本文件里粘四行,把训练爬虫挡在外面。2023 年这么做很合理。今天可能仍然是对的。
你会以为这么老的文件早该过时了。大部分没有。在恐慌期写下 GPTBot 规则的 430 个网站里,87% 后来回来加了新的机器人规则,只有 57 个再没回来过。有人在持续打开这些文件。
但看看他们加了什么,这份勤勉就变味了。新加的行几乎全是训练爬虫——ClaudeBot 现在出现在 671 个网站上,PerplexityBot 540 个,到 2026 年还在涨——而回答时抓取的机器人,那些为了写实时回答而抓页面的,只分到了一小部分注意力。GPTBot 之后没有任何一个爬虫享受过恐慌级待遇:后面每一个爬虫在前两个季度只写入了 3% 到 23% 的规则,相比 2023 年的洪水,这只是一滴一滴地漏。恐慌是一次性事件。之后全是肌肉记忆。
所以这份文件是一座战争纪念碑。但不是被遗弃的那种。是那种人们不断回来维护的,而他们刻上去的每一个名字,都是同一场战争里的又一个训练爬虫。这不是疏忽。这是盲区,而盲区不是靠更勤快地维护文件能修复的。
每家 AI 公司跑两个机器人,大多数规则只知道一个
2023 年的规则手册漏掉的就是这部分。
每家大型 AI 厂商不是派一个机器人来你的网站。它派两个,干不同的活。一个是训练爬虫——它批量读取网页来构建模型。另一个是回答时抓取器——它在真人问了真问题之后才出现,把你的页面拉进正在生成的回答里。第一个是 2023 年所有人愤怒的对象。第二个是现在真正重要的那个,因为按回答收费的收费站计的就是它。
所以我们查了一下:对于每一个完全封禁了某厂商训练爬虫的网站,它有没有提到这家厂商的回答时机器人?大部分没有。
把表格右边两列放在一起读,因为两列之间的差距就是发现本身。封了 Anthropic 训练爬虫的网站里,十个有七个对用 Claude 回答问题的那个机器人没有任何规则。而故意做了那件有意思的事——封训练、放回答,对一个想要推荐流量但不想喂模型的发布者来说唯一说得通的姿态——的网站少得可怜。Anthropic 不到 2%。OpenAI 4%。大家都在理论上讨论的"不训练、但回答可以"这个立场,在现实中几乎不存在。
在解读这份沉默之前,有一个提醒:这是盲区的上限,不是盲区的测量值。从外面看,一个从没遇到过 OAI-SearchBotChatGPT Search使用的爬虫User-Agent,用于索引网页内容以供搜索引用,需在robots.txt中允许。 的网站,和一个遇到了、耸耸肩、觉得没必要写一条多余的 Allow 的网站,长得一模一样——没人会给一个自己乐意放行的机器人写规则。我们能看到的,是有人付诸行动时的意图,也就是表格最后一列:那百分之几封了训练爬虫、同时故意放回答时机器人进来的网站。福布斯就是其中之一——GPTBot 禁止,OpenAI 的搜索抓取器明确允许。这个立场是真实存在的。只是很稀有。
在一个明显用心写过的文件里,这个缺口更容易看清。经济学人,根据我们 2026 年 7 月 3 日扫描、7 月 4 日复查的 robots.txt,点名拒绝了两个 OpenAI 机器人——GPTBot 和 ChatGPT-User 都是干脆的 Disallow: /。第三个,OAI-SearchBot,那个把页面拉进实时搜索回答的抓取器,文件里根本没提。经济学人显然在这里花了心思;它有意点名了机器人,做了一个站得住脚的决定。只是 OpenAI 跑的机器人比它管的那两个多,而它漏掉的那个恰好是搜索抓取器。你可以用同样的方法检查任何网站,大概十秒钟:打开它的 robots.txt,找回答时机器人的名字。
被管理者读不到的规则手册
还有一个更安静的失败。在 7627 个回应我们的网站里,有 883 个,一个诚实表明身份的机器人请求 /robots.txt 时,收到了挑战或拒绝——那本职责就是陈述规则的规则手册,被面朝下递给了访客。GoDaddy 就是其中之一。我们分不清这是刻意的反 AI 立场,还是安全厂商在挑战所有数据中心 IP(包括我们的),我们也不假装能分清。但一本被管理者读不到的规则手册,本身就是一种回答。
与此同时,144 个网站已经做了决定
很容易把这一切读成"互联网正在关闭"。并不是,同样这 5577 个文件就能证明。其中只有 351 个封禁了所有回答时机器人;在可读的前一万名里,绝大多数网站的答题之门是敞开的。还有 144 个网站比默认开放走得更远——它们写了一条明确的 Allow 行,点名一个回答时机器人,有意邀请它进来。
5577 分之 144,算不上什么运动。但它证明了这种主动选择的经济不是假设,也不在等任何人。少数网站已经把回答时抓取当成要争取的东西,而不是要忍受的东西,而这么短的名单意味着还没有人错过它。
勤勉不是决策
把这些发现摆在一起,形状就清楚了。这些文件是被维护的——勤勤恳恳,年复一年——而几乎所有这些维护都在重打同一场战争。对于互联网现在正在学着收费的那个时刻,也就是回答时抓取,维护永远没写到那一行。不是被拒绝了。只是从没走到那里。
对此有三件说得通的事可做,这篇文章不特别主张哪一件。你可以封:训练爬虫和回答时抓取器一起封,接受你不会出现在回答里。你可以卖:把抓取器挡在外面,等按回答收费的收费站来了再收费放行。或者你可以开:让回答时机器人进来,因为出现在回答里对你比那一个页面浏览更值钱。三种都站得住脚。真正不算姿态的是第四件事,也是大多数网站实际在做的事——年复一年地维护文件,却从没决定过回答到来时会发生什么。不管你选什么,有意识地选。文件已经打开了;缺的是那个决定。
开门只是容易的那一半
假设你做了文件从没做过的那个决定,有意为回答时抓取打开大门。后面还有一个更难的问题等着——那个所有维护都没想到要问的问题。
那 144 个网站做了一个真实的决定,打开了门。所有文件都展示不了的是,有没有人检查过下一件事——整个收费站的前提所在:当回答时机器人抓取页面时,这个页面能回答那个问题吗?开门不等于房间值得走进去。不管你是卖软件还是发文章,失败看起来都一样:一个 AI 来到你的定价页,找不到价格,或者读了你的报道,看不出你的结论是什么,它不会给你计费然后走开。它会照样回答买家——从别的地方,或者靠猜。
这从来不是资源问题。勤勉程度在排名列表上几乎不变;视力才变。回答时类别的规则出现在 64% 的前一千名封禁者身上,到第一万名只剩 41%——那些全职干这事的团队,三分之一的时候会漏掉新类别,而在前一万名以下、我们数据到头的地方,斜率只会往下。大多数小团队根本没人维护文件,就算有也救不了他们:维护文件的人照样漏掉要紧的东西。训练战争是可见的那一半。你的页面能不能回答买家的 AI 实际问的问题,是任何文件都揭示不了的那一半——无论规模大小——而正是这一半决定了出现在回答里到底值不值钱。你不是靠更多维护到达那里;你是靠一个页面、一个问题地去看,从你自己的开始。
方法
这份研究是什么,不是什么。我们在 2026 年 7 月 3 日抓取了 Tranco 前一万个域名的 /robots.txt,并对每个网站对 15 个 AI 机器人的声明策略做了分类。这只是一份关于声明策略的研究。我们没有爬取任何网站的页面,看不到边缘或 WAF 的实际执行,也从不说一个网站"封禁了 AI"——只说它发布的文件说了什么、没说什么。下面每个数字都标明了分母。
样本。一万个域名。7627 个返回了任何 HTTP 响应;5577 个有可读的 robots.txt(所有策略比率的分母);1197 个完全封禁了至少一个主要 AI 爬虫。Tranco 框架偏向大型商业网站。
两个机器人的沉默数字。在明确完全封禁某训练爬虫的网站中,robots.txt 里对该厂商回答时机器人完全没有段落的比例:Anthropic 598/840(71%),OpenAI 493/932(53%),Perplexity 229/461(50%)。"明确放行"=至少一个回答时兄弟机器人有明确的 Allow:OpenAI 37/932(4.0%),Anthropic 16/840(1.9%),Perplexity 4/461(0.9%)。沉默率是盲区的上限——缺失的段落无法与刻意保持默认区分开,而且很少有网站会写一条多余的 Allow。
主动选择。5577 个网站中有 144 个对 OAI-SearchBot、ChatGPT-User、Claude-User、Claude-SearchBot 或 Perplexity-User 中至少一个带有明确的 Allow,按网站去重。
规则何时写的。首次观察日期来自互联网档案馆对每个封禁者 robots.txt 的快照,取实际快照时间戳,覆盖全部 1197 个完全封禁者。这些是年龄的上限(某个 token 第一次被存档看到的时间),而且档案馆偏向热门网站。它的快照频率也可能随网站的新闻关注度上升,所以 2023 年第四季度的聚集,部分可能反映的是那个季度更密集的存档,而不只是更密集的编辑。861 个可确定日期的 GPTBot 规则中有 323 个(38%)首次出现于 2023 年第四季度——是第二高季度的三倍——一半(861 个里的 430 个)在爬虫上线后大约半年内。同单位的回答时序列把每个网站按其第一条回答时规则计一次:1197 个封禁者中有 406 个曾写过一条,大约是写 GPTBot 规则的一半,从 2024 年末起稳定在每季度 50 到 80 的低平台,从未接近 2023 年的尖峰。
被维护,而非被遗弃。在 430 个恐慌期 GPTBot 封禁者中(GPTBot 规则首次出现于 2023 年第三季度到 2024 年第一季度),87% 后来至少加了一条新的受追踪机器人规则;只有 57 个没有。这是下限——只有当我们追踪的 15 个机器人之一被加入时,我们才记为一次回归。新增偏向训练爬虫(ClaudeBot 671 个网站,PerplexityBot 540,Applebot-Extended 476,meta-externalagent 493),多于回答时机器人(167 到 354)。回归率在排名上几乎不变(前一千名 91%,五千到一万名 86%);任何回答时段落的存在率随之衰减(前一千名封禁者 64%,79/124,到五千到一万名 41%,263/640)。样本下限是前一万名;真正的长尾未被测量。
读不到的规则手册。7627 个响应网站中,883 个对一个诚实表明身份、从数据中心 IP 请求 robots.txt 的客户端返回了挑战或拒绝,经过一次 www 回退和一次礼貌重试之后。我们无法区分反机器人策略和一刀切的数据中心挑战,所以这些网站被排除在所有比率分母之外——这很可能让我们的封禁率被低估,因为最严格的网站正是我们读不到的。
例外条款。8599 个完全封禁判定中有 926 个(10.8%)把 Disallow: / 与路径级 Allow 配对。我们把这些算作封禁(默认拒绝姿态)。86 个网站运行精心策划的 GPTBot 例外。
回答时可及性。5577 个可读文件中,只有 351 个有效禁止所有回答时机器人;263 个用通配符封禁一切。
排名靠后的开放回答时兄弟。在完全封禁者中,训练机器人被封而回答时兄弟实际保持开放——多数是遗漏,不是明确允许——随排名上升:前一千名 8%(10/125),一千到五千名 22%(97/433),五千到一万名 29%(187/639)。这是缺口在扩大,不是刻意开放。(与上面 0.9% 到 4.0% 的刻意允许不同。)
验证。我们的分类器在约 1116 个真实文件体的 16740 个判定上与参考实现 robots-parser 一致率 99.24%;分歧在例外条款模式上,我们分类的是段落姿态,参考测试的是字面根 URL。几小时后对 500 个域名子样本的重新扫描显示 0.00% 的判定变动(4125 个中 0 个)。
下载完整数据集——每个域名及其逐机器人判定(matrix.jsonl)、首次观察日期(wayback.jsonl),以及完整数字备忘录——自己核对任何一行。CC BY 4.0。
常见问题(FAQ)
Cloudflare按答案付费是什么?网站主怎么应对?
Cloudflare于2026年7月推出实验性收费,AI机器人抓取页面生成回答时当场计费,x402等协议也在跟进。网站主需更新robots.txt,明确回答时抓取器的规则,而非只封训练爬虫。
为什么大多数网站的robots.txt规则已经过时?
分析1万个网站发现,38%的GPTBot规则写于2023年第四季度,之后新增规则几乎全是训练爬虫。回答时抓取器规则增长缓慢,文件成了2023年恐慌的战争纪念碑,未覆盖答案时代。
训练爬虫和回答时抓取器有什么区别?
每家AI公司通常跑两个机器人:训练爬虫批量读取网页构建模型,回答时抓取器在真人提问后拉取页面生成回答。多数网站只封了训练爬虫,却漏掉了真正影响按答案收费的回答时机器人。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



