Googlebot 不止一个:图片、视频、新闻爬虫的 robots.txt 令牌差异
AIAI Summary (BLUF)
本文是 Google 官方关于常用抓取工具的参考文档,详细列出了 Googlebot、Googlebot Image、Googlebot Video、Googlebot News、Google StoreBot 和 Google-InspectionTool 等爬虫的 HTTP 用户代理字符串、robots.txt 令牌以及受影响的产品。技术专业人员可据此配置 robots.txt 规则,精确控制各爬虫的抓取行为。
核心洞察
这篇文章最有意思的点是:Google 把爬虫的"身份"拆得比大多数人以为的细得多。很多人只知道 GooglebotGoogle 的主要网页抓取工具,用于为 Google 搜索和其他产品抓取网页内容。它遵循 robots.txt 规则,并从 googlebot.json 中发布的 IP 范围进行抓取。,但实际上 Googlebot-Image、Googlebot-Video、Googlebot-News 各自有独立的 robots.txtA text file that instructs web crawlers which pages or files to access or ignore on a website. 令牌,你可以单独放行图片但屏蔽视频。另一个容易踩坑的地方是 Google-Extended,它压根没有独立的 User-Agent,你只能在 robots.txt 里用令牌控制,日志里根本看不出来。
Google 的常用抓取工具负责查找信息,用来构建搜索索引、执行产品特定的抓取以及做分析。它们自动抓取时始终遵循 robots.txt 规则。Google 抓取工具的常规技术属性对常用抓取工具同样适用。
常用抓取工具通常从 googlebot.json 中公布的 IP 范围发起抓取,主机名的反向 DNS 掩码匹配 crawl-***-***-***-***.googlebot.com 或 geo-crawl-***-***-***-***.geo.googlebot.com。
下面列出了常用抓取工具、HTTP 请求中显示的用户代理字符串、robots.txt 中 User-agent: 行的令牌,以及受抓取偏好设置影响的产品。有些抓取工具有多个用户代理令牌,你只需要用匹配的那一个就能应用规则。这份列表并不完整,只覆盖了比较可能出现在日志里、且我们收到过相关问题的请求者。
核心结论
Googlebot 并非单一爬虫,而是按产品拆分为多个独立令牌:Googlebot-Image、Googlebot-Video、Googlebot-News 各自拥有独立的 robots.txt 令牌,可单独放行图片而屏蔽视频。
Google-Extended 没有独立的 User-Agent 字符串,只能通过 robots.txt 令牌控制,日志中无法直接识别;它用于管理内容是否可用于训练 Gemini 模型,但不影响网站出现在 Google 搜索结果中,也不作为搜索排名信号。
Googlebot-News 同样没有单独的用户代理字符串,其抓取操作使用各种 Googlebot 用户代理字符串进行,只能通过 robots.txt 中的
Googlebot-News令牌控制。Google 常用抓取工具通常从 googlebot.json 公布的 IP 范围发起抓取,反向 DNS 主机名匹配
crawl-***-***-***-***.googlebot.com或geo-crawl-***-***-***-***.geo.googlebot.com。用户代理字符串中的 Chrome/W.X.Y.Z 为占位符,代表 Chrome 版本号且会随时间增大,日志过滤时应使用通配符而非指定确切版本号。
Googlebot
| 项目 | 内容 |
|---|---|
| HTTP 请求中的 User-Agent | 智能手机版: Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) |
桌面版: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36 |
|
极少出现:Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) 或 Googlebot/2.1 (+http://www.google.com/bot.html) |
|
| robots.txt 令牌 | Googlebot |
| robots.txt 示例 | user-agent: Googlebot / allow: /archive/1Q84 / disallow: /archive |
| 受影响的产品 | 针对 Googlebot 的抓取偏好设置会影响 Google 搜索(包括 Google 探索和所有搜索功能),以及 Google 图片、Google 视频、Google 新闻等产品。 |
Googlebot ImageGoogle 的图片抓取工具,用于抓取和索引图片,以便在 Google 图片、Google 探索、Google 视频以及 Google 搜索中显示图片、徽标和网站图标。
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | Googlebot-Image/1.0 |
| robots.txt 令牌 | Googlebot-Image 或 Googlebot |
| robots.txt 示例 | user-agent: Googlebot-Image / allow: /archive/1Q84 / disallow: /archive/moons.jpg |
| 受影响的产品 | 针对 Googlebot-Image 的抓取偏好设置会影响 Google 图片、Google 探索、Google 视频,以及 Google 搜索中显示图片、徽标和网站图标的所有功能。 |
Googlebot VideoGoogle 的视频抓取工具,用于抓取视频内容,以支持与视频相关的 Google 搜索功能和其他依赖视频的产品。
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | Googlebot-Video/1.0 |
| robots.txt 令牌 | Googlebot-Video 或 Googlebot |
| robots.txt 示例 | user-agent: Googlebot-Video / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | 针对 Googlebot-Video 的抓取偏好设置会影响与视频相关的 Google 搜索功能,以及依赖视频的其他产品。 |
Googlebot NewsGoogle 的新闻抓取工具,用于抓取新闻内容,以支持 Google 新闻产品,包括 news.google.com 和 Google 新闻应用。它没有独立的 User-Agent,使用各种 Googlebot 用户代理字符串。
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | Googlebot-news 没有单独的用户代理字符串,抓取操作使用各种 Googlebot 用户代理字符串进行。 |
| robots.txt 令牌 | Googlebot-News 或 Googlebot |
| robots.txt 示例 | user-agent: Googlebot-News / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | 针对 Googlebot-News 的抓取偏好设置会影响 Google 新闻产品,包括 news.google.com 和 Google 新闻应用。 |
Google StoreBotGoogle 的购物抓取工具,用于抓取商品信息,以支持 Google 购物的所有界面,例如 Google 搜索中的“购物”标签页和 Google 购物网站。
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | 桌面版: Mozilla/5.0 (X11; Linux x86_64; Storebot-Google/1.0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Safari/537.36 |
移动版: Mozilla/5.0 (Linux; Android 8.0; Pixel 2 Build/OPD3.170816.012; Storebot-Google/1.0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 |
|
| robots.txt 令牌 | Storebot-Google |
| robots.txt 示例 | user-agent: Storebot-Google / allow: /archive/1Q84 / disallow: /archive/konbini |
| 受影响的产品 | 针对 Storebot-Google 的抓取偏好设置会影响 Google 购物的所有界面,比如 Google 搜索中的"购物"标签页和 Google 购物。 |
Google-InspectionToolGoogle 的检查工具抓取器,用于在 Google Search Console 的网址检查工具中实时测试网址。它不会遵循 robots.txt 规则,且不会用于索引。
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | 桌面版: Mozilla/5.0 (compatible; Google-InspectionTool/1.0) |
移动版: Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Google-InspectionTool/1.0) |
|
| robots.txt 令牌 | Google-InspectionTool 或 Googlebot |
| robots.txt 示例 | user-agent: Google-InspectionTool / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | 针对 Google-InspectionTool 的抓取偏好设置会影响 Search Console 中的搜索测试工具,比如富媒体搜索结果测试和网址检查。它不影响 Google 搜索或其他产品。 |
GoogleOther
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; GoogleOther) |
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GoogleOther) Chrome/W.X.Y.Z Safari/537.36 |
|
| robots.txt 令牌 | GoogleOther |
| robots.txt 示例 | user-agent: GoogleOther / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | 针对 GoogleOther 的抓取偏好设置不影响任何特定产品。GoogleOther 是通用抓取工具,供各种产品团队抓取网站上可公开访问的内容,比如用于内部研究和开发的一次性抓取。 |
GoogleOther-Image
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | GoogleOther-Image/1.0 |
| robots.txt 令牌 | GoogleOther-Image 或 GoogleOther |
| robots.txt 示例 | user-agent: GoogleOther-Image / allow: /archive/1Q84 / disallow: /archive/moon.jpg |
| 受影响的产品 | 针对 GoogleOther-Image 的抓取偏好设置不影响任何特定产品,与 GoogleOther 类似。它是 GoogleOther 的优化版本,用于获取可公开访问的图片网址。 |
GoogleOther-Video
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | GoogleOther-Video/1.0 |
| robots.txt 令牌 | GoogleOther-Video 或 GoogleOther |
| robots.txt 示例 | user-agent: GoogleOther-Video / allow: /archive/1Q84 / disallow: /archive |
| 受影响的产品 | 针对 GoogleOther-Video 的抓取偏好设置不影响任何特定产品,与 GoogleOther 类似。它是 GoogleOther 的优化版本,用于获取可公开访问的视频网址。 |
Google-CloudVertexBot
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理子字符串 | Google-CloudVertexBot |
| robots.txt 令牌 | Google-CloudVertexBot 或 Googlebot |
| robots.txt 示例 | user-agent: Google-CloudVertexBot / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | 针对 Google-CloudVertexBot 的抓取偏好设置会影响网站所有者为构建 Vertex AI 代理而请求的抓取。它不影响 Google 搜索或其他产品。 |
Google-Extended
| 项目 | 内容 |
|---|---|
| HTTP 请求中的用户代理 | Google-Extended 没有单独的用户代理字符串。抓取操作使用现有的 Google 用户代理字符串进行,robots.txt 令牌用于控制权限。 |
| robots.txt 令牌 | Google-Extended |
| robots.txt 示例 | user-agent: Google-Extended / allow: /archive/1Q84 / disallow: /archive/ |
| 受影响的产品 | Google-Extended 是一个独立的产品令牌,网站发布商用它来管理 Google 从自己网站抓取的内容是否可用于训练未来版本的 Gemini 模型。这些模型为 Gemini 应用和 Vertex AI API for Gemini 提供支持,也用于在 Gemini 应用中(提示时将 Google 搜索索引内容提供给模型以提高真实性和相关性)以及在 Vertex AI 上使用 Google Search 时建立依据。Google-Extended 不会影响网站列入 Google 搜索结果,也不会在 Google 搜索中用作排名信号。 |
关于用户代理中的 Chrome/W.X.Y.Z 的说明
上面列表里的用户代理字符串有时会出现 Chrome/W.X.Y.Z,这里的 W.X.Y.Z 是占位符,代表该用户代理使用的 Chrome 浏览器版本,比如 41.0.2272.96。这个版本号会随时间增大,以便与 Googlebot 使用的最新 Chromium 发布版本匹配。
如果你要搜索日志或过滤服务器来查找使用这种格式的用户代理,用通配符表示版本号,别指定确切的版本号。
常见问题(FAQ)
Googlebot、Googlebot-Image、Googlebot-Video 的 robots.txt 令牌能分开设置吗?
可以。它们各自有独立令牌,如 Googlebot-Image、Googlebot-Video,你可以单独放行图片却屏蔽视频。不过这些令牌也都能用 Googlebot 统一匹配,规则会同时生效。
Google-Extended 在日志里能看到独立 User-Agent 吗?
不能。Google-Extended 压根没有独立的 User-Agent,日志里根本看不出来,你只能在 robots.txt 里用令牌控制它,无法通过请求头识别。
Googlebot-News 抓取时会用自己专属的 User-Agent 吗?
不会。Googlebot-News 没有单独的用户代理字符串,抓取操作使用各种 Googlebot 用户代理字符串进行,但 robots.txt 中可用 Googlebot-News 或 Googlebot 令牌控制。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



