GEOZ

Googlebot 不止一个:图片、视频、新闻爬虫的 robots.txt 令牌差异

2026/9/21
Googlebot 不止一个:图片、视频、新闻爬虫的 robots.txt 令牌差异

AIAI Summary (BLUF)

本文是 Google 官方关于常用抓取工具的参考文档,详细列出了 Googlebot、Googlebot Image、Googlebot Video、Googlebot News、Google StoreBot 和 Google-InspectionTool 等爬虫的 HTTP 用户代理字符串、robots.txt 令牌以及受影响的产品。技术专业人员可据此配置 robots.txt 规则,精确控制各爬虫的抓取行为。

核心洞察

这篇文章最有意思的点是:Google 把爬虫的"身份"拆得比大多数人以为的细得多。很多人只知道 Googlebot,但实际上 Googlebot-Image、Googlebot-Video、Googlebot-News 各自有独立的 robots.txt 令牌,你可以单独放行图片但屏蔽视频。另一个容易踩坑的地方是 Google-Extended,它压根没有独立的 User-Agent,你只能在 robots.txt 里用令牌控制,日志里根本看不出来。


Google 的常用抓取工具负责查找信息,用来构建搜索索引、执行产品特定的抓取以及做分析。它们自动抓取时始终遵循 robots.txt 规则。Google 抓取工具的常规技术属性对常用抓取工具同样适用。

常用抓取工具通常从 googlebot.json 中公布的 IP 范围发起抓取,主机名的反向 DNS 掩码匹配 crawl-***-***-***-***.googlebot.comgeo-crawl-***-***-***-***.geo.googlebot.com

下面列出了常用抓取工具、HTTP 请求中显示的用户代理字符串、robots.txt 中 User-agent: 行的令牌,以及受抓取偏好设置影响的产品。有些抓取工具有多个用户代理令牌,你只需要用匹配的那一个就能应用规则。这份列表并不完整,只覆盖了比较可能出现在日志里、且我们收到过相关问题的请求者。

核心结论

  1. Googlebot 并非单一爬虫,而是按产品拆分为多个独立令牌:Googlebot-Image、Googlebot-Video、Googlebot-News 各自拥有独立的 robots.txt 令牌,可单独放行图片而屏蔽视频。

  2. Google-Extended 没有独立的 User-Agent 字符串,只能通过 robots.txt 令牌控制,日志中无法直接识别;它用于管理内容是否可用于训练 Gemini 模型,但不影响网站出现在 Google 搜索结果中,也不作为搜索排名信号。

  3. Googlebot-News 同样没有单独的用户代理字符串,其抓取操作使用各种 Googlebot 用户代理字符串进行,只能通过 robots.txt 中的 Googlebot-News 令牌控制。

  4. Google 常用抓取工具通常从 googlebot.json 公布的 IP 范围发起抓取,反向 DNS 主机名匹配 crawl-***-***-***-***.googlebot.comgeo-crawl-***-***-***-***.geo.googlebot.com

  5. 用户代理字符串中的 Chrome/W.X.Y.Z 为占位符,代表 Chrome 版本号且会随时间增大,日志过滤时应使用通配符而非指定确切版本号。

Googlebot

项目 内容
HTTP 请求中的 User-Agent 智能手机版: Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
桌面版: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36
极少出现:Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)Googlebot/2.1 (+http://www.google.com/bot.html)
robots.txt 令牌 Googlebot
robots.txt 示例 user-agent: Googlebot / allow: /archive/1Q84 / disallow: /archive
受影响的产品 针对 Googlebot 的抓取偏好设置会影响 Google 搜索(包括 Google 探索和所有搜索功能),以及 Google 图片、Google 视频、Google 新闻等产品。

Googlebot Image

项目 内容
HTTP 请求中的用户代理 Googlebot-Image/1.0
robots.txt 令牌 Googlebot-ImageGooglebot
robots.txt 示例 user-agent: Googlebot-Image / allow: /archive/1Q84 / disallow: /archive/moons.jpg
受影响的产品 针对 Googlebot-Image 的抓取偏好设置会影响 Google 图片、Google 探索、Google 视频,以及 Google 搜索中显示图片、徽标和网站图标的所有功能。

Googlebot Video

项目 内容
HTTP 请求中的用户代理 Googlebot-Video/1.0
robots.txt 令牌 Googlebot-VideoGooglebot
robots.txt 示例 user-agent: Googlebot-Video / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 针对 Googlebot-Video 的抓取偏好设置会影响与视频相关的 Google 搜索功能,以及依赖视频的其他产品。

Googlebot News

项目 内容
HTTP 请求中的用户代理 Googlebot-news 没有单独的用户代理字符串,抓取操作使用各种 Googlebot 用户代理字符串进行。
robots.txt 令牌 Googlebot-NewsGooglebot
robots.txt 示例 user-agent: Googlebot-News / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 针对 Googlebot-News 的抓取偏好设置会影响 Google 新闻产品,包括 news.google.com 和 Google 新闻应用。

Google StoreBot

项目 内容
HTTP 请求中的用户代理 桌面版: Mozilla/5.0 (X11; Linux x86_64; Storebot-Google/1.0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Safari/537.36
移动版: Mozilla/5.0 (Linux; Android 8.0; Pixel 2 Build/OPD3.170816.012; Storebot-Google/1.0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36
robots.txt 令牌 Storebot-Google
robots.txt 示例 user-agent: Storebot-Google / allow: /archive/1Q84 / disallow: /archive/konbini
受影响的产品 针对 Storebot-Google 的抓取偏好设置会影响 Google 购物的所有界面,比如 Google 搜索中的"购物"标签页和 Google 购物。

Google-InspectionTool

项目 内容
HTTP 请求中的用户代理 桌面版: Mozilla/5.0 (compatible; Google-InspectionTool/1.0)
移动版: Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Google-InspectionTool/1.0)
robots.txt 令牌 Google-InspectionToolGooglebot
robots.txt 示例 user-agent: Google-InspectionTool / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 针对 Google-InspectionTool 的抓取偏好设置会影响 Search Console 中的搜索测试工具,比如富媒体搜索结果测试和网址检查。它不影响 Google 搜索或其他产品。

GoogleOther

项目 内容
HTTP 请求中的用户代理 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; GoogleOther)
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GoogleOther) Chrome/W.X.Y.Z Safari/537.36
robots.txt 令牌 GoogleOther
robots.txt 示例 user-agent: GoogleOther / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 针对 GoogleOther 的抓取偏好设置不影响任何特定产品。GoogleOther 是通用抓取工具,供各种产品团队抓取网站上可公开访问的内容,比如用于内部研究和开发的一次性抓取。

GoogleOther-Image

项目 内容
HTTP 请求中的用户代理 GoogleOther-Image/1.0
robots.txt 令牌 GoogleOther-ImageGoogleOther
robots.txt 示例 user-agent: GoogleOther-Image / allow: /archive/1Q84 / disallow: /archive/moon.jpg
受影响的产品 针对 GoogleOther-Image 的抓取偏好设置不影响任何特定产品,与 GoogleOther 类似。它是 GoogleOther 的优化版本,用于获取可公开访问的图片网址。

GoogleOther-Video

项目 内容
HTTP 请求中的用户代理 GoogleOther-Video/1.0
robots.txt 令牌 GoogleOther-VideoGoogleOther
robots.txt 示例 user-agent: GoogleOther-Video / allow: /archive/1Q84 / disallow: /archive
受影响的产品 针对 GoogleOther-Video 的抓取偏好设置不影响任何特定产品,与 GoogleOther 类似。它是 GoogleOther 的优化版本,用于获取可公开访问的视频网址。

Google-CloudVertexBot

项目 内容
HTTP 请求中的用户代理子字符串 Google-CloudVertexBot
robots.txt 令牌 Google-CloudVertexBotGooglebot
robots.txt 示例 user-agent: Google-CloudVertexBot / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 针对 Google-CloudVertexBot 的抓取偏好设置会影响网站所有者为构建 Vertex AI 代理而请求的抓取。它不影响 Google 搜索或其他产品。

Google-Extended

项目 内容
HTTP 请求中的用户代理 Google-Extended 没有单独的用户代理字符串。抓取操作使用现有的 Google 用户代理字符串进行,robots.txt 令牌用于控制权限。
robots.txt 令牌 Google-Extended
robots.txt 示例 user-agent: Google-Extended / allow: /archive/1Q84 / disallow: /archive/
受影响的产品 Google-Extended 是一个独立的产品令牌,网站发布商用它来管理 Google 从自己网站抓取的内容是否可用于训练未来版本的 Gemini 模型。这些模型为 Gemini 应用和 Vertex AI API for Gemini 提供支持,也用于在 Gemini 应用中(提示时将 Google 搜索索引内容提供给模型以提高真实性和相关性)以及在 Vertex AI 上使用 Google Search 时建立依据。Google-Extended 不会影响网站列入 Google 搜索结果,也不会在 Google 搜索中用作排名信号。

关于用户代理中的 Chrome/W.X.Y.Z 的说明

上面列表里的用户代理字符串有时会出现 Chrome/W.X.Y.Z,这里的 W.X.Y.Z 是占位符,代表该用户代理使用的 Chrome 浏览器版本,比如 41.0.2272.96。这个版本号会随时间增大,以便与 Googlebot 使用的最新 Chromium 发布版本匹配。

如果你要搜索日志或过滤服务器来查找使用这种格式的用户代理,用通配符表示版本号,别指定确切的版本号。

常见问题(FAQ)

Googlebot、Googlebot-Image、Googlebot-Video 的 robots.txt 令牌能分开设置吗?

可以。它们各自有独立令牌,如 Googlebot-Image、Googlebot-Video,你可以单独放行图片却屏蔽视频。不过这些令牌也都能用 Googlebot 统一匹配,规则会同时生效。

Google-Extended 在日志里能看到独立 User-Agent 吗?

不能。Google-Extended 压根没有独立的 User-Agent,日志里根本看不出来,你只能在 robots.txt 里用令牌控制它,无法通过请求头识别。

Googlebot-News 抓取时会用自己专属的 User-Agent 吗?

不会。Googlebot-News 没有单独的用户代理字符串,抓取操作使用各种 Googlebot 用户代理字符串进行,但 robots.txt 中可用 Googlebot-News 或 Googlebot 令牌控制。

晓婷深圳
本文由 晓婷 审核,最后更新于 2026年9月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。