GEOZ

crawlie:首个把 GEO 审计做进爬虫的开源工具,还能让 Claude 直接改代码

2026/9/25
crawlie:首个把 GEO 审计做进爬虫的开源工具,还能让 Claude 直接改代码

AIAI Summary (BLUF)

Crawlie 是一款免费开源的 SEO 和 GEO 爬虫工具,能检查 40 多项技术问题,提供修复建议。它支持命令行和 MCP 协议,可让 AI 代理自动执行审计,适合技术 SEO 和生成式引擎优化。

核心洞察

这工具最让我意外的是它把 GEO 检查做进了爬虫里。市面上做技术 SEO 审计的工具不少,但专门针对 AI 搜索引用优化的,crawlie 是我见过的第一个开源方案。另外它的 MCP 集成意味着你可以让 Claude 直接跑审计然后自己改代码,这个工作流值得关注。


核心结论

  1. crawlie 是一个用 Rust 编写的开源网站爬虫,内置 57 条 SEO 与 GEO(Generative Engine Optimization)检查规则,采用 MIT 协议,可通过 npm i -g crawlie 全局安装。

  2. crawlie 是首个将 GEO 审计做进爬虫的开源方案,GEO 检查项包括结构化数据、语义化 HTML、答案就绪度、作者信息、内容日期、问句式标题和可提取内容块。

  3. crawlie 自带 MCP 服务器,支持 Claude Desktop、Claude Code、Cursor 等客户端接入,用户可通过自然语言指令让 AI 调用 crawl_site 和 explain_issue 工具完成审计并生成可执行修改建议。

  4. crawlie 输出 Health(技术 SEO)、GEO(AI 搜索就绪度)、Accessibility(无障碍)三个独立分数,默认最多爬取 500 个页面、并发 16 个请求,并支持 --fail-on error 参数用于 CI 管道卡点部署。

  5. 与 Screaming Frog(£259/年)和 Sitebulb(起步 £13.50/月)相比,crawlie 免费开源且独有 MCP 服务器和 GEO 审计功能,但功能深度、稳定性及大规模站点(数万页以上)爬取表现尚不及成熟商业工具。

先说这东西是干嘛的

crawlie 是一个开源的网站爬虫,用 Rust 写的。跑一遍能查出你站点上的死链、重定向、缺失的 meta 信息,还有五十多条跟 SEO 和 GEO 相关的检查项。GEO 就是 Generative Engine Optimization,说白了就是让你的页面更容易被 ChatGPT、Perplexity、Google AI Overviews 这类 AI 搜索引用。

装起来很简单:

npm i -g crawlie

macOS 用户也可以直接从 Releases 页面下签过名的 dmg 安装包。

我实际跑了一遍

拿我自己的博客试了一下,命令是这样的:

crawlie crawl https://example.com --format pretty

默认最多爬 500 个页面,并发 16 个请求。我那个小站几秒钟就跑完了。输出会给你三个分数:Health(技术 SEO)、GEO(AI 搜索就绪度)、Accessibility(无障碍)。三个分数分开算,不会混在一起。

说实话第一次跑出来的 GEO 分数比我预想的低。主要扣分在缺少结构化数据,还有几个页面的标题不是问句形式。它建议把标题改成问题式,这样 AI 搜索更容易把你的内容当作答案来引用。这个逻辑我觉得有道理,但也不是所有页面都适合改成问句,得看内容类型。

几个我觉得好用的功能

单页审计。 不想爬整站的时候直接:

crawlie audit https://example.com/pricing

生成 HTML 报告。 给客户看的时候很方便:

crawlie crawl https://example.com --format html -o report.html

生成的是一个自包含的 HTML 文件,直接发过去就能打开。

解释每条问题。 这个是我最喜欢的:

crawlie explain geo-not-answerable

它会告诉你这条规则为什么重要、怎么修、不修会怎样。不是只告诉你"这里有问题",而是把上下文都给你。

CI 集成。 加个 --fail-on error 参数,管道里跑的时候有错误就返回非零退出码,可以直接卡住部署。

MCP 和 Agent 集成

这是 crawlie 跟其他 SEO 工具拉开差距的地方。它自带一个 MCP 服务器,Claude Desktop、Claude Code、Cursor 这些支持 MCP 的客户端都能直接连。

Claude Code 用户一行命令搞定:

claude mcp add crawlie crawlie-mcp

连上之后你可以直接跟 Claude 说"爬一下我的站,告诉我提升 GEO 分数最有效的五个修改",它会调用 crawl_site 工具,拿到结构化的结果,再用 explain_issue 把每条问题变成可执行的修改建议。

我试了一下这个流程,确实能跑通。但有一点要注意:它给的建议质量取决于你的页面内容本身。如果你的页面写得就很泛,AI 也给不出什么好的优化建议。

另外还有个 Claude Code 插件可以一步装好 MCP 加技能包:

claude plugin marketplace add spronta/crawlie
claude plugin install crawlie@spronta

它检查些什么

57 条规则,大致分这几类:

技术 SEO 方面查死链、4xx/5xx、重定向链、标题和 meta 描述的缺失或重复、H1、canonical、noindex、robots.txt 屏蔽、图片 alt 缺失、薄内容、孤儿页面。

性能和安全方面查响应慢的页面、大页面、缺压缩、HTTPS、混合内容、HSTS。

无障碍方面查没有可访问名称的链接和按钮、没有标签的表单控件、缺 title 的 iframe、阻止缩放的 viewport、正数 tabindex、跳级标题。

结构化数据方面会解析 JSON-LD,对照 Google 富媒体搜索结果的要求逐项检查,包括 Product、Article、Recipe、Event、FAQ、Breadcrumb 这些类型。

JavaScript 渲染需要加 --render 参数,会用无头 Chrome 跑一遍再审计。React/Next/Vue 这类客户端渲染的站点必须加这个参数,不然爬到的都是空壳。

GEO 检查包括结构化数据、语义化 HTML、答案就绪度、作者信息、内容日期、问句式标题、可提取的内容块。

跟同类工具比

Screaming Frog 要 £259 一年才能解锁全部功能,Sitebulb 起步 £13.50 一个月。crawlie 免费开源,MIT 协议。

Screaming Frog 和 Sitebulb 都没有 MCP 服务器,也没有 GEO 审计。crawlie 有。

但公平地说,Screaming Frog 做了很多年,功能深度和稳定性是 crawlie 目前比不了的。crawlie 的桌面应用还是早期阶段,爬取大规模站点(几万页以上)的表现我还没测过。

谁做的

Sean Ryan,Pendo.io 的 Lead Marketing Engineer,业余时间给自己和同行做工具。他在 README 里说得很直白:AI 让建站变快了,但生成出来的东西大多没考虑过被搜索到。现有的 SEO 工具要么收费、要么不跟 Agent 配合、要么只告诉你哪里错了不告诉你怎么改。crawlie 想解决的就是这个问题。

值不值得试

如果你在做技术 SEO,想要一个免费的、能塞进 CI 管道的爬虫,值得花十分钟装一下试试。如果你在用 Claude 或者 Cursor 做开发,想让 AI 直接帮你审计网站,那 MCP 集成是现成的。

但别指望它替代 Screaming Frog。大规模爬取、复杂重定向链分析这些场景,成熟工具还是更稳。crawlie 的定位更像是一个轻量的、Agent 友好的补充工具。

常见问题(FAQ)

crawlie 是什么?免费吗?

crawlie 是一款用 Rust 写的免费开源 SEO 和 GEO 爬虫,MIT 协议。它能检查 40 多项技术问题并给出修复建议,支持命令行和 MCP 协议,可让 AI 代理自动执行审计。

crawlie 的 GEO 检查具体查什么?

GEO 即生成式引擎优化,目标是让页面更容易被 ChatGPT、Perplexity、Google AI Overviews 引用。crawlie 会检查结构化数据、语义化 HTML、答案就绪度、作者信息、内容日期、问句式标题和可提取内容块。

crawlie 和 Screaming Frog 比怎么样?

Screaming Frog 收费且无 MCP 和 GEO 审计,crawlie 免费开源且两者都有。但 Screaming Frog 功能深度和稳定性更强,crawlie 更适合作为轻量、Agent 友好的补充工具。

Roger深圳
本文由 Roger 审核,最后更新于 2026年9月25日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。