免费工具 · AI Crawler Auditor

您是否正在对 AI 敞开大门?

您的 robots.txt 默默地决定了 ChatGPT、Claude、Gemini、Perplexity 等背后的爬虫是否被允许读取您的网站。此工具会针对 2026 年的 13 个主流 AI 爬虫进行检测,并展示一个清晰的允许/拦截矩阵。该矩阵将爬虫分为三类:抓取页面以回答实时 AI 问题的爬虫、仅收集数据用于模型训练的爬虫,以及两者兼顾的爬虫。这样,您就可以分清拒绝训练与不小心将自己排除在 AI 回答之外的区别。它完全在您的浏览器中运行,无需 API key,没有任何内容会发送给我们。

定义

什么是 AI Crawler Auditor

AI Crawler Auditor 是一款免费的浏览器内工具,它能读取您网站的 robots.txt,并针对 2026 年的 13 个主流 AI 爬虫(GPTBot、OAI-SearchBot、ClaudeBot、Claude-SearchBot、PerplexityBot、Google-Extended、Googlebot、CCBot、Bytespider、Amazonbot、Amzn-SearchBot、Amzn-User 和 meta-externalagent)显示清晰的允许/拦截矩阵。它将用于抓取页面以回答实时 AI 问题的爬虫,与仅收集数据用于模型训练的爬虫区分开来(并标记出像 Amazonbot 这样两者兼具的爬虫),因此您可以清楚地看到自己是拒绝了模型训练,还是不小心将自己排除在 AI 回答之外。

它是如何 工作

输入您的域名,该工具会尝试通过 HTTPS 获取您的公开 /robots.txt。由于浏览器会拦截大多数跨域请求,如果获取失败,您只需打开您的 robots.txt 并复制粘贴进来,两种方式的分析结果是完全相同的。

所有内容都在您的设备上进行解析:我们会针对您的规则检查每个 AI 爬虫记录在册的 user-agent(合并每个匹配的 robots.txt 组,并评估通配符、末尾-$ 符号和最长匹配优先级),然后标记为允许、部分允许或拦截,并提供通俗易懂的建议。无需上传任何内容,也无需 API key。

适用于 哪些人群

适用于希望快速、隐私地了解其 robots.txt 允许了哪些 AI 爬虫进入的网站所有者、营销人员和开发人员。结果一目了然:保持允许实时检索的爬虫,这样您就能继续保持在 AI 回答中被引用的资格;而将拒绝模型训练(GPTBot、Google-Extended、CCBot 等)作为一个深思熟虑的独立决策,而不是一次意外。

实战 案例

比如某家诊所粘贴其 robots.txt 规则后,发现一条通用的 Disallow 规则拦截了 OAI-SearchBot 和 PerplexityBot,这相当于告诉这些合规的爬虫不要抓取其页面,这会在人们向 ChatGPT 或 Perplexity 寻找本地医疗服务商时,大幅降低该诊所出现的频率。(robots.txt 属于自愿遵守的指南:引擎仍可能根据之前已收录的或第三方来源提及该品牌。)该矩阵会精准显示哪些爬虫被拦截以及原因,并确认保留其 GPTBot 训练拒绝设置是没有问题的,而实时检索爬虫则应重新开放。

运行审计

谁能读取您的网站,以及您将谁拒之门外。

输入您的域名,我们将尝试获取您的 /robots.txt。浏览器通常会拦截对另一个域名文件的跨域请求,因此如果获取失败,只需打开您的 robots.txt 并粘贴进来,然后进行分析。所有内容都将在您的设备上进行解析,并与 ChatGPT、Claude、Perplexity、Google-Extended(控制 Gemini 的训练和实证,而非 AI Overviews)、Googlebot(支持 Google Search 和 AI Overviews)、Common Crawl、ByteDance、Amazon 以及 Meta 背后的官方 user-agents 进行比对。robots.txt 仅约束合规的机器人,本来就已存在于模型训练数据中的内容不论如何都会继续保留。

改为粘贴您的 robots.txt(在浏览器无法自动获取时使用)

没有任何内容被上传或存储,该文件完全在您的浏览器中进行解析。请记住: robots.txt 是自愿遵守的(表现良好的爬虫会尊重它,有些则会忽略),而且本已包含在模型训练集中的内容无论如何都会保留在内。想要有人帮您监控这些吗?与我们聊聊

常见问题

疑问,为您解答。

是的,它完全免费,无需注册,也无需 API key。它能读取您的 robots.txt 规则,并显示您允许或拦截了哪些 AI 爬虫。

不会。该工具完全在您的浏览器中运行。无论您是输入域名还是粘贴 robots.txt,解析都在您的设备本地完成,我们绝不会上传、记录或存储这些内容。

出于安全考虑,浏览器会拦截大多数指向其他域名文件的跨站请求,因此直接抓取您的 robots.txt 往往会失败。遇到这种情况,您可以打开自己的 robots.txt,复制内容并粘贴进来,工具会以完全相同的方式进行分析。

它会检测 2026 年主流 AI 爬虫已公开记录的 user-agent,包括 GPTBot 与 OAI-SearchBot(OpenAI)、ClaudeBot 与 Claude-SearchBot(Anthropic)、PerplexityBot、Google-Extended 与 Googlebot(Google)、CCBot(Common Crawl)、Bytespider(ByteDance)、Amazonbot、Amzn-SearchBot 与 Amzn-User(Amazon),以及 meta-externalagent(Meta)。

训练类爬虫(如 GPTBot、ClaudeBot、Google-Extended、CCBot)采集的数据可能被用于训练模型。搜索检索类爬虫(如 OAI-SearchBot、Claude-SearchBot、PerplexityBot)则是抓取页面来实时回答用户提问。也有一些爬虫两者兼做,例如 Amazonbot。拦截检索类爬虫会让您当下就从 AI 答案中消失;而只拦截训练类爬虫,则是另一种同样合理的退出选择。

不控制。Google-Extended 只决定您的内容能否用于 Gemini 的模型训练和答案依据(grounding)。AI Overviews 依托的是标准 Googlebot 索引,因此拦截 Google-Extended 不会让您从 AI Overviews 中消失,允许它也不会把您加进去。

不能。它给出的是站点层面将 robots.txt 与已公开 user-agent 逐一比对的结果。robots.txt 靠自愿遵守,路径级规则仍可能限制部分栏目,爬虫本身也会变动;而已经进入模型训练数据的内容,无论如何都会留在那里。

想把您的 AI 爬虫权限一次配置到位?