哪些 AI 爬虫 能读取你的网站?
输入一个网址,我们会像爬虫那样读取你的 robots.txt,然后给出 44 个有据可查的 AI 爬虫的判定结果:允许还是屏蔽、起决定作用的具体规则,以及屏蔽每个类别会让你付出什么代价。无需账户,不保存任何内容。
输入一个网址,输出每个爬虫的判定
输入任意页面网址
我们会先解析重定向,让检查针对提供你网站服务的源站运行,然后只抓取一次它的 robots.txt。
我们会评估每个有据可查的 AI 爬虫
每个爬虫的 robots 标识都会按 RFC 9309 语义与你的规则进行匹配:最长匹配获胜,通配符也计入。每条判定旁都会显示胜出的规则。
按类别解读结果
搜索索引类和助手抓取类爬虫决定 AI 答案能否看到并引用你;训练类爬虫只影响未来的模型训练。工具会把这两类决定分开呈现。
robots.txt 屏蔽能做什么,不能做什么
robots.txt 是你的网站与守规矩的爬虫之间的公开契约。屏蔽检索类爬虫会把你的页面从该引擎构建的答案中移除;屏蔽训练类爬虫只是让你的内容退出未来的模型训练。这个文件拦不住恶意行为者,但也不需要:对 AI 可见度真正重要的爬虫都会公布自己的标识并遵守规则。
为什么我们不用机器人用户代理去探测你的网站
发送伪装成 GPTBot 的请求,测的其实是你的网站如何对待假的 GPTBot,这完全是另一回事:CDN 通过公布的 IP 段来验证真实爬虫,而不是靠用户代理字符串。伪造的探测会给出笃定却错误的答案。读取 robots.txt 呈现的才是你发布的契约。
没人记得写下的那条屏蔽规则
AI 可见度为零最常见的原因并不是内容质量,而是多年前在 CDN 或 robots.txt 中添加的一条通用机器人规则,往往是在一次爬虫恐慌期间写下的,如今仍把每个新的 AI 爬虫都拦在门外。如果这个工具显示检索类爬虫被屏蔽,而你不记得做过这个决定,那你就找到了杠杆最大的修复项。
CDN 和防火墙层的屏蔽不会显示在这里
这个工具读取的是 robots.txt,也就是你公开发布的那一层。有些网站还会在 CDN 或防火墙层拦截机器人,这从 robots.txt 的读取中完全看不见,并且可能与宽松的策略相矛盾。Citlyze 的机器人访问监控会持续以每个机器人的方式请求你的页面,因此也能看到那一层,并在有爬虫被拦截时向你发出警报。
GPTBot 为模型训练收集内容;OAI-SearchBot 为 ChatGPT 的搜索答案建立索引,另有一个独立的用户代理会在用户实时询问某个页面时抓取它。屏蔽训练机器人不影响你的搜索可见度;屏蔽搜索与抓取代理则会把你从 ChatGPT 的答案中移除。其他厂商也存在同样的划分,这正是本工具按类别分组判定的原因。
