哪些 AI 爬虫 真的能读取你的网站?
输入一个网址,我们会像爬虫那样读取你的 robots.txt,然后给出 44 个有据可查的 AI 爬虫的判定结果:允许还是屏蔽、起决定作用的具体规则,以及屏蔽每个类别会让你付出什么代价。无需账户,不保存任何内容。
输入一个网址,输出每个爬虫的判定
输入任意页面网址
我们会先解析重定向,让检查针对真正提供你网站服务的源站运行,然后只抓取一次它的 robots.txt。
我们会评估每个有据可查的 AI 爬虫
每个爬虫的 robots 标识都会按 RFC 9309 语义与你的规则进行匹配:最长匹配获胜,通配符也计入。每条判定旁都会显示胜出的规则。
按类别解读结果
搜索索引类和助手抓取类爬虫决定 AI 答案能否看到并引用你;训练类爬虫只影响未来的模型训练。工具会把这两类决定分开呈现。
robots.txt 屏蔽能做什么,不能做什么
robots.txt 是你的网站与守规矩的爬虫之间的公开契约。屏蔽检索类爬虫会把你的页面从该引擎构建的答案中移除;屏蔽训练类爬虫只是让你的内容退出未来的模型训练。这个文件拦不住恶意行为者,但也不需要:对 AI 可见度真正重要的爬虫都会公布自己的标识并遵守规则。
为什么我们不用机器人用户代理去探测你的网站
发送伪装成 GPTBot 的请求,测的其实是你的网站如何对待假的 GPTBot,这完全是另一回事:CDN 通过公布的 IP 段来验证真实爬虫,而不是靠用户代理字符串。伪造的探测会给出笃定却错误的答案。读取 robots.txt 呈现的才是你实际发布的契约。
没人记得写下的那条屏蔽规则
AI 可见度为零最常见的原因并不是内容质量,而是多年前在 CDN 或 robots.txt 中添加的一条通用机器人规则,往往是在一次爬虫恐慌期间写下的,如今仍把每个新的 AI 爬虫都拦在门外。如果这个工具显示检索类爬虫被屏蔽,而你不记得做过这个决定,那你就找到了杠杆最大的修复项。
CDN 和防火墙层的屏蔽不会显示在这里
这个工具读取的是 robots.txt,也就是你公开发布的那一层。有些网站还会在 CDN 或防火墙层拦截机器人,这从外部看不见,并且可能与宽松的 robots.txt 相矛盾。如果你的 robots.txt 允许某个爬虫,而它的运营方仍然抓取不到你,下一步请检查你 CDN 的机器人管理设置。
关于爬虫访问权限
想看看 Citlyze 的演示? 预约演示
GPTBot 为模型训练收集内容;OAI-SearchBot 为 ChatGPT 的搜索答案建立索引,另有一个独立的用户代理会在用户实时询问某个页面时抓取它。屏蔽训练机器人不影响你的搜索可见度;屏蔽搜索与抓取代理则会把你从 ChatGPT 的答案中移除。其他厂商也存在同样的划分,这正是本工具按类别分组判定的原因。