Citlyze 新功能:Brand FactCheck、Ask Citlyze、AI Shopping 和 Ads in AI
AI 爬虫访问检查工具

哪些 AI 爬虫 能读取你的网站?

输入一个网址,我们会像爬虫那样读取你的 robots.txt,然后给出 44 个有据可查的 AI 爬虫的判定结果:允许还是屏蔽、起决定作用的具体规则,以及屏蔽每个类别会让你付出什么代价。无需账户,不保存任何内容。

工作方式

输入一个网址,输出每个爬虫的判定

01

输入任意页面网址

我们会先解析重定向,让检查针对提供你网站服务的源站运行,然后只抓取一次它的 robots.txt。

02

我们会评估每个有据可查的 AI 爬虫

每个爬虫的 robots 标识都会按 RFC 9309 语义与你的规则进行匹配:最长匹配获胜,通配符也计入。每条判定旁都会显示胜出的规则。

03

按类别解读结果

搜索索引类和助手抓取类爬虫决定 AI 答案能否看到并引用你;训练类爬虫只影响未来的模型训练。工具会把这两类决定分开呈现。

robots.txt 屏蔽能做什么,不能做什么

robots.txt 是你的网站与守规矩的爬虫之间的公开契约。屏蔽检索类爬虫会把你的页面从该引擎构建的答案中移除;屏蔽训练类爬虫只是让你的内容退出未来的模型训练。这个文件拦不住恶意行为者,但也不需要:对 AI 可见度真正重要的爬虫都会公布自己的标识并遵守规则。

为什么我们不用机器人用户代理去探测你的网站

发送伪装成 GPTBot 的请求,测的其实是你的网站如何对待假的 GPTBot,这完全是另一回事:CDN 通过公布的 IP 段来验证真实爬虫,而不是靠用户代理字符串。伪造的探测会给出笃定却错误的答案。读取 robots.txt 呈现的才是你发布的契约。

没人记得写下的那条屏蔽规则

AI 可见度为零最常见的原因并不是内容质量,而是多年前在 CDN 或 robots.txt 中添加的一条通用机器人规则,往往是在一次爬虫恐慌期间写下的,如今仍把每个新的 AI 爬虫都拦在门外。如果这个工具显示检索类爬虫被屏蔽,而你不记得做过这个决定,那你就找到了杠杆最大的修复项。

CDN 和防火墙层的屏蔽不会显示在这里

这个工具读取的是 robots.txt,也就是你公开发布的那一层。有些网站还会在 CDN 或防火墙层拦截机器人,这从 robots.txt 的读取中完全看不见,并且可能与宽松的策略相矛盾。Citlyze 的机器人访问监控会持续以每个机器人的方式请求你的页面,因此也能看到那一层,并在有爬虫被拦截时向你发出警报。

下一个问题

访问是第零步,可见度才是测量本身。

这个检查工具告诉你 AI 爬虫是否可以读取你的网站。Citlyze 则告诉你在这之后 AI 引擎怎么谈论你的品牌:提及、引用与竞争对手的声量份额,按计划持续追踪。

常见问题

关于爬虫访问权限

想看看 Citlyze 的演示? 预约演示

GPTBot 为模型训练收集内容;OAI-SearchBot 为 ChatGPT 的搜索答案建立索引,另有一个独立的用户代理会在用户实时询问某个页面时抓取它。屏蔽训练机器人不影响你的搜索可见度;屏蔽搜索与抓取代理则会把你从 ChatGPT 的答案中移除。其他厂商也存在同样的划分,这正是本工具按类别分组判定的原因。

当买家提问时,AI 会推荐你吗?

追踪 ChatGPT、Gemini、Perplexity、DeepSeek、ByteDance、Grok、Google AI Overview & AI Mode和Bing Copilot 如何提及、引用并排序您的品牌。查看已追踪的回答以及需要弥补的缺口。

无需信用卡

一位市场负责人在窗边办公桌前用笔记本电脑阅读 AI 回答