開始 14 天免費試用,無需信用卡

哪些 AI 爬蟲 真的能讀取你的網站?

輸入一個網址,我們會像爬蟲一樣讀取你的 robots.txt,然後給出 44 個有據可查的 AI 爬蟲的判定結果:允許還是封鎖、起決定作用的具體規則,以及封鎖每個類別會讓你付出什麼代價。無需帳號,不會保存任何內容。

運作方式

輸入一個網址,輸出每個爬蟲的判定

01

輸入任一頁面網址

我們會先解析重新導向,讓檢查針對實際提供你網站服務的來源站台執行,然後只抓取一次它的 robots.txt。

02

我們會評估每個有據可查的 AI 爬蟲

每個爬蟲的 robots 識別字串都會依 RFC 9309 語義與你的規則比對:最長比對獲勝,萬用字元也計入。每條判定旁都會顯示勝出的規則。

03

依類別解讀結果

搜尋索引類與助理抓取類爬蟲決定 AI 答案能否看到並引用你;訓練類爬蟲只影響未來的模型訓練。工具會把這兩種決定分開呈現。

robots.txt 封鎖能做什麼,不能做什麼

robots.txt 是你的網站與守規矩的爬蟲之間的公開契約。封鎖檢索類爬蟲會把你的頁面從該引擎建構的答案中移除;封鎖訓練類爬蟲只是讓你的內容退出未來的模型訓練。這個檔案擋不住惡意行為者,但也不需要:對 AI 能見度真正重要的爬蟲都會公布自己的識別字串並遵守規則。

為什麼我們不用機器人使用者代理探測你的網站

發送偽裝成 GPTBot 的請求,測的其實是你的網站如何對待假的 GPTBot,這是完全不同的事:CDN 是靠公布的 IP 範圍驗證真實爬蟲,而不是使用者代理字串。偽造的探測會給出篤定卻錯誤的答案。讀取 robots.txt 呈現的才是你實際發布的契約。

沒人記得寫下的那條封鎖規則

AI 能見度為零最常見的原因並不是內容品質,而是多年前在 CDN 或 robots.txt 中加入的一條全面機器人規則,往往是在一次爬蟲恐慌期間寫下的,如今仍把每個新的 AI 爬蟲擋在門外。如果這個工具顯示檢索類爬蟲被封鎖,而你不記得做過這個決定,你就找到了槓桿最大的修正項。

CDN 與防火牆層的封鎖不會顯示在這裡

這個工具讀取的是 robots.txt,也就是你公開發布的那一層。有些網站還會在 CDN 或防火牆層攔截機器人,這從外部看不到,並且可能與寬鬆的 robots.txt 相互矛盾。如果你的 robots.txt 允許某個爬蟲,而其營運方仍然抓取不到你,下一步請檢查你 CDN 的機器人管理設定。

下一個問題

存取是第零步,能見度才是測量本身。

這個檢查工具告訴你 AI 爬蟲是否可以讀取你的網站。Citlyze 則告訴你在這之後 AI 引擎實際怎麼談論你的品牌:提及、引用與競爭對手的聲量佔比,依排程持續追蹤。

常見問題

關於爬蟲存取權限

想看看 Citlyze 的示範嗎? 預約示範

GPTBot 為模型訓練蒐集內容;OAI-SearchBot 為 ChatGPT 的搜尋答案建立索引,另有一個獨立的使用者代理會在使用者即時詢問某個頁面時抓取它。封鎖訓練機器人不影響你的搜尋能見度;封鎖搜尋與抓取代理則會把你從 ChatGPT 的答案中移除。其他廠商也有同樣的區分,這正是本工具依類別分組判定的原因。

當買家提問時,AI 會推薦你嗎?

追蹤 ChatGPT、Gemini、Perplexity、DeepSeek、字節跳動與 Grok 如何提及、引用並排序您的品牌。檢視已追蹤的回答以及需要補上的缺口。

無需信用卡