IKENSA暫定名 · 開發預覽

AI 爬蟲清單與辨識

GPTBot、ClaudeBot、PerplexityBot、Google-Extended…

g01檢核 自動GEO / AIO在互動地圖中開啟 →

AI 爬蟲清單像新聞台的採訪車隊——GPTBot、ClaudeBot、PerplexityBot 各家電視台的車;認得車牌,才知道誰來採訪過你、誰被你的警衛擋在門外。

03為什麼是現在學

AI 能見度的第一步是最土的:確認 AI 引擎的爬蟲進得來。認不得它們的名字,後面所有 GEO 都無從談起。

04白話理解(對客戶簡報可直接引用)

主要名單與用途:GPTBot(OpenAI 訓練/檢索)、OAI-SearchBot(ChatGPT 搜尋)、ClaudeBot(Anthropic)、PerplexityBot、Google-Extended(Gemini 訓練——注意它不影響 Google 搜尋收錄)、CCBot(Common Crawl,多數模型的訓練底料)、Bytespider(字節)。檢查兩處:robots.txt 有沒有擋(g02)、伺服器/WAF 層有沒有擋(g05)——後者常是無聲的兇手。

05工具箱

  • 各家官方爬蟲文件(UA 與 IP 段) — 名單會變,季度校一次
  • 伺服器日誌 grep AI UA — 「有沒有真的來過」的事實

06怎麼做 · SOP 3 步(每步標產出物)

  1. 1建立 AI 爬蟲名單(UA/用途/官方文件連結)爬蟲名單卡
  2. 2日誌抽查各家實際來訪紀錄來訪基準
  3. 3季度校訂名單校訂紀錄

07場景應用(實戰經驗)

  • 日誌裡 GPTBot 高頻造訪但 ChatGPT 從不引用你——訪問是必要條件不是充分條件,下一步查內容的可引用性(g07–g14)。

08⚠️ 常見誤區

  • 把訓練用與檢索用爬蟲混為一談——擋訓練(如 Google-Extended)不等於擋檢索,政策要分開想(g03)。
口訣

先認得車牌,再談上不上新聞。

10里程碑 · 完成標準(可驗證)

  • 名單卡存在
  • 來訪基準已知

學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。

12檢核方式與依據出處

程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。

依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。

下一節點 →
robots.txt 對 AI 爬蟲的策略