AI 爬蟲清單與辨識
GPTBot、ClaudeBot、PerplexityBot、Google-Extended…
AI 爬蟲清單像新聞台的採訪車隊——GPTBot、ClaudeBot、PerplexityBot 各家電視台的車;認得車牌,才知道誰來採訪過你、誰被你的警衛擋在門外。
03為什麼是現在學
AI 能見度的第一步是最土的:確認 AI 引擎的爬蟲進得來。認不得它們的名字,後面所有 GEO 都無從談起。
04白話理解(對客戶簡報可直接引用)
主要名單與用途:GPTBot(OpenAI 訓練/檢索)、OAI-SearchBot(ChatGPT 搜尋)、ClaudeBot(Anthropic)、PerplexityBot、Google-Extended(Gemini 訓練——注意它不影響 Google 搜尋收錄)、CCBot(Common Crawl,多數模型的訓練底料)、Bytespider(字節)。檢查兩處:robots.txt 有沒有擋(g02)、伺服器/WAF 層有沒有擋(g05)——後者常是無聲的兇手。
05工具箱
- ▸各家官方爬蟲文件(UA 與 IP 段) — 名單會變,季度校一次
- ▸伺服器日誌 grep AI UA — 「有沒有真的來過」的事實
06怎麼做 · SOP 3 步(每步標產出物)
- 1建立 AI 爬蟲名單(UA/用途/官方文件連結)→ 爬蟲名單卡
- 2日誌抽查各家實際來訪紀錄→ 來訪基準
- 3季度校訂名單→ 校訂紀錄
07場景應用(實戰經驗)
- ◆日誌裡 GPTBot 高頻造訪但 ChatGPT 從不引用你——訪問是必要條件不是充分條件,下一步查內容的可引用性(g07–g14)。
08⚠️ 常見誤區
- ✕把訓練用與檢索用爬蟲混為一談——擋訓練(如 Google-Extended)不等於擋檢索,政策要分開想(g03)。
口訣
「先認得車牌,再談上不上新聞。」
10里程碑 · 完成標準(可驗證)
- ☐名單卡存在
- ☐來訪基準已知
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
12檢核方式與依據出處
程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。
- 🟢 官方明文OpenAI:官方爬蟲文件 ↗
- 🟢 官方明文Anthropic:ClaudeBot 說明 ↗
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。