IKENSA暫定名 · 開發預覽

CDN/WAF 誤擋 AI 爬蟲

Cloudflare 預設規則常直接擋掉

g05檢核 自動GEO / AIO在互動地圖中開啟 →

CDN 誤擋 AI 爬蟲像大樓警衛的臉部辨識把快遞員當可疑人物——你根本不知道包裹(引用機會)在一樓就被退了,還在納悶為什麼都沒人找你。

03為什麼是現在學

這是 GEO 檢測裡最常見的「無聲故障」:robots.txt 明明放行,Cloudflare 等 WAF 的 bot 防護卻在下一層把 AI 爬蟲全擋了——而且沒有任何錯誤訊息會告訴你。

04白話理解(對客戶簡報可直接引用)

Cloudflare 的 Bot Fight Mode/Super Bot Fight Mode、AI Scrapers and Crawlers 開關,以及各家 WAF 的挑戰規則,預設常把 AI 爬蟲歸類為「自動化流量」擋掉或丟 JS 挑戰(爬蟲解不了)。檢查法:看 WAF 的事件紀錄裡 AI UA 被怎麼處置;修法:為已驗證的 AI 爬蟲建立放行規則(allow rule)。

05工具箱

  • Cloudflare Security Events(或對應 WAF 紀錄) — AI UA 被 block/challenge 的證據
  • WAF 自訂規則(放行清單) — 照 g01 的名單建

06怎麼做 · SOP 3 步(每步標產出物)

  1. 1查 WAF 紀錄裡 AI 爬蟲的處置狀況誤擋證據
  2. 2建立放行規則規則更新
  3. 3兩週後回查紀錄確認放行生效驗證紀錄

07場景應用(實戰經驗)

  • 「我們 robots.txt 全開啊」但 Perplexity 永遠引用不到——WAF 紀錄一查,PerplexityBot 被 JS 挑戰擋了八個月。這一項是 GEO 健檢的必查點,也是本站快篩掃不到、要人工看 WAF 後台的半自動項。

08⚠️ 常見誤區

  • 為了放行把整個 bot 防護關掉——防護與放行是白名單關係,不是開關關係。
口訣

robots 放行只是第一關;WAF 那關要自己去看紀錄。

10里程碑 · 完成標準(可驗證)

  • WAF 紀錄已查
  • 放行規則生效
  • 回查驗證通過

學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。

12檢核方式與依據出處

程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。

依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。

← 上一節點
GSC「AI 控制」設定
下一節點 →
llms.txt 的正確定位