CDN/WAF 誤擋 AI 爬蟲
Cloudflare 預設規則常直接擋掉
CDN 誤擋 AI 爬蟲像大樓警衛的臉部辨識把快遞員當可疑人物——你根本不知道包裹(引用機會)在一樓就被退了,還在納悶為什麼都沒人找你。
03為什麼是現在學
這是 GEO 檢測裡最常見的「無聲故障」:robots.txt 明明放行,Cloudflare 等 WAF 的 bot 防護卻在下一層把 AI 爬蟲全擋了——而且沒有任何錯誤訊息會告訴你。
04白話理解(對客戶簡報可直接引用)
Cloudflare 的 Bot Fight Mode/Super Bot Fight Mode、AI Scrapers and Crawlers 開關,以及各家 WAF 的挑戰規則,預設常把 AI 爬蟲歸類為「自動化流量」擋掉或丟 JS 挑戰(爬蟲解不了)。檢查法:看 WAF 的事件紀錄裡 AI UA 被怎麼處置;修法:為已驗證的 AI 爬蟲建立放行規則(allow rule)。
05工具箱
- ▸Cloudflare Security Events(或對應 WAF 紀錄) — AI UA 被 block/challenge 的證據
- ▸WAF 自訂規則(放行清單) — 照 g01 的名單建
06怎麼做 · SOP 3 步(每步標產出物)
- 1查 WAF 紀錄裡 AI 爬蟲的處置狀況→ 誤擋證據
- 2建立放行規則→ 規則更新
- 3兩週後回查紀錄確認放行生效→ 驗證紀錄
07場景應用(實戰經驗)
- ◆「我們 robots.txt 全開啊」但 Perplexity 永遠引用不到——WAF 紀錄一查,PerplexityBot 被 JS 挑戰擋了八個月。這一項是 GEO 健檢的必查點,也是本站快篩掃不到、要人工看 WAF 後台的半自動項。
08⚠️ 常見誤區
- ✕為了放行把整個 bot 防護關掉——防護與放行是白名單關係,不是開關關係。
口訣
「robots 放行只是第一關;WAF 那關要自己去看紀錄。」
10里程碑 · 完成標準(可驗證)
- ☐WAF 紀錄已查
- ☐放行規則生效
- ☐回查驗證通過
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
12檢核方式與依據出處
程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。
- 🟢 官方明文Cloudflare:AI 爬蟲管理文件 ↗
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。