爬蟲陷阱偵測
無限日曆、無限篩選、Session ID
爬蟲陷阱像遊樂園的鏡子迷宮——每面鏡子看起來都是新通道,爬蟲走進去就在無限反射裡耗光體力。
03為什麼是現在學
無限日曆、無限篩選組合、Session ID 進網址——這些結構會無中生有出無限網址,把爬取預算燒在不存在的內容上。
04白話理解(對客戶簡報可直接引用)
常見陷阱清單:可以無限「下一月」的日曆、篩選參數自由組合(見 a10)、網址帶 session id(每個訪客生一套網址)、相對路徑錯誤造成的遞迴(/page/page/page/)、比較功能的組合頁。解法都一樣:不該存在的模式用 robots 擋、程式端修根因。
05工具箱
- ▸爬取工具(開深度上限跑一次) — 爬不完、網址越爬越長=有陷阱
- ▸日誌檔 — 看爬蟲實際掉進哪個洞
06怎麼做 · SOP 3 步(每步標產出物)
- 1全站深爬找無限模式(網址數異常膨脹的路徑)→ 陷阱清單
- 2程式端修根因(日曆設界線、session 改 cookie)→ 修復紀錄
- 3robots.txt 擋殘餘模式→ 規則更新
07場景應用(實戰經驗)
- ◆訂位系統的日曆可以點到 2099 年——每一月都是一頁。加上「未來 18 個月」邊界後,爬蟲從此不再迷路。
08⚠️ 常見誤區
- ✕只用 robots 擋、不修根因——內鏈還在指向陷阱,訊號持續流失。
口訣
「網址會自己生網址的地方,就是陷阱。」
10里程碑 · 完成標準(可驗證)
- ☐深爬可正常完結
- ☐無 session id 網址
- ☐陷阱模式已擋
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
12檢核方式與依據出處
程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。
- 🟢 官方明文Google:URL 結構問題與無限空間 ↗
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。