IKENSA暫定名 · 開發預覽

爬蟲陷阱偵測

無限日曆、無限篩選、Session ID

t07檢核 自動技術 SEO在互動地圖中開啟 →

爬蟲陷阱像遊樂園的鏡子迷宮——每面鏡子看起來都是新通道,爬蟲走進去就在無限反射裡耗光體力。

03為什麼是現在學

無限日曆、無限篩選組合、Session ID 進網址——這些結構會無中生有出無限網址,把爬取預算燒在不存在的內容上。

04白話理解(對客戶簡報可直接引用)

常見陷阱清單:可以無限「下一月」的日曆、篩選參數自由組合(見 a10)、網址帶 session id(每個訪客生一套網址)、相對路徑錯誤造成的遞迴(/page/page/page/)、比較功能的組合頁。解法都一樣:不該存在的模式用 robots 擋、程式端修根因。

05工具箱

  • 爬取工具(開深度上限跑一次) — 爬不完、網址越爬越長=有陷阱
  • 日誌檔 — 看爬蟲實際掉進哪個洞

06怎麼做 · SOP 3 步(每步標產出物)

  1. 1全站深爬找無限模式(網址數異常膨脹的路徑)陷阱清單
  2. 2程式端修根因(日曆設界線、session 改 cookie)修復紀錄
  3. 3robots.txt 擋殘餘模式規則更新

07場景應用(實戰經驗)

  • 訂位系統的日曆可以點到 2099 年——每一月都是一頁。加上「未來 18 個月」邊界後,爬蟲從此不再迷路。

08⚠️ 常見誤區

  • 只用 robots 擋、不修根因——內鏈還在指向陷阱,訊號持續流失。
口訣

網址會自己生網址的地方,就是陷阱。

10里程碑 · 完成標準(可驗證)

  • 深爬可正常完結
  • 無 session id 網址
  • 陷阱模式已擋

學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。

12檢核方式與依據出處

程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。

依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。

← 上一節點
日誌檔分析
下一節點 →
IndexNow 與主動提交