IKENSA暫定名 · 開發預覽

日誌檔分析

唯一能看到爬蟲真實行為的資料

t06檢核 半自動技術 SEO在互動地圖中開啟 →

日誌檔像店裡的監視器錄影帶——GSC 給你的是精選集,錄影帶才是完整真相:爬蟲哪天來、走了哪些貨架、在哪裡撞牆。

03為什麼是現在學

所有工具都在「推測」爬蟲行為,只有伺服器日誌記錄了「事實」。大站診斷爬取問題,日誌是唯一終審證據。

04白話理解(對客戶簡報可直接引用)

伺服器日誌記錄每一個請求:誰(user-agent)、何時、要哪頁、回了什麼碼。抓出 Googlebot 的請求做三件分析:爬了哪些區(跟你希望的一致嗎)、多少比例浪費在參數/轉址/404 上、重要頁多久被爬一次。

05工具箱

  • Screaming Frog Log File Analyser — 拖進去就能分析的入門選擇
  • 主機/CDN 的日誌匯出(Cloudflare Logs 等) — 先確認拿得到日誌——很多虛擬主機拿不到

06怎麼做 · SOP 3 步(每步標產出物)

  1. 1確認日誌來源與保留天數(目標 ≥30 天)日誌取得管道
  2. 2過濾 Googlebot(驗證 IP 反查,防假冒)爬蟲請求資料集
  3. 3三張分析表:區域分佈/浪費比例/重要頁爬取頻率日誌分析報告

07場景應用(實戰經驗)

  • 大站經典發現:日誌顯示 60% 爬取花在已 noindex 的篩選頁——robots 補擋後,新品收錄時間從兩週縮到兩天。

08⚠️ 常見誤區

  • 用 user-agent 字串就當是 Googlebot——假冒者很多,要做反向 DNS 驗證。
口訣

工具在推測,日誌是事實。

10里程碑 · 完成標準(可驗證)

  • 拿得到日誌
  • 有一份浪費比例分析
  • 重要頁爬取頻率已知

學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。

12檢核方式與依據出處

半自動:程式抓資料或客戶填表,再由系統/顧問判讀。

依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。

← 上一節點
重導向鏈與迴圈
下一節點 →
爬蟲陷阱偵測