日誌檔分析
唯一能看到爬蟲真實行為的資料
日誌檔像店裡的監視器錄影帶——GSC 給你的是精選集,錄影帶才是完整真相:爬蟲哪天來、走了哪些貨架、在哪裡撞牆。
03為什麼是現在學
所有工具都在「推測」爬蟲行為,只有伺服器日誌記錄了「事實」。大站診斷爬取問題,日誌是唯一終審證據。
04白話理解(對客戶簡報可直接引用)
伺服器日誌記錄每一個請求:誰(user-agent)、何時、要哪頁、回了什麼碼。抓出 Googlebot 的請求做三件分析:爬了哪些區(跟你希望的一致嗎)、多少比例浪費在參數/轉址/404 上、重要頁多久被爬一次。
05工具箱
- ▸Screaming Frog Log File Analyser — 拖進去就能分析的入門選擇
- ▸主機/CDN 的日誌匯出(Cloudflare Logs 等) — 先確認拿得到日誌——很多虛擬主機拿不到
06怎麼做 · SOP 3 步(每步標產出物)
- 1確認日誌來源與保留天數(目標 ≥30 天)→ 日誌取得管道
- 2過濾 Googlebot(驗證 IP 反查,防假冒)→ 爬蟲請求資料集
- 3三張分析表:區域分佈/浪費比例/重要頁爬取頻率→ 日誌分析報告
07場景應用(實戰經驗)
- ◆大站經典發現:日誌顯示 60% 爬取花在已 noindex 的篩選頁——robots 補擋後,新品收錄時間從兩週縮到兩天。
08⚠️ 常見誤區
- ✕用 user-agent 字串就當是 Googlebot——假冒者很多,要做反向 DNS 驗證。
口訣
「工具在推測,日誌是事實。」
10里程碑 · 完成標準(可驗證)
- ☐拿得到日誌
- ☐有一份浪費比例分析
- ☐重要頁爬取頻率已知
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
12檢核方式與依據出處
半自動:程式抓資料或客戶填表,再由系統/顧問判讀。
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。