robots.txt 規則
擋錯一行可以讓整站消失
robots.txt 像大門口的告示牌——寫錯一行「非請勿入」,把郵差(Googlebot)也擋在外面,從此收不到任何信。
03為什麼是現在學
它是爬蟲進站讀的第一個檔案,一行 Disallow: / 就能讓整站從搜尋結果消失。威力大、語法簡單、錯了無聲——所以要最早檢查。
04白話理解(對客戶簡報可直接引用)
robots.txt 是放在網站根目錄的純文字檔,告訴爬蟲哪些路徑不要爬。它管「爬取」不管「收錄」:擋了爬取,頁面還是可能因外部連結被收錄(只是顯示不出內容)。原則:只擋真的不該爬的(後台、購物車、站內搜尋結果),並在檔案裡宣告 sitemap 位置。
05工具箱
- ▸GSC robots.txt 報告 — Google 實際讀到哪一版、有沒有解析錯誤
- ▸直接開 /robots.txt — 十秒目視檢查——很多災難用眼睛就看得到
06怎麼做 · SOP 4 步(每步標產出物)
- 1目視檢查現行 robots.txt,逐行確認每條規則的理由→ 規則註解版
- 2確認沒有誤擋 CSS/JS(會影響 Google 渲染頁面)→ 資源可存取驗證
- 3加上 Sitemap: 宣告→ robots.txt 定稿
- 4改版上線時把 robots.txt 差異比對排進檢查表→ 上線檢查表更新
07場景應用(實戰經驗)
- ◆改版事故經典款:工程師把測試站的 Disallow: / 一起部署上正式站,兩週後流量歸零才發現。
08⚠️ 常見誤區
- ✕用 robots.txt 藏敏感頁面——它是公開檔案,等於把藏寶圖貼在門口。
- ✕想讓頁面退出搜尋卻用 Disallow——擋了爬取,Google 反而讀不到頁上的 noindex,退不乾淨。
口訣
「robots 管爬不管收;要退場用 noindex,不是 Disallow。」
10里程碑 · 完成標準(可驗證)
- ☐每條規則都有理由
- ☐CSS/JS 未被誤擋
- ☐Sitemap 已宣告
- ☐上線流程含 robots 差異比對
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
11情境判斷題
要讓「已被收錄」的舊活動頁從搜尋結果消失,正確做法是?
12檢核方式與依據出處
程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。
- 🟢 官方明文Google:robots.txt 規範 ↗
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。