IKENSA暫定名 · 開發預覽

robots.txt 規則

擋錯一行可以讓整站消失

f08檢核 自動基礎建置在互動地圖中開啟 →

robots.txt 像大門口的告示牌——寫錯一行「非請勿入」,把郵差(Googlebot)也擋在外面,從此收不到任何信。

03為什麼是現在學

它是爬蟲進站讀的第一個檔案,一行 Disallow: / 就能讓整站從搜尋結果消失。威力大、語法簡單、錯了無聲——所以要最早檢查。

04白話理解(對客戶簡報可直接引用)

robots.txt 是放在網站根目錄的純文字檔,告訴爬蟲哪些路徑不要爬。它管「爬取」不管「收錄」:擋了爬取,頁面還是可能因外部連結被收錄(只是顯示不出內容)。原則:只擋真的不該爬的(後台、購物車、站內搜尋結果),並在檔案裡宣告 sitemap 位置。

05工具箱

  • GSC robots.txt 報告 — Google 實際讀到哪一版、有沒有解析錯誤
  • 直接開 /robots.txt — 十秒目視檢查——很多災難用眼睛就看得到

06怎麼做 · SOP 4 步(每步標產出物)

  1. 1目視檢查現行 robots.txt,逐行確認每條規則的理由規則註解版
  2. 2確認沒有誤擋 CSS/JS(會影響 Google 渲染頁面)資源可存取驗證
  3. 3加上 Sitemap: 宣告robots.txt 定稿
  4. 4改版上線時把 robots.txt 差異比對排進檢查表上線檢查表更新

07場景應用(實戰經驗)

  • 改版事故經典款:工程師把測試站的 Disallow: / 一起部署上正式站,兩週後流量歸零才發現。

08⚠️ 常見誤區

  • 用 robots.txt 藏敏感頁面——它是公開檔案,等於把藏寶圖貼在門口。
  • 想讓頁面退出搜尋卻用 Disallow——擋了爬取,Google 反而讀不到頁上的 noindex,退不乾淨。
口訣

robots 管爬不管收;要退場用 noindex,不是 Disallow。

10里程碑 · 完成標準(可驗證)

  • 每條規則都有理由
  • CSS/JS 未被誤擋
  • Sitemap 已宣告
  • 上線流程含 robots 差異比對

學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。

11情境判斷題

要讓「已被收錄」的舊活動頁從搜尋結果消失,正確做法是?

12檢核方式與依據出處

程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。

依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。

← 上一節點
CMS 選型與 SEO 能力
下一節點 →
XML Sitemap 生成