robots.txt 對 AI 爬蟲的策略
擋掉=自願退出 AI 搜尋
robots.txt 對 AI 爬蟲的規則像演唱會的媒體證發放——不發證給某家電視台,那家的晚間新聞就永遠不會出現你的畫面;這是你自己的選擇,但要是「知道後果的選擇」。
03為什麼是現在學
很多網站在 2023–24 的「反 AI 訓練」風潮中封了所有 AI 爬蟲——兩年後 AI 搜尋成了流量入口,當年的封鎖變成自願缺席。這個決定值得每年重審一次。
04白話理解(對客戶簡報可直接引用)
決策框架:你的生意需要被 AI 推薦嗎(B2B/B2C 服務、電商→幾乎都是要)?需要,就放行檢索類爬蟲(GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot);對「內容本身就是商品」的媒體/出版業,才有封鎖的正當計算。決定之後檢查 robots.txt 的實際規則與決策一致——很多站的現狀是「沒人記得為什麼擋」。
05工具箱
- ▸本站快篩的 AI 爬蟲放行檢查 — 一鍵驗證現狀
- ▸robots.txt 決策紀錄(誰決定、為什麼、何時重審) — 把「沒人記得」變「有據可查」
06怎麼做 · SOP 3 步(每步標產出物)
- 1盤點現行 robots.txt 對各 AI 爬蟲的規則→ 現狀表
- 2按生意型態做放行決策並記錄理由→ 決策紀錄
- 3年度重審→ 重審紀錄
07場景應用(實戰經驗)
- ◆接手健檢常見:前任管理員 2023 年封了全部 AI 爬蟲,老闆 2026 年問「為什麼 ChatGPT 都推薦同業不推薦我們」——答案就在 robots.txt 第三行。
08⚠️ 常見誤區
- ✕複製網路上的「封鎖 AI 爬蟲範本」不理解後果——範本作者的生意跟你的不一樣。
口訣
「擋掉=自願退出 AI 搜尋;要擋,先算清楚帳。」
10里程碑 · 完成標準(可驗證)
- ☐規則與決策一致
- ☐決策有紀錄
- ☐年度重審機制
學習者勾自己的進度;顧問勾客戶專案的交付——同一份標準,兩種用法。
12檢核方式與依據出處
程式自動判定:輸入網址,掃描引擎自己爬、自己打 API、自己判定。
依據等級決定計分權重(🟢×3/🔵×2/⚠️×1)——權重量的是「依據有多硬」, 不是「我們覺得多重要」。查無權威文件的判準,誠實標「業界慣例」。