9 月 15 日之後,「擋 AI」同「擋 Google」可能係同一個掣
Cloudflare 二〇二六年七月一日公佈,九月十五日起改爬蟲預設值 —— 擋咗 Training 嗰類,Googlebot 會一齊被擋。件事係咩、同我哋自己量到嘅爬蟲行為有咩關係。
如果你個網站係擺喺 Cloudflare 後面,你可能喺某個時候撳過一個叫「Block AI bots」嘅掣。
撳嗰陣個諗法好簡單:我唔想啲 AI 攞我啲嘢去訓練模型。呢個願望好正常。
問題係,由九月十五日開始,嗰個掣嘅意思會同你當初以為嘅唔一樣。
件事係咁嘅
Cloudflare 喺二〇二六年七月一日公佈,九月十五日起改爬蟲嘅預設值。佢哋將爬蟲分成三類:
- Search —— 收錄你嘅內容,遲啲答問題嗰陣攞出嚟用
- Agent —— 有人即時叫佢做嘢,佢就即刻上嚟攞(Cloudflare 自己舉嘅例包括
ChatGPT-User) - Training —— 攞你啲內容去訓練或者微調個模型
新嘅預設係:Training 同 Agent 喺有廣告嘅頁面預設擋住,Search 照放行。唔想要呢套預設,可以喺九月十五日之前去 Security 設定度改。
原文喺 Cloudflare 自己個 blog。
一個掣點解會擋到兩樣嘢
真正有殺傷力嗰句,喺同一篇公告入面:同時做幾件事嘅爬蟲,會按佢全部行為嚟判。 而 Search Engine Journal 將呢句解讀成「最嚴嗰條規生效」。
而 Cloudflare 自己舉嘅例,就係 Googlebot、Applebot 同 BingBot。
呢三隻一路以嚟都係一身兼兩職:又幫搜尋引擎收錄你,又攞內容去訓練。所以你揀咗擋 Training,佢哋就會一齊中招。Search Engine Journal 七月二日跟進呢單嘢嗰陣,講嘅都係同一件事。
即係話:「我唔想畀人攞去訓練」呢個決定,執行落去可能變成「順手擋埋 Google 收錄我」。
⚠️ 要老實講清楚一樣嘢:呢篇文唔會同你講你一定中招。 邊啲帳戶會被自動轉去新預設,唔同來源講法唔一致 —— Cloudflare 自己啲頁寫嘅係「新上嘅網域」,行業媒體就寫埋「未改過設定嘅免費帳戶」。我哋核實唔到邊個講法先準,所以唔會替你判斷你屬邊一類。你自己入 dashboard 撳兩下,五分鐘搞掂,準過信我。
「擋 AI」聽落係一個決定,實際上係三個。而你嗰個掣,可能唔止管住你以為嗰一個。
呢件事啱啱撞正我哋自己量緊嘅嘢
Cloudflare 呢套嘢要成立,前提係認得出邊隻爬蟲嚟緊、佢想做乜。呢件事有幾難,我哋自己個站量過。
二〇二六年九月五日,我哋用誘餌連結同時測四隻 AI。伺服器記錄收到嘅嘢差天共地:
- Claude 老老實實報
Claude-User/1.0,仲留埋一個聯絡電郵 - Gemini 個 User-Agent 得一個字:
Google - ChatGPT 報
ChatGPT-User/1.0,而且我哋兩次證實佢會避開落咗noindex嘅頁 —— 同一款頁,Claude 同 Gemini 就照攞 - Grok 出咗十一次,一次都冇報過身分。佢行 JavaScript 嗰次用嘅 User-Agent,同一個真人用 Windows Chrome 一模一樣,仲要經住宅代理出
最後嗰項對「分類」嚟講最麻煩。我哋個站淨係靠 User-Agent 認人,所以根本認唔出佢。我哋知道嗰次係 Grok,淨係因為係我哋自己親手叫佢去讀。
⚠️ 唔好由呢度推落去「所以 Cloudflare 都認唔出佢」。Cloudflare 手上嘅訊號比我哋多好多,佢認唔認得出,我哋冇量過,唔知。我哋量到嘅只有一句:淨靠 User-Agent 去認人,係唔夠嘅。
你今個星期做得到嘅四件事
- 搞清楚你個站係咪喺 Cloudflare 後面。 唔肯定就問返幫你整個站嗰位,一句就答到。
- 係嘅話,入 Security 睇下 AI 爬蟲設定而家係點,順便睇下你有冇撳過舊嗰個「Block AI bots」。
- 諗清楚你想擋嘅係邊一類。「唔想畀人攞去訓練」同「唔想 AI 答問題嗰陣引用我」係兩個好唔同嘅決定。對一間想畀人搵到嘅中小企嚟講,通常後者先係你唔想擋嗰樣。
- 睇下你有冇伺服器記錄查得到邊個嚟過。 冇嘅話,你對呢件事嘅所有判斷都係靠估 —— 包括你以為自己擋咗、或者以為自己冇擋。
最後一句要講清楚
放行咗爬蟲,唔等於 AI 就會推薦你。
擋定唔擋,決定嘅只係「佢攞唔攞得到你嘅內容」。攞到之後佢引唔引用、推唔推薦,係完全另一件事,而嗰件事冇人控制得到。任何同你講「開返畀佢就會有 AI 推薦你」嘅,都係講大咗。
我哋淨係講得出我哋量到嘅嘢。而喺量到嘅範圍之內,有一句係企得穩嘅:擋咗,就連攞都攞唔到。

