過去五天我們都在幹同一件苦差事:從自己的 log 裡把 AI 爬蟲挖出來、驗明正身、看他們到底理不理 robots.txt。這套功夫很有價值,但真的很折騰人。
如果你的網站早就躲在 Cloudflare 背後,台灣其實有一大票網站都是,那裡有個現成的監視器可以先湊合著看,連一行程式都不用寫。它叫做 AI Crawl Control。它就靜靜躺在儀表板裡,免費方案就能摸得到。
今天我們就來純開箱。看看哪些方案真的能用、介面到底給你哪幾張表、怎麼打開它、當你按下「封鎖」的那一瞬間底層到底發生了什麼事,以及它跟 robots.txt 之間到底是什麼畸形關係。明天 (Day 7) 我們再來談它刻意不給你的那一半真相。
這裡描述的所有功能,狀態皆截至 2026-09-06。這個產品在過去 14 個月裡至少改版了五次,連名字都換過,你現在讀到這篇文章時,介面搞不好又長得不一樣了。文末的 evidence 表附有每一條的原始出處,一切請以官方頁面為準。
如果你在 2025 年上半年讀過相關的文章,你看到的名字會是 AI Audit。那是它最原始的樣子,定位就是單純的「稽核」。說白了就是只准你站在單向玻璃後面看,不太讓插手。
到了 2025 年 8 月 28 日,它正式改名為 AI Crawl Control 並且轉為一般供應 (GA)。官方部落格講得很漂亮,說這工具從單純的監控,演進為對 AI 系統如何存取你的內容提供細緻的洞察與控制。這絕對不是行銷部門在玩文字遊戲,是整個權力關係變了。從「你可以看」,升級成「你可以擋,甚至可以開始標價收過路費了」。
接下來它的演進節奏是這樣的:
| 時間 | 具體變動 |
|---|---|
| 2025-07-01 | Pay Per Crawl 進入 private beta 階段 |
| 2025-08-27/28 | AI Audit 改名為 AI Crawl Control 並 GA,付費方案可自訂封鎖回應 |
| 2025-10-21 | 新增 Robots.txt 分頁 |
| 2026-02-04 | 推出 GraphQL API 參考文件與 bot reference |
| 2026-02-09 | 強化分析能力,加入路徑樣式分組、導流分析、流量傳輸量 |
| 2026-04-17 | Robots.txt 分頁更名為 Directives,新增 Content Format 洞察 |
| 2026-07-01 | 三大分類 (Search、Agent、Training) 開放給全方案,並預告 9/15 預設值變更 |
最後那一列是今天最需要講清楚的未爆彈,我們留到第五節來拆。
官方文件首頁寫得很豪氣:「Available on all plans」。你用免費方案確實進得去那張表,也確實按得到封鎖鍵。
但「能用」跟「好用」是兩個完全不同的世界。官方的方案對照表,悄悄把防線切成了三個維度:
| 權限維度 | 所有方案 (含免費) | Enterprise + Bot Management |
|---|---|---|
| 偵測方式 | 靠 User agent 字串 | 靠 Bot Management detection ID |
| 分析視窗 | 最多只給 24 小時 | 可自由設定時間範圍 |
| 控制手段 | 放行 / 封鎖 | 放行 / 封鎖,外加 pay per crawl |
這三個星號,每一個都在嘲笑你手上的數據。
星號一,免費方案的警衛只認 User-Agent 字串。 文件明寫著:「On the free plan, AI Crawl Control identifies AI crawlers based on their user agent strings.」只有升級之後,才會啟用 Cloudflare Bot Management 的 detection ID 來做更嚴謹的偵測。
讀過第四天的人絕對會背脊發涼。UA 只是對方隨口胡謅的搭訕詞,免費版給你的,只是一份「自稱是 GPTBot」的報表,根本不是驗證過的真身。對於那些乖乖報上名來的大廠確實有用,但遇到那些假扮成 Chrome 的騙子,這張表完全是瞎的。
星號二,免費版只有 24 小時的記憶。 文件寫著:「On free plans, the Metrics tab only displays metrics for the past 24 hours.」
這是最痛也最陰險的閹割。AI 爬蟲根本不是天天來報到的,訓練型的爬蟲常常是兩週才來掃一次 (這是我們 Day 22 會談的題目)。對於這種兩週才露面一次的傢伙,你大約有 92% 的機率打開儀表板時,他剛好不在場 (這是 1 減去 1/14 的數學算式)。你會看著一片空白的螢幕,天真地以為天下太平。方案對照表把「可設定時間範圍」放在 Enterprise,但 Pro 或是 Business 方案的記憶到底有多長,官方文件根本沒寫死。[需補數據:Pro 或 Business 方案的 AI Crawl Control 分析視窗長度,官方文件未明寫,建議實機確認]。
星號三,導流 (referrals) 分析是被鎖在付費牆後的。 文件在 Top referrers 那段冷冷地寫著「This feature is available for customers on a paid plan.」免費用戶只看得到機器人來強取豪奪,卻無權知道 AI 平台到底有沒有把活人送過來。這件事太過致命,我們明天整篇都會繞著它轉。
點進去之後,你會看到四個房間。
Overview (總覽):這是一個活動快照,你可以用日期範圍、爬蟲名稱、營運商 (operator)、主機名稱和路徑來篩選。
Crawlers (爬蟲):這是主戰場,一列就是一隻爬蟲,欄位包含:
Metrics (指標):這裡給你細部的拆解。維度有日期、爬蟲、營運商 (像是 OpenAI、Anthropic 這層級)、狀態碼、主機名稱與路徑。裡面附有 HTTP 回應碼分佈 (2xx/3xx/4xx/5xx) 和資料傳輸量。最好用的是「最熱門路徑」,它可以用 URI 樣式來分組,像是 /blog/* 或 /api/v1/*,一眼就能看出你家哪一區被剝削得最慘。
Directives (指令):這個分頁原本叫 Robots.txt,2026 年 4 月才改名。它跨越你所有的主機名稱來追蹤 robots.txt 狀態,並且會指名道姓告訴你,到底是誰硬闖了你明確 disallow 的路徑。
這裡藏著一個巨大的判讀陷阱,文件自己都心虛地寫下來了,請務必抄在手邊:「violations are not logged in real-time, recently added or changed rules may cause previously legitimate requests to be flagged as violations.」
白話文的意思是:系統是拿你當下最新的 robots.txt,去對質他過去的請求紀錄。如果你今天心血來潮加了一條 Disallow: /pricing,他昨天合法拿走 /pricing 資料的動作,今天會全部被系統貼上違規的標籤。當你看到違規數字突然暴增時,先摸摸良心問自己最近有沒有改過規矩,再去罵那些爬蟲。
要用這個功能只有一個硬前提:你的流量必須乖乖經過 Cloudflare 的代理。官方寫的是「Make sure your domain is proxying traffic through Cloudflare」,也就是你的 DNS 紀錄必須是那朵橘雲。如果是灰雲,請求根本不會經過 Cloudflare 的邊緣節點,這張表上永遠不會有他們的影子。(橘雲跟灰雲對觀測的影響,是我們 Day 11 的重頭戲)。
步驟很簡單:
重點在於第 3 步按下去之後發生了什麼。文件寫得毫無掩飾:
「When you block a crawler in AI Crawl Control, the system creates or updates a WAF custom rule on your zone to enforce that block.」
而且,它是用同一條規則來承載你所有的封鎖怨念:「you are using one WAF custom rule to block those AI crawlers」。
這會帶來兩個很會咬人的實務後果。
第一,它會吃掉你 WAF custom rule 的珍貴配額。 免費方案的防火牆規則額度本來就緊巴巴的,你在這裡按下的封鎖,跟你在外面辛辛苦苦手寫的防火牆規則,搶的是同一個池子。
第二,這條規則會幽靈般地出現在你的 WAF 設定裡,而且不是你親手寫的。 半年後,如果有個不知情的同事在 Security 的 WAF 裡看到一條沒印象的規則,很可能會順手把它清掉。然後你的 AI 爬蟲封鎖就會默默灰飛煙滅,系統不會有任何警告,你只會看著 Crawlers 分頁裡的數字像喪屍一樣慢慢爬回來。如果你的團隊有防火牆規則的變更審查機制,請務必把這條列進白名單,並且狠狠註記它的來歷。
至於封鎖時要回傳什麼代碼?付費方案可以優雅地選擇 403 Forbidden 或者是充滿暗示的 402 Payment Required,甚至還能自訂回應內容。Cloudflare 自己給的玩法,是在 402 的內文裡附上授權聯絡方式,把冷冰冰的「擋掉」變成一門「我們來談談授權」的生意。402 這條路背後完整的 pay per crawl 生態,我們 Day 29 再來深聊。
這件事在中文圈已經被傳成各種變形版本,互相打臉。我親自去翻了原始公告,底下是官方頁面實實在在寫下來的東西。
出處是 Cloudflare 部落格的〈Your site, your rules: new AI traffic options for all customers〉(2026-07-01) 與同一天的 changelog 紀錄〈New options to manage AI traffic〉。
全新的三大分類。 Cloudflare 把 AI 流量硬生生拆成三種行為,讓你各自獨立設定:
每一類你都可以選擇:全站死鎖、只封鎖有掛廣告的頁面、或者全面放行。這個三分類的權力,開放給所有客戶,包含免費方案的窮光蛋。
9/15 到底改了什麼規矩。 官方原文是這樣寫的:
「For all new domains onboarding to Cloudflare, the categories of Training and Agent will be blocked by default on the pages that display ads, while Search will remain allowed by default.」
我們拆開來看。適用對象是「所有新搬進 Cloudflare 的網域」。被預設擋下的是 Training 和 Agent 這兩種。而且,只在有廣告的頁面上擋,不是全站封鎖。至於 Search 還是預設放行。為什麼要拿廣告來當判斷標準?Cloudflare 的解釋很粗暴:「An ad is a signal that a website owner meant for a person to land there and see it」。有掛廣告,代表站長打從心底就是要給活人看的。
那些身分曖昧、同時兼做 Search 和 Training 的混合型爬蟲,系統會「according to all of their behaviors」來判定。照它全部的行為來算,實務上的下場,就是會被新的預設值因為 Training 的那面而無情擋下。
如果你是既有客戶,而且想退出這個新預設,官方說你可以在 Security settings 裡去標記表態,期限是「any time leading up to September 15」。
這裡有一段我查不到,所以我絕對不寫。 有些二手報導信誓旦旦地說,這次的預設值也會套用到「既有客戶新增的站點」與「所有既有免費方案的客戶」。我在官方部落格與 changelog 上死都找不到這句話,官方文字只寫了 "new domains onboarding to Cloudflare"。這篇文章只採信官方版本:既有的 zone 根本不在新預設的適用範圍內。如果你的營運決策卡在這個節骨眼上,請親自去 zone 的 Security settings 確認實際狀態,別輕信任何人的轉述,包括這篇。
不過既有的 zone 確實有一件事會被動刀。 Cloudflare 的 Bots 文件裡明確警告,舊的「Block AI bots」開關將在 2026-09-15 deprecating。這個舊開關的邏輯是「封鎖被歸類為 AI 訓練用途的已驗證爬蟲,以及一些行為類似的未驗證爬蟲」,並且會「排除同時用於 Training 和 Search 的混合用途爬蟲」。如果你的網域現在是靠這個開關在死撐,9/15 之後它會被全新的三分類模型取代,擋的範圍會徹底洗牌。那些混合用途的爬蟲會從「被排除」變成「照全部行為判定」,整體方向是變得更嚴苛。
完整的檢查清單我們留到 Day 10。今天你只要記住一句話:9/15 之前,把每個 zone 的 Security settings 打開來好好看一眼。
這一區是重災區,Cloudflare 弄了三個名字聽起來超像的功能,把大家搞得暈頭轉向。
1. AI Crawl Control 裡的 Directives 分頁 = 單純的觀測。 它只負責打小報告告訴你誰違反了 robots.txt,但它絕對不執行阻擋。你在這裡看到違規數字,不代表那些傢伙被擋下了,他們照樣把你的內容搬得一乾二淨。
2. Managed robots.txt = 代管產生器。 這是 Bots 底下的另一個開關。打開之後,Cloudflare 會幫你自動產生並維護一份 robots.txt,明文叫那些已知的 AI 爬蟲滾遠一點。這個全方案都能用。預設長這樣:
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /
請看清楚那個 Allow: /。它根本不是把爬蟲擋在門外,它是全面放行,只是軟弱地標註了你對內容用途的偏好。
3. Content Signals Policy = 免費方案的預設假象。 官方是這麼解釋的:如果免費方案的網域沒有自己放 robots.txt,也沒有打開 Managed robots.txt,當爬蟲來要規矩時,會拿到 Cloudflare 塞給他的 Content Signals Policy。這份政策定義了 search、ai-input、ai-train 這三個訊號字眼,但它「does not express any specific preferences about your content」。它只是定義了詞彙,根本沒有替你表態。想要表態,你就得打開 Managed robots.txt。如果你想撕掉這張假告示,去 zone 總覽的 Control AI Crawlers 底下把它取消勾選。
所以實務上,你該問自己的殘酷問題是:你的網域現在到底向外面吐出了什麼樣的 robots.txt? 一行指令就能見真章:
curl -sS https://你的網域/robots.txt
如果你從來沒放過這檔案,又剛好用的是免費方案,吐出來的東西可能根本不是你想的 404,而是 Cloudflare 擅自幫你掛上的 Content Signals Policy。很多站長到死都不知道這件事。
這三個功能有一個共同的悲哀前提,那就是我們 Day 5 講破的現實:robots.txt 是靠對方良心自願遵守的。它只是一塊告示牌,從來就不是一扇門。Directives 分頁存在的唯一理由,就是因為這塊告示牌常常被無視,它只是在幫你計算到底有多少人把你當空氣。真正能擋人的那扇門,是 WAF 規則,也就是我們在第四節談的那個按鈕。
最後這個提醒,是我們親自用血淚踩出來的坑。
AI Crawl Control 確實是你「決定放行哪些 AI 爬蟲」的審判庭。但它絕對不是這座城堡裡唯一會對 AI 爬蟲動手的保鑣。同一個 zone 裡其他的安全開關,常常會在更外圍的階段就把爬蟲亂棍打死,而且在免費或是 Pro 方案上,這些保鑣預設都是醒著的:
我們自家網域的慘痛經驗是:當這幾個開關亮著的時候,部分的 AI 爬蟲會在碰到你自訂的任何邏輯之前,就直接被邊緣節點給蒸發了。最討厭的是,這種影響是看心情的,不是全有全無。完全取決於到底是哪個開關對上了哪一隻爬蟲。以我們的觀測,即時檢索型的 ChatGPT-User 常常能全身而退,反而是只想來要訓練資料的 GPTBot 最容易在門口被亂槍打死。所以你必須一個開關、一隻爬蟲分開來驗證,千萬別天真地以為這是一視同仁的全面封鎖。
驗證的方法只要一行:
curl -sS -o /dev/null -w '%{http_code}\n' -A "GPTBot/1.0" https://你的網域/robots.txt
如果回傳了 403,就代表他在外圍就被宰了。這時候你在 AI Crawl Control 報表上看到的「這隻爬蟲今天沒來過」根本是個謊言。他來過了,只是死在更遠的地方,死在 AI Crawl Control 有機會統計他之前。
這個坑深到值得我們單獨開一篇來談,這是 Day 9 的課題。
我們來殘酷地盤點一下,免費版到底施捨了什麼給你:
零成本、花不到五分鐘、不用寫半行程式。老實說,用這個標準來看,它的投資報酬率高得嚇人。如果你已經躲在 Cloudflare 後面,卻從來沒點開過這頁,今晚就去把它打開。
但是,那個短暫的 24 小時失憶症、那個只看名牌不看身分證的草率偵測,還有那個必須付費才能一窺究竟的導流分析,這三件事加起來,絕對會在未來的某個時刻讓你狠狠撞上一面牆:好,我看見了,然後呢?
明天 (Day 7),我們就把這面牆的輪廓畫個清楚。告訴你 AI Crawl Control 的極限到底在哪裡、有哪些痛點是它在結構上就註定回答不了的,以及當你真的渴望那些答案時,靠自己雙手補齊的血汗路線到底長什麼樣子。
本文是「你的第一本 AEO x GEO 教戰手冊」系列第 6 天。系列實測與數據由 arrivl 整理 (Growth Analytics for the Agentic Web)。