返回行銷專欄

Cloudflare AI Bots Protection 會唔會令 AI 搜尋搵唔到你?

HKINT 數碼營銷團隊

許多香港網站使用 Cloudflare,但各站點的 AI 爬蟲設定並不相同,不能一概而論。Cloudflare 現時提供 AI 機械人政策及 AI Crawl Control 功能,你的網站是否已封鎖 ChatGPT、Perplexity、Google Gemini 等 AI 爬蟲,須逐一檢查自己區域的實際設定及請求日誌,方可確定 AI 爬蟲能否存取你的內容。

Engineer maintaining server network equipment

不少香港網站使用 Cloudflare,而 Cloudflare 提供針對 AI 爬蟲的封鎖政策及 AI Crawl Control 等功能。你的網站是否正在攔截 ChatGPT、Perplexity、Google Gemini 等 AI 爬蟲,取決於各個域區(zone)的實際設定及請求日誌,不能一概而論。若你的網站正在運行 Cloudflare,建議逐一檢查現時的 bot 設定與觀察到的請求,確認 AI 搜尋引擎能否抓取你的內容,否則你的 AEO 投入可能因此落空。

為何 Cloudflare 會封鎖 AI 爬蟲?

Cloudflare 現時提供針對 AI 爬蟲的封鎖功能(Block AI Bots),初衷是讓網站擁有者控制 AI 公司(如 OpenAI、Anthropic、Google DeepMind)是否可以抓取其內容用於模型訓練。啟用相關政策後,被識別為 AI 爬蟲的請求可能被 Cloudflare 邊緣節點攔截或受挑戰,令爬蟲無法正常存取頁面。實際行為請以你的域區設定及安全事件日誌為準。

問題在於:不同 AI 平台往往將「訓練」與「搜尋/引用」的爬蟲分開。以 OpenAI 為例,GPTBot 用於模型訓練,OAI-SearchBot 用於搜尋,ChatGPT-User 則處理用戶發起的即時抓取,三者的控制互相獨立。Google 搜尋及 AI 功能則依賴 Googlebot 並可於 Search Console 管理 AI 顯示設定;Google-Extended 只是 robots.txt 的控制標記,並非獨立的請求 User-Agent。因此設定時需分清各爬蟲的用途,才能同時兼顧訓練與 AI 搜尋引用。

這不是 Cloudflare 的錯誤,而是一個需要網站管理員主動檢視及決策的設定。由於不少管理員甚少檢查 bot 政策,建議定期確認各域區的實際配置,以免在不知情下攔截 AI 爬蟲。

如何在 Cloudflare Dashboard 檢查你的 AI 爬蟲設定

以下是在 Cloudflare 管理後台逐步查看現有封鎖狀態的方法:

第一步:登入 Cloudflare Dashboard 前往 dash.cloudflare.com 並選擇你要檢查的域名。

第二步:進入 Security Settings → Configure AI bot policies 在左側導航欄選擇「Security Settings」,然後點選「Configure AI bot policies」設定 AI 爬蟲政策。如需逐一檢視及控制個別爬蟲,可使用「AI Crawl Control」功能。

第三步:檢視 AI 爬蟲政策 在 Bot 設定頁面,檢視目前的 AI 爬蟲政策或 AI Crawl Control 設定,了解各個 AI 爬蟲是獲准還是被攔截,而不是只看一個全域的允許/封鎖開關。確認政策後,再逐個爬蟲及逐次請求核對實際行為。

第四步:用 Bot Analytics 及安全事件確認實際流量 在 Analytics 或安全事件記錄中篩選與 AI 爬蟲相關的請求,查看近期有多少 AI 爬蟲請求被攔截或允許。這些觀察到的請求數據,比任何靜態設定畫面更能反映封鎖的實際規模。

若你使用的是 Cloudflare 免費或 Pro 計劃,部分進階 Bot Management 功能可能受限,但基本的 AI 爬蟲封鎖政策在所有計劃均可使用;實際可用功能請以你計劃的現行說明為準。

主要 AI 爬蟲身份對照

如果你決定允許 AI 搜尋引擎抓取你的網站,建議使用供應商核實的爬蟲身份(例如官方公佈的 IP 範圍)並配合 Cloudflare 安全事件日誌驗證,而非僅憑用戶端可自行控制的 User-Agent 放行繞過 WAF。以下是已確認的主要 AI 爬蟲身份:

AI 平台爬蟲名稱用途
OpenAIOAI-SearchBotChatGPT 搜尋索引
OpenAIGPTBot模型訓練
OpenAIChatGPT-User用戶發起的即時抓取
GoogleGooglebotGoogle 搜尋及 AI 功能共用
GoogleGoogle-Extendedrobots.txt 控制標記(非獨立爬蟲)

建議在 Cloudflare WAF 的自訂規則或 AI 爬蟲政策中,只對經核實身份的 AI 爬蟲放行,而非全域關閉封鎖——這樣可以同時保留對其他惡意爬蟲的防護。切勿單憑 User-Agent 就跳過 WAF 檢查,因為 User-Agent 可被請求方任意設定。

想了解如何系統性地提升網站在 AI 搜尋中的能見度,可參考 HKINT 答案引擎優化(AEO)技術優化 的完整技術框架。

cloudflare 封鎖 ai 爬蟲點檢查:實際驗證方法

除了查看 Dashboard 設定外,你還可以用以下方法主動驗證 AI 爬蟲是否能成功存取你的網站:

方法一:模擬 User-Agent 測試 在伺服器終端使用 curl 模擬爬蟲 User-Agent: ``` curl -A "GPTBot/1.1" https://你的域名.com/ -I ``` 若返回 HTTP 200,代表該測試請求獲放行;若返回 403 或挑戰,代表被封鎖。注意:這只能證明該次測試請求的結果——User-Agent 可被偽冒,此結果並不代表真正的 AI 爬蟲已獲核實身份及存取權,亦不代表會被索引或引用。

方法二:檢查 robots.txt 前往 `https://你的域名.com/robots.txt`,確認是否有以下封鎖指令: ``` User-agent: GPTBot Disallow: / ``` 若有此設定,正規爬蟲會遵守 robots.txt 指引而不抓取。robots.txt 與 Cloudflare 的封鎖是兩個獨立層面,兩者均需要檢查。但請注意:robots.txt 只是對合規爬蟲的請求,並非保護私人或客戶數據的安全機制——機密內容必須以身份驗證(authentication)保護。

方法三:在 AI 搜尋引擎中手動測試 在 Perplexity 或 ChatGPT 中輸入:「請告訴我關於 [你的域名].com 的資訊」。若 AI 能準確引用你網站的近期內容,是一個爬蟲能夠存取的正面訊號;若只返回非常舊的資訊或完全不知道你的網站,則可能存在封鎖問題。但獲准存取只代表具引用資格,不保證一定會被引用或何時被引用。

開放 AI 爬蟲之前需要考量的事項

決定允許 AI 爬蟲前,以下幾點值得評估:

內容版權風險:允許訓練用途的爬蟲(如 OpenAI 的 GPTBot)抓取,意味着你的內容可能被用於 AI 模型訓練。以 OpenAI 為例,訓練與搜尋爬蟲身份獨立,你可以只放行搜尋類爬蟲而封鎖訓練類爬蟲;但其他服務商或會使用多功能爬蟲,須按個別服務商的控制選項權衡「被 AI 引用帶來的曝光」與「內容被用於訓練的版權問題」。

選擇性開放:你可以透過 robots.txt 只開放特定目錄給 AI 爬蟲,例如只允許抓取部落格文章,並禁止抓取客戶資料或付費內容區域。但 robots.txt 並非安全控制,任何需要保密的內容都應以身份驗證及存取權限保護,而非僅靠爬蟲指令。

分離訓練與引用:OpenAI 已將訓練與引用爬蟲分為不同身份——GPTBot(訓練)、OAI-SearchBot(搜尋)及 ChatGPT-User(用戶發起抓取)各自獨立控制,你可以在 Cloudflare 或 robots.txt 層面分別設定。其他服務商則未必如此,部分或共用同一抓取基礎設施,須查閱其自身的使用控制選項及 Cloudflare 政策規則;例如 Google-Extended 並無獨立的 HTTP 請求 User-Agent。

監控引用效果:開放後,定期使用 Cloudflare Bot Analytics 追蹤 AI 爬蟲流量,並在主要 AI 搜尋平台手動測試你的內容是否被引用,評估 AEO 的實際成效。

常見問題

Q:關掉 Cloudflare 的 AI 爬蟲封鎖會唔會令我網站更容易受到攻擊?

A:按原設計放行 AI 爬蟲與 DDoS 防護、WAF 規則、SSL 加密等核心安全功能互相獨立。但請注意,User-Agent 可被任何人偽冒——惡意方完全可以聲稱自己是 GPTBot。因此建議以供應商公佈的核實身份(如官方 IP 範圍)及 Cloudflare 安全事件日誌驗證請求真偽,而非單憑 User-Agent 放行。

Q:我冇用 Cloudflare,係咪就唔需要擔心 AI 爬蟲問題?

A:使用其他 WAF 或 CDN 服務的網站同樣可能存在類似的預設封鎖設定,例如 Akamai、Fastly、AWS CloudFront 都有各自的 Bot Management 功能。建議無論使用哪款防護服務,均應主動檢查是否有針對 AI 爬蟲的自動封鎖規則。此外,部分 WordPress 防護插件(如 Wordfence)也可能在 7G Firewall 規則集中封鎖 AI 爬蟲的 User-Agent。

Q:允許 AI 爬蟲之後,我的網站內容幾耐後會出現喺 ChatGPT 答案裏面?

A:這取決於各平台的索引更新頻率,並無保證時間表。各平台對已放行爬蟲的抓取及索引週期各有不同,放行只是令引用成為可能,實際何時被引用由平台自行決定。Google AI Overview 則依賴 Googlebot 的正常抓取週期,若你的網站已有良好的 GSC 索引覆蓋,開放後的效果會較為明顯。建議開放後配合結構化資料(Schema)優化,提升被正確引用的機率。

準備好開始網上推廣?

無論你想改善搜尋排名、投放廣告或建立新網站,歡迎與 HKINT 團隊聯絡,一起討論最適合你業務的方向。

預約諮詢