← 返回最新 GEO 動態

平台動態

Anthropic 更新 Claude crawler 指引:香港 SME 應分開設定訓練、搜尋與使用者存取權限

Anthropic 更新 Claude crawler 指引:香港 SME 應分開設定訓練、搜尋與使用者存取權限

Anthropic 在 2026 年更新 crawler 說明,將 ClaudeBot、Claude-SearchBot 和 Claude-User 的用途分開:分別關乎可能用於模型訓練的資料、搜尋回應品質,以及使用者要求 Claude 存取網站的情境。對香港 SME 而言,robots.txt 不應只有「全部開放」或「全部封鎖」兩個選項;應按公開內容、訓練取向與客戶服務需要分別處理。

三個 Claude crawler 分別做甚麼?

Anthropic 表示,這些 crawler 會遵守 robots.txt 的不要爬取指令,並以不同 user-agent 讓網站作較細緻的控制。修改前應先理解每一個設定影響哪一種內容使用,而非只因看到 AI bot 就一律封鎖。

ClaudeBot:可能用於模型訓練的公開內容

ClaudeBot 收集可能有助改善生成式 AI 模型效用與安全性的公開內容。限制它,是表達網站未來材料不應納入 Anthropic 模型訓練資料集的偏好;這不等於網站不會在搜尋或使用者要求下被存取。

Claude-SearchBot:搜尋品質與可見度基礎

Claude-SearchBot 分析網上內容,以改善搜尋回應的關聯性與準確性。Anthropic 指出,封鎖它會阻止系統為搜尋最佳化而建立內容索引,可能減少網站在使用者搜尋結果中的可見度與資料準確度。公開服務資訊的網站應先評估有沒有理由限制它。

Claude-User:使用者要求下的網站存取

當 Claude 使用者要求查閱網站時,系統可能以 Claude-User 存取頁面。封鎖它會阻止系統按使用者查詢擷取內容,可能降低這類主動搜尋的可見度;它與自動建立搜尋索引不同,應按私密資料、登入流程及服務支援情境判斷。

香港 SME 應怎樣作出 robots.txt 決定?

先分開公開服務、受限資料與內部內容

公開服務頁、FAQ、採購問題與聯絡資料,應先考慮客戶能否從搜尋或主動查詢中取得正確資訊。內部文件、客戶資料、登入後內容或測試環境,應以存取控制或密碼保護處理;robots.txt 本身不能令敏感資料安全,也不能保證網址不被發現。

把訓練偏好與搜尋偏好分開記錄

企業可在內容政策中分別記錄是否允許 ClaudeBot、Claude-SearchBot 與 Claude-User。這比一條廣泛規則更容易向管理層與技術團隊解釋。

實作與驗證時的三個注意事項

使用正確 user-agent,並覆蓋需要控制的子網域

Anthropic 指出,封鎖特定 bot 應在網站根目錄的 robots.txt 為該 user-agent 加上 Disallow: /;不同子網域需各自設定。它亦支援非標準的 Crawl-delay,讓網站在不完全封鎖下管理爬取節奏。

不要以 IP 封鎖取代 robots.txt

Anthropic 說明,封鎖 crawler IP 未必能持續或正確完成 opt-out,還可能妨礙 crawler 讀取 robots.txt。企業可參考公開 IP 清單核實流量來源,但設定權限仍應以 robots.txt 為主要機制。

重新檢查一般搜尋的索引控制

Google 同樣提醒,robots.txt 用於管理 crawler 存取與伺服器負荷,不是保證網頁不會出現在搜尋結果。若目標是不讓私密頁被搜尋,應採用 noindex 或密碼保護;同時,為了讓 crawler 讀取 noindex,頁面不能先被 robots.txt 封鎖。

GEO Expert 的觀點

面對不同 AI 平台,重點不是盲目開放或封鎖所有 crawler,而是把內容授權、公開可見度與客戶體驗分開管理。香港 SME 應先確保核心服務資料準確、公開及可驗證,再按訓練使用取向與私密資料要求設定個別 bot,避免不必要地限制潛在客戶找到正確資訊。

資料來源

◔即時查詢