
OpenAI 近日在其 Publisher and Developer FAQ 釐清,任何公開網站都有機會出現在 ChatGPT 搜尋中;如希望內容能被發現、在摘要中呈現並清楚連結,網站不應封鎖 OAI-SearchBot。這不是展示或排序保證,但它把網站可見度、模型訓練與使用者主動瀏覽三種不同的設定清楚區分,值得香港 SME 的管理層理解。
OAI-SearchBot、GPTBot 與 ChatGPT-User 有甚麼不同?
OpenAI 的官方 crawler 文件列出多種 user agent,它們的用途並不相同。最常見的誤解,是把所有 OpenAI 爬蟲當作同一種權限,因而同時封鎖或同時開放,卻沒有先釐清企業想達成的目標。
OAI-SearchBot 管理 ChatGPT 搜尋可見度
OAI-SearchBot 用於在 ChatGPT 的搜尋功能中顯示網站。OpenAI 建議希望出現在搜尋結果的網站,在 robots.txt 允許這個 crawler,並確保主機或 CDN 允許其已公布的 IP 範圍。OpenAI 亦提醒,robots.txt 更新後,系統調整可能需要約 24 小時。
GPTBot 與訓練用途有關,可獨立處理
GPTBot 用於擷取可能用於改進 OpenAI 生成式 AI 基礎模型的內容。OpenAI 說明,網站擁有者可允許 OAI-SearchBot 以參與 ChatGPT 搜尋,同時封鎖 GPTBot 以表示內容不應用於這類訓練用途。兩者是獨立設定;是否選擇開放,應由企業的內容策略、授權條款與風險取向決定。
ChatGPT-User 是使用者觸發的瀏覽行為
ChatGPT-User 可在使用者要求 ChatGPT 或 Custom GPT 造訪某個頁面時出現,但不是自動網頁爬取,也不決定網站是否出現在 ChatGPT 搜尋中。OpenAI 指出,這類使用者觸發的行為未必適用 robots.txt 規則,因此網站不應把它與 OAI-SearchBot 的搜尋設定混為一談。
香港 SME 應如何設計 robots.txt 與 noindex?
先決定你要管理的是搜尋、訓練還是私密內容
公開服務頁、FAQ 與文章若希望有機會成為 ChatGPT 搜尋的來源,通常需要保持 OAI-SearchBot 可存取。若企業只想避免基礎模型訓練,應評估 GPTBot 設定,而不是一併封鎖搜尋 crawler。至於不希望在任何搜尋結果出現的測試頁、登入後資料或私密文件,應採用適合的存取控制或 noindex,而非只依賴 robots.txt。
noindex 必須讓 crawler 看得到
OpenAI 說明,若不希望被封鎖 crawler 的頁面仍以純連結和標題形式出現,可使用 noindex meta tag;但 crawler 必須能讀取頁面,才看得到這項指令。這與 Google 的一般索引原則相同:只以 robots.txt 封鎖頁面,並不一定等於網址永遠不會被發現。
不要只看「有沒有在 ChatGPT 出現」
以可核實的網站資料支援引用
ChatGPT 搜尋會使用網頁搜尋來回答需要最新資料的問題,並可附上來源連結。企業應把服務範圍、服務地區、資格、流程、聯絡方法和更新日期寫得清楚,讓讀者能核實內容。這種做法同時有助傳統搜尋、AI 搜尋與潛在客戶的採購判斷,而不是為單一平台製造無法驗證的宣稱。
在分析工具辨認 ChatGPT 轉介流量
OpenAI 指出,允許 OAI-SearchBot 的網站可在 Google Analytics 等分析平台追蹤 ChatGPT 帶來的轉介流量,因為 ChatGPT 搜尋的轉介網址會自動加入 utm_source=chatgpt.com。香港 SME 可把這個來源與登入頁、內容互動、WhatsApp 對話及合資格商機一起看,而不是把一次提及誤解為已帶來商業成果。
GEO Expert 的觀點
OpenAI 的最新說明帶來一個務實訊息:ChatGPT 搜尋可見度與模型訓練不是同一個選項。企業應先釐清內容的商業用途與授權界線,再以清晰、可公開驗證的網站內容建立搜尋基礎。只有在技術設定、內容品質與商業量度同時到位時,AI 搜尋帶來的可見度才有機會轉化為值得管理的商業訊號。