如何檢查你的網站能否被 AI 讀取

五個可自行執行的檢查,判斷 ChatGPT、Perplexity 等生成式引擎是否讀得到你的網站內容。全部不需要付費工具。

生成式引擎能否引用你的公司,前提是它讀得到你的內容。以下五個檢查可以自行執行,全部不需要付費工具,大約十五分鐘可以完成。

一、關掉 JavaScript 之後,內容還在嗎?

這是最關鍵的一項。多數 AI 爬蟲不執行 JavaScript,因此靠前端框架動態渲染的內容,對它們等於不存在。

最直接的檢查方式是在終端機執行:

curl -s https://你的網址 | grep "你首頁的某句文案"

如果搜不到,代表那句文案並不存在於原始 HTML,而是由瀏覽器執行 JavaScript 後才生成的。AI 爬蟲看不到它。

也可以在瀏覽器按 Ctrl+U(Mac 為 Cmd+Option+U)檢視原始碼,用搜尋功能找同一句文案,效果一樣。

如果檢查不通過:解決方向是伺服器端渲染或靜態生成,讓內容在送到瀏覽器之前就已經存在於 HTML。這通常是框架層面的設定變更,不必重寫整個網站。

二、robots.txt 有沒有把 AI 爬蟲擋在門外?

開啟 https://你的網址/robots.txt,檢查是否出現以下名稱,以及它們是被允許還是被禁止:

  • GPTBotOAI-SearchBotChatGPT-User(OpenAI)
  • ClaudeBotanthropic-ai(Anthropic)
  • PerplexityBot(Perplexity)
  • Google-Extended(Google 的 AI 產品)

不少網站在早年基於防止內容被用於模型訓練的考量,加入了封鎖規則,之後未再檢視。結果是搜尋引擎讀得到,AI 卻完全讀不到。

值得注意的是,Google-Extended 只控制 Google 的 AI 產品取用,與搜尋排名無關,封鎖它不會改善也不會損害 SEO,但會令你在 AI 概覽中缺席。

三、有沒有結構化資料?

開啟 Google Rich Results Test,輸入你的網址。這個工具會列出頁面上偵測到的結構化資料類型。

對一間公司而言,至少應有 Organization;有實體地址的應加上 LocalBusiness;服務頁應有 Service;有常見問題的應有 FAQPage

FAQPage 特別值得處理,因為問答格式與生成式引擎的運作方式高度吻合——它要找的正是「問題對應答案」這種結構。

四、公司資料在各處是否完全一致?

生成式引擎透過跨來源的一致性來確認一間公司真實存在。檢查以下位置的公司名稱、地址、電話是否逐字相同:

  • 網站頁尾與聯絡頁
  • 網站的結構化資料
  • Google 商家檔案
  • 公司註冊資料
  • 各社交平台的簡介

常見的不一致包括:地址有時寫「2 樓」有時寫「2/F」、電話有時加國碼有時不加、公司名有時有「有限公司」有時沒有。這些差異在人看來無關痛癢,但會削弱機器判斷的信心。

五、直接去問

最後一項最簡單:打開 ChatGPT 或 Perplexity,用你的潛在客戶會用的說法提問。

例如不要問「捷信通是什麼公司」,而要問「香港有哪些公司做 POS 系統開發」。前者是在測試它認不認得你的名字,後者才是真實的客戶行為。

記錄下答案中出現了哪些公司、引用了哪些來源。這就是你的基線。做完優化之後隔幾週再問一次,比較差異。

檢查之後

以上五項如果都通過,代表技術基礎沒有問題,接下來的工作重點在內容本身:是否以問題為標題、是否在開頭直接給出答案、是否包含可驗證的具體資料。

如果有幾項不通過,先處理第一項和第二項——內容讀不到的情況下,其他優化都沒有意義。

需要協助處理這些項目?

我們提供 GEO 與 SEO 服務,由網站現況診斷開始。