如何檢查你的網站能否被 AI 讀取
五個可自行執行的檢查,判斷 ChatGPT、Perplexity 等生成式引擎是否讀得到你的網站內容。全部不需要付費工具。
生成式引擎能否引用你的公司,前提是它讀得到你的內容。以下五個檢查可以自行執行,全部不需要付費工具,大約十五分鐘可以完成。
一、關掉 JavaScript 之後,內容還在嗎?
這是最關鍵的一項。多數 AI 爬蟲不執行 JavaScript,因此靠前端框架動態渲染的內容,對它們等於不存在。
最直接的檢查方式是在終端機執行:
curl -s https://你的網址 | grep "你首頁的某句文案"
如果搜不到,代表那句文案並不存在於原始 HTML,而是由瀏覽器執行 JavaScript 後才生成的。AI 爬蟲看不到它。
也可以在瀏覽器按 Ctrl+U(Mac 為 Cmd+Option+U)檢視原始碼,用搜尋功能找同一句文案,效果一樣。
如果檢查不通過:解決方向是伺服器端渲染或靜態生成,讓內容在送到瀏覽器之前就已經存在於 HTML。這通常是框架層面的設定變更,不必重寫整個網站。
二、robots.txt 有沒有把 AI 爬蟲擋在門外?
開啟 https://你的網址/robots.txt,檢查是否出現以下名稱,以及它們是被允許還是被禁止:
GPTBot、OAI-SearchBot、ChatGPT-User(OpenAI)ClaudeBot、anthropic-ai(Anthropic)PerplexityBot(Perplexity)Google-Extended(Google 的 AI 產品)
不少網站在早年基於防止內容被用於模型訓練的考量,加入了封鎖規則,之後未再檢視。結果是搜尋引擎讀得到,AI 卻完全讀不到。
值得注意的是,Google-Extended 只控制 Google 的 AI 產品取用,與搜尋排名無關,封鎖它不會改善也不會損害 SEO,但會令你在 AI 概覽中缺席。
三、有沒有結構化資料?
開啟 Google Rich Results Test,輸入你的網址。這個工具會列出頁面上偵測到的結構化資料類型。
對一間公司而言,至少應有 Organization;有實體地址的應加上 LocalBusiness;服務頁應有 Service;有常見問題的應有 FAQPage。
FAQPage 特別值得處理,因為問答格式與生成式引擎的運作方式高度吻合——它要找的正是「問題對應答案」這種結構。
四、公司資料在各處是否完全一致?
生成式引擎透過跨來源的一致性來確認一間公司真實存在。檢查以下位置的公司名稱、地址、電話是否逐字相同:
- 網站頁尾與聯絡頁
- 網站的結構化資料
- Google 商家檔案
- 公司註冊資料
- 各社交平台的簡介
常見的不一致包括:地址有時寫「2 樓」有時寫「2/F」、電話有時加國碼有時不加、公司名有時有「有限公司」有時沒有。這些差異在人看來無關痛癢,但會削弱機器判斷的信心。
五、直接去問
最後一項最簡單:打開 ChatGPT 或 Perplexity,用你的潛在客戶會用的說法提問。
例如不要問「捷信通是什麼公司」,而要問「香港有哪些公司做 POS 系統開發」。前者是在測試它認不認得你的名字,後者才是真實的客戶行為。
記錄下答案中出現了哪些公司、引用了哪些來源。這就是你的基線。做完優化之後隔幾週再問一次,比較差異。
檢查之後
以上五項如果都通過,代表技術基礎沒有問題,接下來的工作重點在內容本身:是否以問題為標題、是否在開頭直接給出答案、是否包含可驗證的具體資料。
如果有幾項不通過,先處理第一項和第二項——內容讀不到的情況下,其他優化都沒有意義。
