SEM .tw
GEO

Claude 怎麼找資料?讓 AI 助理引用你內容的做法

Claude 接觸你的內容有四條路:訓練資料、網頁搜尋、使用者貼網址、使用者上傳檔案。這篇說明每條路要注意什麼、Anthropic 的爬蟲怎麼設定,以及 Claude 偏好引用哪種內容。

7 分鐘

一家做資安顧問的 B2B 公司,業務主管在月會上提了一件事:最近三個新客戶在第一次會議時都說,他們是「請 Claude 幫忙整理零信任架構的導入步驟」時,看到回答裡引用了這家公司的白皮書,才來聯絡的。

三個客戶,說多不多,但每一個的合約金額都是七位數。老闆問我們:「這能不能複製?」

和 ChatGPT、Gemini 相比,Claude 在台灣的使用者數量沒那麼大,但使用族群很集中:工程師、顧問、研究人員、需要寫報告的專業工作者。他們用 Claude 查資料,通常不是隨便問問,而是要做決策或寫提案。對 B2B 和專業服務業來說,被 Claude 引用的價值,常常比數字看起來更高。

這篇說明 Claude 是怎麼找資料的,以及你可以做哪些調整,讓它在需要時找到並引用你的內容。

Claude 有哪幾種方式接觸到你的內容?

Claude 接觸網站內容主要有四條路:模型訓練時學到的知識、使用者開啟網頁搜尋時即時找到的頁面、使用者在對話中貼上網址請它讀取,以及使用者直接上傳的檔案。四條路的運作方式不同,要顧的重點也不同。

訓練資料決定 Claude「本來就知道什麼」。如果你的品牌或觀點在網路上被廣泛討論,Claude 不用搜尋也可能提到你,但這部分有時間落差,最新的內容不會在裡面。

網頁搜尋是目前最直接的引用來源。使用者開啟搜尋功能後,Claude 會依問題發出搜尋、閱讀結果頁面,並在回答中附上來源連結。

使用者貼網址的情境,在專業工作者之間很常見:「幫我讀這篇文章,整理成三個重點」。這時候你的頁面能不能被正確讀取,直接影響 Claude 怎麼轉述你。

使用者上傳檔案則是你的白皮書、PDF 報告被下載後,再被丟進 Claude 分析。這條路你無法控制,但可以讓檔案本身更容易被讀懂。

Claude 接觸網站內容的四條路:訓練資料、網頁搜尋、使用者貼網址讀取、使用者上傳檔案,前三條與網站設定有關

Anthropic 的三個爬蟲怎麼設定?

Anthropic 公開了三個用途不同的爬蟲,可以在 robots.txt 分別設定(名稱與用途以 Anthropic 官方最新說明為準):

爬蟲名稱 用途 擋掉的影響
ClaudeBot 蒐集可能用於模型訓練的公開網頁 未來的模型比較不會「本來就知道」你的內容
Claude-SearchBot 用於提升搜尋結果的品質 你的頁面在 Claude 搜尋中的能見度可能下降
Claude-User 使用者在對話中要求讀取網頁時使用 使用者貼你的網址,Claude 讀不到

如果你的考量是「不想讓內容被拿去訓練」,擋 ClaudeBot 就好;Claude-SearchBot 和 Claude-User 建議放行,否則等於關掉被搜尋引用和被使用者讀取的兩條路。

多數網站可以在 CMS 的 SEO 設定裡直接編輯 robots.txt,例如在後台左側選單點「SEO 設定」→「robots.txt」,在編輯區加上針對各爬蟲的規則後儲存(各平台介面不同,實際以你使用的系統為準)。改完之後,用瀏覽器打開「你的網域/robots.txt」確認內容已經生效。如果你想更完整地了解各家 AI 爬蟲的取捨,可以參考這篇 AI 爬蟲該不該擋的決策框架。

另外,有些 CDN 或主機商的防火牆會把 AI 爬蟲一律視為機器人流量擋掉。robots.txt 設對了,伺服器日誌卻完全看不到 Claude 的爬蟲,就要往這個方向查。

網站後台的 robots.txt 編輯畫面示意:左側選單點 SEO 設定下的 robots.txt,編輯區分別設定 ClaudeBot 不允許、Claude-SearchBot 與 Claude-User 允許,再按儲存

Claude 偏好引用什麼樣的內容?

從我們實際測試的經驗來看,Claude 傾向引用「說法明確、有依據、範圍清楚」的段落:有具體數字和時間、說明適用條件、區分事實與意見。籠統的口號和沒有出處的數據,比較少被拿來當引用。

這跟 Claude 的使用情境有關。專業使用者常會要求它「附上來源」「區分哪些是推測」,所以 Claude 在挑選段落時,會偏好那些自己就把條件講清楚的內容。

我們整理了幾個實用的寫法調整:

數字附上時間與範圍。 「導入後平均縮短 30% 的處理時間」不如「我們在 2025 年協助的 12 家製造業客戶中,導入後平均縮短約 30% 的處理時間」。後者一看就知道數字從哪來、適用於誰。

寫出適用條件和例外。 「這個做法適合 50 人以上、已有 IT 部門的企業;小型團隊可以先從某某步驟開始」。Claude 很常在回答裡保留這類條件,因為使用者需要知道。

定義和步驟獨立成段。 一段只講一件事,第一句就是結論。Claude 讀長頁面時,常常只擷取其中一兩段,段落要能單獨成立。

標明作者與更新日期。 誰寫的、什麼專業背景、何時更新,這些資訊讓內容更像可以引用的來源。

這些原則跟一般的 GEO 內容寫法相通,如果想看更完整的內容策略,可以延伸閱讀 GEO 內容策略教學。

同一段內容的兩種寫法:左邊只說大幅提升效率,沒有依據;右邊寫出年份、客戶數、平均縮短 30% 與適用條件,比較容易被 Claude 引用

讓頁面在被貼網址時也讀得懂

使用者貼網址請 Claude 讀取,是很多人沒想到的情境,但在 B2B 領域非常普遍。採購人員收到你的提案連結,可能第一件事就是丟給 AI 助理整理重點。

這時候常見的問題有幾個:

內容要登入或填表單才看得到。 白皮書放在填表下載的頁面後面,Claude 讀到的只有表單。我們的建議是在下載頁放一段 300 到 500 字的摘要,把核心結論寫出來,完整版再留給填表的人。

重要內容靠 JavaScript 載入。 頁面打開後要等一下才出現內容,或者要點開頁籤才看得到,讀取工具可能只拿到一個空殼。

PDF 是掃描檔或圖片。 上傳到 Claude 的 PDF 如果是整頁圖片,辨識結果常會出錯。白皮書請用文字可選取的格式輸出,標題層級也要清楚。

彈出視窗蓋住內文。 Cookie 同意視窗、訂閱電子報的蓋版廣告,有時候會讓讀取到的內容只剩下視窗上的文字。

如果你的網站有大量技術文件或產品說明,也可以考慮提供 llms.txt,替 AI 工具整理一份網站導覽,做法可以參考這篇 llms.txt 完整指南。

案例:資安顧問公司的白皮書

回到開頭那家資安顧問公司。我們檢查後發現,被 Claude 引用的是他們一篇講零信任導入步驟的部落格文章,那篇文章裡有一段寫得特別清楚:「依我們協助 20 多家企業的經驗,導入通常分四個階段,前兩個階段約需三到六個月,適用於已有 AD 帳號管理的企業」。

真正的白皮書反而沒被引用,因為它放在填表單才能下載的頁面後面。

我們做了兩件事。第一,把白皮書的六個章節各寫成一篇公開的摘要文章,每篇開頭用兩三句話講結論,並寫出數字的來源與適用條件,結尾再引導下載完整版。第二,確認 robots.txt 放行 Claude-SearchBot 和 Claude-User,同時發現 CDN 的機器人防護規則擋掉了部分 AI 爬蟲,請主機商調整。

接下來四個月,我們每月用 Claude 的搜尋功能測試 20 組資安相關問題,被引用的次數從每月 2 次增加到 7 次左右。業務那邊回報,「從 AI 助理看到你們」的新詢問累計 9 件,其中 2 件成交。白皮書的下載量也增加了,因為摘要文章本身就是下載頁的入口。

把結論藏在表單後面,Claude 只會讀到那張表單。

常見問題

Q:擋掉 ClaudeBot 之後,Claude 還能引用我的網站嗎?

可以。依照 Anthropic 的說明,ClaudeBot 主要用於訓練資料蒐集,搜尋與使用者讀取各有其他爬蟲負責。只要 Claude-SearchBot 和 Claude-User 沒有被擋,Claude 在搜尋或使用者貼網址時,仍然可以讀取並引用你的頁面。

Q:Claude 的使用者這麼少,值得特別花時間嗎?

如果你的客戶是工程師、顧問、研究人員這類專業族群,值得。而且本文提到的調整,例如段落寫清楚、內容不藏在表單後面、爬蟲正確放行,對其他 AI 助理同樣有效,不是只為 Claude 做的。

Q:要怎麼知道 Claude 有沒有引用我?

最實際的做法是準備一份問題清單,定期在 Claude 開啟網頁搜尋後實際問一輪,記錄有沒有出現你的連結。也可以在 GA4 觀察是否有來自 claude.ai 的參照流量,另外在業務詢問表單加一個「從哪裡知道我們」的選項,把 AI 助理列進去。

結語

Claude 接觸你的內容有四條路,網站經營者能直接影響的是前三條:爬蟲設定決定它能不能讀到,內容寫法決定它願不願意引用,頁面結構決定使用者貼網址時它讀得懂多少。對 B2B 和專業服務業來說,這幾個調整的成本不高,換來的是一群高價值的潛在客戶。

具體的下一步:今天就打開你的 robots.txt,確認 Claude-SearchBot 和 Claude-User 沒有被擋;接著挑一份你最重要的白皮書,替它寫一篇公開的摘要文章,把核心結論放在第一段。

下一步:完整策略 GEO 完整指南:如何讓 ChatGPT 和 Perplexity 推薦你的品牌