頁面被搜尋到,唔代表 AI 一定讀到內容。以 OpenWebUI 呢類 RAG 流程嚟睇,搜尋結果只係入口,後面仲要經過網頁擷取、文字處理同內容入庫,頁面內容先有機會進入後續比較。呢點代表 AI SEO 嘅 Discovery 唔只睇排名,仲要睇網站能唔能夠被成功擷取。
頁面被搜尋到,唔代表 AI 一定讀到內容。傳統 SEO 經常將「出現喺搜尋結果」視為可見度嘅重要門檻,但喺 AI 網頁搜尋或者 RAG 流程入面,搜尋結果只係入口。系統後面仲要成功擷取頁面、取得可用文字,再將內容送入後續處理。
呢篇係 OpenWebUI 系列嘅第三篇。上一篇〈AI SEO 點解唔可以只睇關鍵字:從 OpenWebUI 睇查詢生成〉分析咗查詢生成點樣影響 Discovery。本文接住睇下一個問題:查詢搵到頁面之後,系統能唔能夠真正取得頁面內容?
呢個問題會令 Discovery 嘅定義更精準。Discovery 唔只係頁面有冇出現喺搜尋結果,亦包括頁面能唔能夠被成功擷取成可處理內容。如果頁面被搵到,但內容無法取得,後面嘅內容切分、語意檢索同引用選擇都唔會正常發生。
被搜尋到,唔等於被成功讀取
被搜尋到只係 AI SEO 可見度嘅前半段。當系統攞到候選頁面之後,仲需要擷取頁面內容。若果擷取失敗,頁面喺流程入面仍然可能中斷。
喺 OpenWebUI 嘅網頁搜尋流程入面,外部搜尋會先搵到候選來源。之後,系統需要用 web loader 取得頁面內容,再將文字送入 RAG 流程。換句話講,搜尋結果只係令頁面有機會進入候選集合,唔代表文章內容已經俾 AI 讀到。
呢點代表「搜尋可見度」同「內容可擷取性」要分開睇。頁面出現喺搜尋結果,表示佢可能被列入候選來源;但若果擷取工具讀唔到真正內容,呢個機會就唔會進入後面嘅比較。
因此,AI SEO 嘅 Discovery 唔係單一門檻,而係一段流程。頁面要先被查詢搵到,之後要能夠被開啟、擷取、轉成可用文字,最後先會進入後續內容處理。
web loader 先決定內容能唔能夠進入後續流程
web loader 係頁面由「候選來源」變成「可處理內容」嘅關鍵步驟。OpenWebUI 喺取得搜尋結果之後,仲需要透過擷取工具開啟完整網址,移除網頁標記,並將頁面轉成純文字。
如果呢一步成功,頁面內容先會被送入後續流程。之後系統會將文字儲存到資料庫,再針對內容片段做查詢同語意檢索。若果擷取工具取得嘅係空內容、錯誤頁、登入頁或者防護頁,後續就冇真正嘅文章內容可以處理。
OpenWebUI 嘅問題排查文件亦提到,網頁搜尋可能遇到代理伺服器設定、連線逾時或者內容空白等狀況。呢啲問題唔係排名問題,而係頁面能唔能夠被順利取得嘅問題。
所以,呢一關分析嘅係可擷取性,即係頁面是否能夠被讀取。佢同傳統 SEO 嘅 crawlability 有重疊,但唔完全一樣。搜尋引擎能夠建立索引,唔代表每個 AI 網頁擷取工具都能夠喺回答當下順利取得內容。
擷取失敗唔係 Relevance failure
網頁擷取失敗唔應該被誤判成 Relevance failure。Relevance failure 指嘅係頁面內容被取回之後,喺內容片段比較入面輸畀其他來源。但如果頁面內容根本冇被成功擷取,系統仲未進入真正嘅內容比較。
呢種情況比較似 Discovery incomplete。頁面可能已經被搜尋查詢搵到,但冇成功變成可處理內容。換句話講,Discovery 行到一半中斷,而唔係內容喺相關性比較入面落敗。
呢個區分會影響診斷。若果你只見到頁面冇被引用,好容易直接判斷內容唔夠好。但喺 RAG 流程入面,仲要先確認頁面有冇被成功讀取。如果冇,問題可能係擷取失敗,而唔係文章本身唔相關。
實務上,診斷順序應該先確認網頁搜尋有冇啟用,再睇頁面有冇出現喺候選來源,之後檢查內容有冇被擷取工具取回。只有當文章內容確實進入後續處理,先適合分析內容片段是否輸畀競爭頁面。
可擷取性唔只係 robots.txt 問題
AI SEO 嘅可擷取性唔只睇 robots.txt。robots.txt 係爬蟲指令嘅一部分,但 RAG 類系統喺實際擷取頁面時,仲會受到 HTTP 狀態、網頁防護、登入要求、地區限制、逾時同前端渲染影響。
呢啲問題會出現喺搜尋結果之後。頁面可能已經被搜尋引擎索引,亦可能出現喺候選來源,但回答當下嘅擷取工具仍然讀唔到頁面內容。
Cloudflare、WAF 或其他防機器人機制如果設定太嚴,可能令擷取工具取得驗證頁、403、429、空白 HTML 或登入頁。喺呢種情況下,系統見到嘅唔係文章內容,而係防護或者錯誤頁面。
呢個唔係話網站應該放棄安全防護。更準確嘅講法係,內容團隊需要理解安全設定同 AI 可讀性之間存在張力。若果防護規則阻止一般網頁擷取工具取得內容,AI 搜尋流程可能無法將頁面送入後續比較。
不同擷取工具可能見到不同內容
不同擷取工具可能見到不同內容。OpenWebUI 嘅文件同設定顯示,網頁擷取可以受到 loader engine 影響。不同引擎對網頁標記、前端渲染內容、防護頁面同逾時嘅處理能力可能唔一樣。
呢點對高度依賴 JavaScript 嘅頁面尤其重要。若果重要內容需要前端渲染之後先出現,簡單擷取工具可能只取得不完整內容。瀏覽器自動化工具比較有機會等待頁面渲染,但亦更可能觸發防機器人機制、逾時或者資源限制。
因此,同一個網址喺不同擷取方式下可能產生不同結果。搜尋引擎見到嘅內容、使用者瀏覽器見到嘅內容,以及 RAG 擷取工具能夠取得嘅內容,唔一定完全一致。
呢點令 AI SEO 嘅 Discovery 更複雜。頁面唔係「存在」就夠,仲要能夠喺特定擷取方式下回傳可用文字。若果擷取工具攞到嘅係空白、錯誤頁或者不完整內容,後續語意檢索就無法正確比較頁面。
結論:AI SEO 要睇可搜尋,亦要睇可擷取
AI SEO 唔只睇搜尋排名,亦要睇頁面能唔能夠被成功擷取。以 OpenWebUI 呢類 RAG 流程嚟睇,搜尋結果只係入口。頁面仲要能夠被擷取工具取得、轉成可用文字,先有機會進入後續內容切分同語意檢索。
呢點會改變 Discovery 嘅判斷方式。頁面冇被引用,唔一定係內容唔相關,亦唔一定係最後引用選擇失敗。佢可能喺更早嘅位置已經中斷:被搵到,但冇被成功讀取。
下一篇會接住分析內容成功被擷取之後會發生咩事。當頁面轉成可處理文字之後,系統會將內容切成較細嘅內容片段。呢啲片段點樣被切分,會直接影響後面嘅語意檢索同引用機會。
References
- Open WebUI official website
- Open WebUI GitHub repository
- Open WebUI Web Search troubleshooting
- Open WebUI RAG documentation
常見問題
頁面出現喺搜尋結果,就代表 AI 一定讀到內容嗎?
唔一定。以 OpenWebUI 呢類 RAG 流程嚟睇,搜尋結果之後仲需要 web loader 成功擷取頁面內容。如果頁面被防火牆、防機器人機制、登入牆或者前端渲染問題擋住,後續內容切分同語意檢索可能唔會正常發生。
AI SEO 嘅 crawlability 只係睇 robots.txt 嗎?
唔係。robots.txt 只係其中一層。AI SEO 仲要考慮網頁能唔能夠被一般擷取工具取得,例如 Cloudflare、WAF、流量限制、地區限制、登入要求同前端渲染都可能影響內容擷取。