同樣是 1000 個字元,中文和英文代表的內容量不一樣。例如 Artificial Intelligence 有 23 個 characters,人工智能只有 4 個字元。以 OpenWebUI 的預設 RAG 行為來看,內容會先被切成片段,再進入後續語意檢索;如果一篇文章混合太多主題,被切出的片段也可能帶入過多語意雜訊。

AI SEO 不能只看整篇文章。頁面被搜尋到,也成功被擷取成文字之後,系統通常還要把內容切成較小的片段,再把這些片段交給後續的語意檢索。

這篇是 OpenWebUI 系列的第四篇。上一篇〈AI SEO 為什麼不只看搜尋排名:從 OpenWebUI 看網頁擷取與可存取性〉分析的是頁面能不能被成功擷取;本文接著分析擷取成功之後,文字如何被切成可檢索的內容片段。

本文的重點不是提供段落寫作 checklist,也不是說所有 AI 搜尋平台都用同一種切分規則。真正要觀察的是:當一個系統用字元上限來切分內容時,不同語言會因為字元密度不同,產生不同的片段結果。

內容被擷取後,還要被切成片段

內容切分發生在頁面擷取之後。當網頁被轉成可處理文字,系統通常不會直接把整篇文章原封不動交給模型,而是先把文字拆成較小的內容片段。

這會改變 AI SEO 的分析方式。傳統 SEO 常用整篇文章、整個 URL 或頁面主題來思考可見度;但在 RAG 流程中,後續比較的通常不是完整頁面,而是一段段被切出的內容。

因此,內容切分不是純粹的技術背景。它會影響後面哪些文字有機會被檢索、比較,最後被放進模型上下文。若某段資訊被切散,或和太多不相關內容合在同一片段裡,後續 Relevance 判斷就可能受到影響。

這不是所有 RAG 系統的通用切分方式

OpenWebUI 的預設設定提供的是一個可觀察的切分樣本,不是所有 RAG 系統的標準答案。不同 AI 搜尋平台、RAG 系統或文件處理流程,可能會用不同方式切分內容。

有些系統會用 token-based chunking,也就是用模型處理單位作為上限。有些會用 semantic chunking,嘗試按語意邊界切分。也有系統會考慮 Markdown、HTML heading、段落或文件結構,讓切分結果更接近原本內容層次。

這些方法可能比單純 character-based chunking 更能保留完整語意。因此,本文不會把 OpenWebUI 的字元切分方式寫成所有 AI 搜尋平台的通用規則。更準確的讀法是:它是一個開源、可觀察的 character-based chunking 例子。

1000 characters 在中文和英文裡不是同一件事

OpenWebUI 的預設 CHUNK_SIZE=1000 計算的是 characters,也就是字元。這不是 1000 個英文單字,也不是 1000 個 token。

對英文內容來說,1000 characters 通常大約是 150–180 words。這個範圍大概只夠容納兩到三個短段落,或一小段定義加上部分解釋。

對中文內容來說,1000 characters 就是約 1000 個中文字。中文常常可以用較少字元表達同一個概念。例如:

Artificial Intelligence = 23 characters
人工智能 = 4 characters

這個差異會讓同樣 1000 個字元,在中文和英文裡代表不同內容量。英文可能只放得下一段簡短說明;中文則可能放入更多概念、條件、例子和轉折。

這不是說中文一定比較適合 AI SEO,而是說 character-based chunking 會放大語言之間的字元密度差異。當系統用字元作為切分上限時,中文內容片段可能比英文片段承載更多資訊,也可能在主題混雜時承載更多雜訊。

為什麼同一篇文章最好維持同一主題

字元密度真正帶來的問題,不只是每個內容片段多大,而是片段裡可能混入多少不同方向的資訊。當一篇文章只圍繞同一主題展開,即使被切成多個片段,每個片段也比較容易保留相近的語意方向。

相反地,如果同一篇文章同時處理多個不相干主題,內容片段就可能混合不同問題。這種情況在中文內容中特別值得注意,因為同樣字元數可以承載更多資訊,也代表混合主題時可能帶入更多無關內容。

這不是說每篇文章只能回答一個狹窄問題,而是說文章應該有清楚的主題邊界。同一篇文章可以有多個子題,但這些子題應該服務同一個核心問題。否則,切分後的內容片段可能難以對齊單一查詢意圖。

這也解釋了為什麼 AI SEO 不能只看頁面長度。長文章不一定比較有利;如果長文章只是把多個不同主題放在同一頁,切分後的內容片段反而可能更難被判斷為相關。

內容切分如何影響 AI 引用漏斗

內容切分主要影響 Relevance。它發生在頁面被找到、成功擷取並轉成可處理文字之後。若頁面沒有被搜尋到,或內容無法被擷取,問題仍然在前面的 Discovery 階段。

當內容被切成片段後,後續語意檢索會判斷哪些片段最接近查詢。若片段本身聚焦、完整、語意方向清楚,就比較容易進入後續比較。若片段混合太多主題,或同時處理多個問題,就可能在相關性判斷中變弱。

Citation 則發生在更後面。即使一個片段被檢索出來,最後答案是否引用它,還要看它能不能支撐答案中的具體主張。因此,chunking 不是 citation 的全部原因,但它會影響哪些內容有機會進入後面的 citation 選擇。

結論:重點不是字數規則,而是語言密度和主題一致性

OpenWebUI 的內容切分流程,讓我們看到 AI SEO 的另一個中間層問題:內容被擷取之後,還會被切成較小片段,再進入語意檢索。這一步不等於所有 AI 系統都相同,但它提供了一個清楚的 character-based chunking 樣本。

在這個樣本裡,1000 characters 對英文和中文代表不同內容量。Artificial Intelligence 有 23 個 characters,人工智能 只有 4 個字元。這類差異累積起來,就會影響一個內容片段能放入多少資訊。

因此,AI SEO 不應把內容切分理解成固定字數規則。更重要的是語言密度和主題一致性:同一篇文章最好圍繞同一個核心主題,讓被切出的內容片段仍然能維持清楚方向。

下一篇會進入語意檢索。內容被切成片段後,系統還要判斷哪些片段和查詢最接近。那一步才會涉及 embedding model、語意相似度和 top-k 門檻。

References

常見問題

所有 AI 搜尋系統都用 character-based chunking 嗎?

不是。OpenWebUI 的預設設定提供一個 character-based chunking 例子,但其他 RAG 系統可能使用 token-based、semantic-based 或 heading-aware chunking。不同切分方法會產生不同內容片段。

為什麼中文 AI SEO 要注意主題一致性?

中文通常能在較少字元中表達同一個概念。例如 Artificial Intelligence 有 23 個 characters,人工智能只有 4 個字元。如果文章同時混合太多主題,同一個內容片段也可能包含更多不相關資訊,影響後續檢索和引用判斷。

下一篇

AI SEO 為什麼不只看搜尋排名:從 OpenWebUI 看頁面能不能被 AI 讀取

繼續閱讀