For the complete documentation index, see llms.txt. This page is also available as Markdown.

文件解析同 OCR

知識庫只可以檢索已經解析出嚟嘅文字。掃描 PDF、雙欄論文、複雜表格同圖片型頁面,先將正文解析正確,再調整模型同召回參數。

判斷解析係咪合格,唔睇「導入成功」四隻字,而係睇正文順序、關鍵表格、金額日期同掃描文字可唔可以正確讀到。

先判斷資料類型

資料類型
推薦起點
必查內容

Markdown、TXT、HTML

預設讀取

標題層級、編碼、換行

可複製文字嘅 PDF、DOCX、PPTX

先用預設處理

段落順序、頁眉頁腳、表格

掃描 PDF、截圖、圖片型頁面

本地或系統 OCR

識別語言、金額、日期、編號

多欄、公式或複雜表格 PDF

專用文檔處理器

閱讀順序、表格結構、腳註

解析喺檢索鏈路入面嘅位置

资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图
解析錯誤會繼續傳到分塊同召回;下游模型無法恢復已經喺正文入面遺失嘅內容。

配置並驗收一份樣本文檔

1

1. 選擇代表性樣本

唔好先導入成批資料。揀一份最能暴露問題嘅文檔,例如帶表格嘅掃描 PDF 或雙欄說明書。

2

2. 配置處理能力

打開【設定】→【文檔處理】,按需要配置文檔解析服務同 OCR。雲端服務通常需要 API Key 或服務地址;本地能力可能需要先下載模型。

文档处理设置中的文件解析与 OCR 服务配置
先將要用嘅服務配置到可用狀態,再返去知識庫揀處理器。
3

3. 導入並等待就緒

將樣本文檔加入知識庫。處理完成後打開正文,檢查標題、段落、頁碼、表格同 OCR 文字。

4

4. 檢查 Chunks

確認關鍵條件同結論冇被拆散;頁眉、頁腳同目錄唔好大量重複佔用片段。

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
正文正確之後再檢查分塊;解析錯誤唔可以靠加大 Chunk 修復。
5

5. 用真實問題復測

喺【召回測試】入面輸入一個答案喺該文檔之中嘅問題。結果應該包含正確來源、完整條件同關鍵數字。

6

6. 固定方案再批量導入

樣本合格之後,再將同類型資料分批導入。處理器、OCR 或分塊設定改變後,對舊資料執行【重新索引】並重複測試。

處理器同 OCR 點揀

適用情況
優點
注意事項

預設讀取

文本型常見格式

配置少、速度快

複雜排版同掃描頁可能會漏內容

System OCR

系統支援而且圖片清晰

唔使額外 API Key、速度快

準確率取決於操作系統、語言同圖像質量

本地 PaddleOCR

需要離線識別

文檔唔會離開本機

首次使用前需要下載本地模型

雲端或自託管處理器

雙欄、複雜表格、公式較多

版面分析能力通常更強

雲端方案會接收用嚟處理嘅文檔內容

典型問題點樣定位

表現
先檢查
處理方向

正文為空或者好短

文件係咪掃描件

啟用 OCR 或更換處理器

雙欄文字交錯

正文閱讀順序

使用擅長版面分析嘅處理器

表格變成零散文字

表頭、行列關係

更換處理器,或者將關鍵規則整理成 Markdown 筆記

頁眉頁腳反覆出現

Chunks 入面嘅重複噪聲

清理源文件或者換解析器,唔好只係提高 Top K

OCR 數字出錯

金額、日期、編號

提高圖像清晰度並人工核對高風險欄位

配置說明

配置項
推薦起點
幾時調整
調整後動作

文件處理器

先用預設處理

正文錯序、表格遺失、掃描頁為空

重新索引樣本文檔

OCR

清晰掃描件優先本地或系統能力

圖片型頁面冇文字或者錯字好多

重新索引並核對關鍵字段

Chunk 大小同重疊

先保留知識庫預設設定

條件同結論被切開

每輪只改一項並重新索引

驗收問題

3~5 個真實問題

更換處理器、OCR 或分塊後

使用同一問題集比較

用戶案例

小林導入咗一份雙欄差旅制度 PDF。狀態已經就緒,但正文將左右兩欄交錯埋一齊,召回結果入面嘅審批條件亦都唔完整。佢冇先調高 Top K,而係改用更適合版面分析嘅處理器,重新索引同一份文件,再檢查正文同 Chunks。

完成標準係:審批條件可以按原文順序閱讀,金額同日期正確,固定問題可以召回包含完整條件嘅片段。

常見問題

正文正確,仲要睇 Chunks 嗎?

需要。正文正確只代表解析合格;條件同結論仲可能喺切分時被分開。

增加 Top K 可以修復解析問題嗎?

唔可以。Top K 只控制返回幾多片段,唔會恢復正文入面已經遺失或者錯序嘅內容。

點解更換處理器之後結果冇變?

舊資料仍然用緊原來嘅索引。對相關條目執行【重新索引】,再用相同問題復測。

繼續閱讀

最後更新

呢個有冇幫助?