> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/document-preprocessing.md).

# 文件解析與 OCR

知識庫只可以檢索已經解析出嚟嘅文字。掃描 PDF、雙欄論文、複雜表格同圖片型頁面，先將正文解析正確，再調整模型同召回參數。

{% hint style="info" %}
判斷解析係咪合格，唔好睇「導入成功」四個字，而係睇正文順序、關鍵表格、金額日期同掃描文字可唔可以正確讀取。
{% endhint %}

## 先判斷資料類型

| 資料類型                 | 推薦起點      | 必查內容          |
| -------------------- | --------- | ------------- |
| Markdown、TXT、HTML    | 預設讀取      | 標題層級、編碼、換行    |
| 可複製文字嘅 PDF、DOCX、PPTX | 先用預設處理    | 段落順序、頁眉頁腳、表格  |
| 掃描 PDF、截圖、圖片型頁面      | 本地或系統 OCR | 識別語言、金額、日期、編號 |
| 雙欄、公式或複雜表格 PDF       | 專用文檔處理器   | 閱讀順序、表格結構、腳註  |

## 解析喺檢索鏈路入面嘅位置

<figure><img src="/files/707d8ff229d7cf7030a9ca2d037ffd3bdd630b5a" alt="资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图"><figcaption><p>解析錯誤會繼續傳到分塊同召回；下游模型無法恢復正文入面已經丟失嘅內容。</p></figcaption></figure>

## 配置同驗收一份樣本文檔

{% stepper %}
{% step %}

### 1. 選擇具代表性樣本

唔好先導入成批資料。揀一份最能暴露問題嘅文檔，例如帶表格嘅掃描 PDF 或雙欄說明書。
{% endstep %}

{% step %}

### 2. 配置處理能力

打開【設置】→【文檔處理】，按需要配置文檔解析服務同 OCR。雲端服務通常需要 API Key 或服務地址；本地能力可能要先下載模型。

<figure><img src="/files/e7aff555601fea783d554056547188f3ec060ab6" alt="文档处理设置中的文件解析与 OCR 服务配置"><figcaption><p>先將要使用嘅服務配置到可用狀態，再返去知識庫揀處理器。</p></figcaption></figure>
{% endstep %}

{% step %}

### 3. 導入並等待就緒

將樣本文檔加入知識庫。處理完成後打開正文，檢查標題、段落、頁碼、表格同 OCR 文字。
{% endstep %}

{% step %}

### 4. 檢查 Chunks

確認關鍵條件同結論冇被拆散；頁眉、頁腳同目錄唔好大量重複佔用片段。

<figure><img src="/files/f40998683b0aa62431eb81fa05a615038defc9d1" alt="知识库高级设置中的智能分段、分隔符、分段大小和重叠大小"><figcaption><p>正文正確之後再檢查分塊；解析錯誤唔可以靠增大 Chunk 修復。</p></figcaption></figure>
{% endstep %}

{% step %}

### 5. 用真實問題複測

喺【召回測試】入面輸入一條答案喺該文檔中嘅問題。結果應該包含正確來源、完整條件同關鍵數字。
{% endstep %}

{% step %}

### 6. 固定方案再批量導入

樣本合格之後，再將同類型資料分批導入。處理器、OCR 或分塊設置改變後，對舊資料執行【重新索引】並重複測試。
{% endstep %}
{% endstepper %}

{% hint style="warning" %}
切換處理器或者 OCR 唔會自動修復已經索引咗嘅舊資料。必須重新索引相關條目，先可以比較新舊結果。
{% endhint %}

## 處理器同 OCR 點樣揀

| 選擇           | 適用情況         | 優點               | 注意事項               |
| ------------ | ------------ | ---------------- | ------------------ |
| 預設讀取         | 文字型常見格式      | 配置少、速度快          | 複雜排版同掃描頁可能會丟失內容    |
| System OCR   | 系統支援而且圖片清晰   | 唔使額外 API Key、速度快 | 準確率取決於操作系統、語言同圖像質素 |
| 本地 PaddleOCR | 需要離線識別       | 文檔唔會離開本機         | 首次使用前要下載本地模型       |
| 雲端或自託管處理器    | 雙欄、複雜表格、公式較多 | 版面分析能力通常更強       | 雲端方案會接收用嚟處理嘅文檔內容   |

{% hint style="danger" %}
敏感資料使用雲端文檔處理器之前，先確認服務條款、數據保留策略同賬號權限。完全離線就需要解析、OCR、嵌入、重排同聊天各個環節都用本地能力。
{% endhint %}

## 典型問題點樣定位

| 表現        | 先檢查            | 處理方向                         |
| --------- | -------------- | ---------------------------- |
| 正文係空白或者好短 | 文件係咪掃描件        | 啟用 OCR 或者更換處理器               |
| 雙欄文字交錯    | 正文閱讀順序         | 使用擅長版面分析嘅處理器                 |
| 表格變成零散文字  | 表頭、行列關係        | 更換處理器，或者將關鍵規則整理成 Markdown 筆記 |
| 頁眉頁腳反覆出現  | Chunks 入面嘅重複噪聲 | 清理源文件或者換解析器，唔好淨係提高 Top K     |
| OCR 數字出錯  | 金額、日期、編號       | 提高圖像清晰度同人工核對高風險欄位            |

## 配置說明

| 配置項         | 推薦起點           | 何時調整             | 調整後動作        |
| ----------- | -------------- | ---------------- | ------------ |
| 文件處理器       | 先用預設處理         | 正文錯序、表格丟失、掃描頁係空白 | 重新索引樣本文檔     |
| OCR         | 清晰掃描件優先本地或系統能力 | 圖片型頁面冇文字或者錯字較多   | 重新索引並核對關鍵欄位  |
| Chunk 大小同重疊 | 先保留知識庫預設設定     | 條件同結論被切開         | 每一輪只改一項並重新索引 |
| 驗收問題        | 3～5 個真實問題      | 更換處理器、OCR 或分塊之後  | 用同一問題集比較     |

## 用戶案例

小林導入一份雙欄差旅制度 PDF。狀態已經就緒，但正文將左右兩欄交錯埋一齊，召回結果入面嘅審批條件亦都唔完整。佢冇先調高 Top K，而係換用更適合版面分析嘅處理器，重新索引同一份文件，再檢查正文同 Chunks。

完成標準係：審批條件可以按原文順序讀到，金額同日期正確，固定問題可以召回包含完整條件嘅片段。

## 常見問題

<details>

<summary>正文正確，仲要睇 Chunks 咩？</summary>

需要。正文正確只係話解析合格；條件同結論仍然有可能喺切分嗰陣被分開。

</details>

<details>

<summary>增加 Top K 可以修復解析問題咩？</summary>

唔可以。Top K 只係控制返幾多片段，唔會恢復正文入面已經丟失或者錯序嘅內容。

</details>

<details>

<summary>點解更換處理器之後結果冇變化？</summary>

舊資料仍然用緊原來嘅索引。對相關條目執行【重新索引】，再用相同問題複測。

</details>

## 繼續閱讀

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>添加同整理資料</strong></td><td>揀選來源並檢查處理狀態。</td><td><a href="/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563">/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563</a></td></tr><tr><td><strong>檢查資料同召回</strong></td><td>用固定問題驗收解析同分塊。</td><td><a href="/pages/c63f889f83b9213cb096e7e37b06ede1b3b4a986">/pages/c63f889f83b9213cb096e7e37b06ede1b3b4a986</a></td></tr><tr><td><strong>數據、私隱同維護</strong></td><td>確認本地同雲端嘅數據邊界。</td><td><a href="/pages/c717d714b290fe2e0838ea72d335a09917e42a89">/pages/c717d714b290fe2e0838ea72d335a09917e42a89</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/document-preprocessing.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
