> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/data.md).

# 數據、私隱同維護

知識庫會儲存已匯入資料嘅託管副本、解析文本、Chunks 同檢索索引。數據會唔會離開本機，視乎解析、OCR、嵌入、重排同聊天各環節揀咗咩服務。

{% hint style="info" %}
原文件留喺本地，唔代表成個知識庫流程都係離線。只要其中一個處理環節用雲端服務，就有可能發送完成任務所需嘅文件、片段或查詢。
{% endhint %}

## 匯入後會保存咩

| 內容           | 用途          | 更新方式             |
| ------------ | ----------- | ---------------- |
| 檔案或目錄入面檔案嘅副本 | 俾知識庫繼續處理同展示 | 原文件更新後重新加入或替換    |
| 網頁同筆記快照      | 保留匯入時嘅內容    | 來源更新後重新匯入        |
| 解析正文同 Chunks | 預覽同檢索       | 更換處理器或者分塊之後重新索引  |
| BM25 關鍵字索引   | 精準詞語檢索      | 重新索引時重建          |
| 向量索引         | 語義檢索        | 配置或者更換嵌入模型後生成或重建 |

<figure><img src="/files/605329854681bd110f8a7a74d7e588d92af4cf74" alt="包含多条已处理资料的员工差旅制度知识库"><figcaption><p>資料列表入面嘅條目係知識庫託管同索引嘅對象，唔係原目錄嘅即時同步視圖。</p></figcaption></figure>

## 一次查詢可能經過邊啲邊界

<figure><img src="/files/707d8ff229d7cf7030a9ca2d037ffd3bdd630b5a" alt="展示解析、关键词检索、向量检索、重排和回答之间数据流的知识库架构图"><figcaption><p>圖中嘅解析、向量、重排同回答節點都可能揀本地或者雲端服務；逐項檢查先可以確定數據邊界。</p></figcaption></figure>

| 揀選嘅能力   | 可能接收嘅內容       |
| ------- | ------------- |
| 雲端文件處理器 | 用於解析嘅文件內容     |
| 雲端嵌入模型  | 資料片段同檢索查詢     |
| 雲端重排模型  | 查詢同候選片段       |
| 雲端聊天模型  | 問題、對話上下文同召回片段 |
| 本地對應能力  | 喺本機完成相應處理     |

{% hint style="danger" %}
API Key、內部文件同帶個人資料嘅日誌都唔應該出現喺公開截圖或者反饋入面。刪除或者分享前先脫敏。
{% endhint %}

## 做一次完整嘅維護檢查

{% stepper %}
{% step %}

### 1. 記錄而家嘅配置

記錄知識庫名稱、文件處理器、OCR、嵌入模型、重排模型同關鍵分塊設定。遷移之後用呢啲核對環境。
{% endstep %}

{% step %}

### 2. 清理重複同舊版本

同一制度只保留而家版本；需要歷史審計時，喺標題入面清楚寫年份或者版本，避免檢索時互相競爭。
{% endstep %}

{% step %}

### 3. 檢查異常條目

處理【錯誤】或者長期【處理中】嘅資料，抽查正文同 Chunks。應用中斷導致索引未完成時，執行【重新索引】。
{% endstep %}

{% step %}

### 4. 建立合適嘅備份

打開【設定】→【數據】。遷移裝置或者準備刪除資料時使用包含知識庫數據文件嘅完整備份。
{% endstep %}

{% step %}

### 5. 喺目標環境還原同驗收

唔好淨係確認還原完成。檢查知識庫條目、正文、Chunks，並且跑固定嘅召回問題。
{% endstep %}

{% step %}

### 6. 保留可回退基線

新處理器或者模型先喺少量資料上驗證，再分批重新索引。確認新結果穩定之前，唔好刪除最近嘅完整備份。
{% endstep %}
{% endstepper %}

## 完整備份同精簡備份

| 備份方式 | 包含內容                     | 適用場景            | 限制           |
| ---- | ------------------------ | --------------- | ------------ |
| 完整備份 | 聊天、設定同知識庫等數據文件           | 遷移裝置、刪除前保護、完整還原 | 文件較大，需時更長    |
| 精簡備份 | 主要係聊天記錄同設定，跳過圖片、知識庫等數據文件 | 快速保留常用配置同聊天     | 唔可以單獨還原完整知識庫 |

{% hint style="warning" %}
精簡備份唔係知識庫刪除前嘅還原保障。重要遷移至少保留一份完整備份，並且喺目標環境實際完成召回測試。
{% endhint %}

## 更新同刪除點樣處理

### 來源內容更新

1. 重新加入同名資料。
2. 需要覆蓋舊版本時揀【替換】；只有真係要並存時先揀【全部保留】。
3. 等資料變成就緒。
4. 抽查正文同 Chunks。
5. 跑固定嘅召回回歸問題。

### 處理設定更新

只改處理器、OCR、分塊或者模型設定時，對現有條目執行【重新索引】。修改配置本身唔會自動重做舊資料。

### 刪除資料或者知識庫

刪除會移除知識庫託管嘅內容同索引，但唔會刪除原路徑入面嘅文件或者原筆記。操作前確認原始來源仍然搵得到、完整備份可用，並檢查仲有冇 Agent 綁定緊呢個知識庫。

## 配置說明

| 項目   | 推薦起點        | 驗收方式        | 風險            |
| ---- | ----------- | ----------- | ------------- |
| 資料版本 | 同一用途只保留而家版  | 固定問題只命中正確版本 | 新舊規則混用        |
| 雲端服務 | 按敏感等級逐項確認   | 睇處理器同模型配置   | 文件或者片段發送到外部服務 |
| 備份   | 大改前建立完整備份   | 還原後檢查條目同召回  | 精簡備份缺少知識庫文件   |
| 重新索引 | 分批處理具代表性嘅資料 | 同一問題集前後對比   | 一次過重建會失去可用基線  |

## 用戶案例

小林要將團隊制度庫遷移去新電腦。佢先記錄處理器同模型配置，建立完整備份，喺新電腦還原之後檢查三條資料嘅正文同 Chunks，並且重複原本五條召回問題。全部通過之後，佢先清理舊環境。

完成標準係：資料數量同標題一致，關鍵問題仍然命中同一來源，而且團隊確認所有雲端服務符合數據要求。

## 完全離線檢查清單

* 文件解析同 OCR 使用系統、本地或者自託管能力。
* 嵌入模型喺本機運行。
* 唔使用雲端重排，或者使用本地重排能力。
* 對話同 Agent 使用本地聊天模型。
* 冇啟用會將內容發送到外部系統嘅 MCP、網絡搜尋或者頻道。

## 常見問題

<details>

<summary>修改原文件之後，知識庫會自動更新嗎？</summary>

唔會。文件、網頁同筆記都係按匯入時內容建立資料。重新加入並替換，或者按需要重新索引。

</details>

<details>

<summary>用本地嵌入模型就完全離線咩？</summary>

唔一定。解析、OCR、重排或者聊天入面任何一個環節用雲端服務，都可能發送完成任務所需嘅內容。

</details>

<details>

<summary>精簡備份可以還原知識庫嗎？</summary>

唔可以還原完整知識庫文件。遷移或者刪除前使用完整備份，並且喺還原後實際驗證資料同召回。

</details>

## 繼續閱讀

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>文件解析與 OCR</strong></td><td>了解本地同雲端處理器嘅差異。</td><td><a href="/pages/4b9563c434830d8aac5df782c734b2ddcd8509f0">/pages/4b9563c434830d8aac5df782c734b2ddcd8509f0</a></td></tr><tr><td><strong>添加同整理資料</strong></td><td>替換來源並管理資料版本。</td><td><a href="/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563">/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563</a></td></tr><tr><td><strong>常見問題</strong></td><td>按失敗層級快速定位問題。</td><td><a href="/pages/63b1e545034e96e6aba4adcc4b63d4be0c910334">/pages/63b1e545034e96e6aba4adcc4b63d4be0c910334</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/data.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
