> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/knowledge-base.md).

# 知識庫入門

知識庫會將文件、筆記、目錄或者網頁整理成可以反覆檢索嘅資料集合。先用召回測試確認系統搵到正確片段，再將知識庫交畀對話或者 Agent 使用。

{% hint style="info" %}
如果只係臨時處理一小段文字，直接貼去對話入面會快啲。資料會反覆使用、答案一定要以內部材料為準嘅時候，再建立知識庫。
{% endhint %}

## 咩時候適合使用

| 需求               | 建議做法        | 原因                      |
| ---------------- | ----------- | ----------------------- |
| 查詢員工制度、產品手冊、項目資料 | 建立知識庫       | 資料會重複使用，需要穩定引用原文        |
| 臨時分析一個附件         | 喺對話中直接上傳    | 唔需要長期維護同索引              |
| 資料仲喺持續整理緊        | 先用【筆記】梳理    | 避免未確認內容被當成正式答案          |
| 需要長期自動處理資料       | 建庫後綁定 Agent | Agent 可以喺任務入面持續使用同一資料範圍 |

## 一次回答會經歷乜嘢

<figure><img src="/files/707d8ff229d7cf7030a9ca2d037ffd3bdd630b5a" alt="从资料解析、分块、BM25 与向量检索到合并、重排和 Top K 的知识库检索架构图"><figcaption><p>資料會先經過解析同切分，再用關鍵字或者語義搵出候選片段；聊天模型只負責根據召回內容組織回答。</p></figcaption></figure>

### 先認識呢啲詞

| 名稱    | 喺本任務入面嘅含義                       |
| ----- | ------------------------------- |
| 知識庫   | 圍繞同一主題組織嘅一組資料同檢索設定              |
| 資料條目  | 匯入嘅一個文件、筆記、目錄入面嘅文件或者網頁快照        |
| Chunk | 資料切分後用嚟檢索嘅小片段                   |
| 召回    | 根據問題搵出相關片段嘅過程                   |
| 嵌入模型  | 將文字轉換成向量，用嚟匹配唔同表達但意思相近嘅內容；唔係必選項 |
| 重排模型  | 對候選片段再次評分同排序；都係可選項              |

{% hint style="success" %}
冇嵌入模型都可以使用知識庫，呢個時候主要靠 BM25 關鍵字檢索。第一次體驗可以先揀【唔使用】，將建立、匯入同召回流程跑通。
{% endhint %}

## 5 分鐘完成第一次使用

{% stepper %}
{% step %}

### 1. 建立一個邊界清楚嘅知識庫

打開左邊導航【知識庫】→ 點擊知識庫列表上方嘅新增按鈕。名稱用「對象 + 用途」，例如【員工差旅制度】。
{% endstep %}

{% step %}

### 2. 選擇檢索方式

第一次體驗可以將【嵌入模型】設為【唔使用】。需要匹配口語問法或者同義表達時，再配置嵌入模型。
{% endstep %}

{% step %}

### 3. 添加資料

進入知識庫後點擊添加資料按鈕，選擇【文件】、【筆記】、【目錄】或者【連結】。

<figure><img src="/files/024a74247461ed4b2b0089f937db2f9f5571906b" alt="知识库中的文件、笔记、目录和链接四种资料入口"><figcaption><p>按資料來源揀入口；唔好為咗減少操作而將無關目錄一齊匯入。</p></figcaption></figure>
{% endstep %}

{% step %}

### 4. 等待資料變成就緒

處理完成後，資料會出現喺列表入面。抽查正文同 Chunks，確認冇亂碼、缺頁或者明顯錯序。

<figure><img src="/files/605329854681bd110f8a7a74d7e588d92af4cf74" alt="包含多条已处理资料的员工差旅制度知识库"><figcaption><p>資料就緒後都要抽查內容；匯入完成唔代表檢索質量已經合格。</p></figcaption></figure>
{% endstep %}

{% step %}

### 5. 完成召回測試

打開【召回測試】，輸入一個你已經知道答案嘅真實問題，檢查正確來源有冇出現喺前幾條結果入面。
{% endstep %}

{% step %}

### 6. 進入對話或者綁定 Agent

召回穩定之後，喺對話輸入區選擇知識庫；需要長期工作流時，喺 Agent 編輯頁綁定知識庫。
{% endstep %}
{% endstepper %}

## 推薦起點

| 配置項    | 產品預設值 | 建議起點              | 作用              | 適用場景         | 注意事項               |
| ------ | ----- | ----------------- | --------------- | ------------ | ------------------ |
| 知識庫範圍  | —     | 一個明確主題            | 控制一齊參與檢索嘅資料     | 制度、產品、項目資料   | 權限或者生命周期唔同嘅內容應該分開  |
| 嵌入模型   | 唔使用   | 先唔使用              | 決定係咪加入向量檢索      | 口語問法同原文差異較大  | 雲端模型嘅收費同資料處理取決於服務商 |
| 測試問題   | —     | 3～5 個真實問題         | 建立長期回歸基線        | 每次更新資料或者設定之後 | 唔好淨係用資料標題同原句測試     |
| 進入正式使用 | —     | 資料、Chunks、召回三項都通過 | 避免將解析或者檢索問題帶入對話 | 所有知識庫        | 聊天模型無法補返冇召回到嘅關鍵資訊  |

## 點樣判斷已經可以使用

* 需要嘅資料都顯示為可用狀態，冇長期停喺處理中或者錯誤狀態。
* 隨機打開一兩條資料，正文同 Chunks 冇亂碼、缺頁或者明顯錯序。
* 用固定問題做召回測試，正確來源可以穩定出現喺前幾條結果入面。

## 用戶案例

小林要俾同事查差旅制度。佢建立【員工差旅制度】知識庫，匯入住宿、交通同審批三份資料，先唔配置嵌入模型。三份資料就緒之後，佢用「北京住宿上限幾多」「5000 元以上邊個審批」等問題測試。

完成標準係：每個問題都可以搵到正確制度來源，片段同時包含適用條件同結論。只有達到呢個標準之後，佢先至將知識庫綁定到負責員工問答嘅 Agent。

## 常見問題

<details>

<summary>知識庫同聊天模型有咩分別？</summary>

知識庫負責喺你嘅資料入面搵片段，聊天模型負責理解問題同組織回答。召回階段冇搵到關鍵資訊時，單純換聊天模型通常都解決唔到問題。

</details>

<details>

<summary>資料匯入成功之後可以直接使用嗎？</summary>

仲需要抽查正文同 Chunks，並完成召回測試。匯入成功只代表處理流程結束，唔代表結果完整或者排序正確。

</details>

<details>

<summary>修改分塊設定之後，舊資料會自動變嗎？</summary>

唔會。要令已有資料使用新分塊設定，需要執行【重新索引】，再用同一組問題重測。

</details>

## 繼續閱讀

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>建立知識庫</strong></td><td>確定名稱邊界同檢索方式。</td><td><a href="/pages/53cbe09648fc1e16c2c226fbbdbef86912e0d690">/pages/53cbe09648fc1e16c2c226fbbdbef86912e0d690</a></td></tr><tr><td><strong>添加同整理資料</strong></td><td>匯入文件、筆記、目錄同網頁。</td><td><a href="/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563">/pages/51861a0e6495a8d2826da9dc67f188b5d67b3563</a></td></tr><tr><td><strong>檢查資料同召回</strong></td><td>用固定問題驗收檢索質量。</td><td><a href="/pages/c63f889f83b9213cb096e7e37b06ede1b3b4a986">/pages/c63f889f83b9213cb096e7e37b06ede1b3b4a986</a></td></tr><tr><td><strong>模型同檢索設定</strong></td><td>繼續調整嵌入、重排同分塊。</td><td><a href="/pages/80a36504e872dfe466466dc078aa9127440ec266">/pages/80a36504e872dfe466466dc078aa9127440ec266</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/zhong-wen-fan-ti/knowledge-base/knowledge-base.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
