> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/knowledge-base/sources.md).

# 添加与整理资料

知识库支持文件、Cherry Studio 笔记、本地目录和单个网页地址。导入后还要检查处理状态、正文和 Chunks，并在资料更新时重新索引。

{% hint style="info" %}
完成标准不是“文件已经出现在列表里”，而是资料可以读取、Chunks 完整，并且真实问题能召回正确来源。
{% endhint %}

## 选择正确入口

<figure><img src="/files/ofn493hu7lqCWIkEERha" alt="知识库中的文件、笔记、目录和链接四种资料入口"><figcaption><p>按资料来源选择入口：少量文件用【文件】，同类文件集合用【目录】，Cherry Studio 内容用【笔记】，公开网页用【链接】。</p></figcaption></figure>

| 入口 | 适合什么资料                  | 导入后的关系      | 主要注意事项             |
| -- | ----------------------- | ----------- | ------------------ |
| 文件 | PDF、Office、Markdown、文本等 | 保存托管副本      | 单次最多选择 20 项        |
| 笔记 | Cherry Studio 中已经整理的内容  | 导入当时的内容快照   | 原笔记后续修改不会自动同步      |
| 目录 | 同一主题下的一批本地文件            | 按目录内容建立资料条目 | 不要把无关目录整体导入        |
| 链接 | 单个可以公开访问的网页             | 保存抓取时的网页快照  | 登录页、脚本渲染或受限网页可能不完整 |

{% hint style="warning" %}
支持的文件包括 PDF、DOCX、DOC、PPTX、XLSX、XLS、MD、TXT、CSV、HTML 和 EPUB。扫描版 PDF 或图片型内容还需要检查 OCR。
{% endhint %}

## 添加并验收资料

{% stepper %}
{% step %}

### 1. 选择资料来源

打开知识库，点击添加资料按钮，选择【文件】、【笔记】、【目录】或【链接】。
{% endstep %}

{% step %}

### 2. 确认选中的内容

文件和笔记可以批量选择；单次交互式添加最多 20 项。资料更多时分批添加，或使用目录入口。
{% endstep %}

{% step %}

### 3. 处理同名冲突

新资料与现有条目同名时，选择【全部保留】或【替换】。更新制度、手册和笔记快照时通常选择【替换】。

{% hint style="warning" %}
选择【全部保留】会让新旧内容同时参与召回。只有确实需要并行查询不同版本时才这样做，并在名称中标明日期或版本。
{% endhint %}
{% endstep %}

{% step %}

### 4. 等待处理完成

资料会经过复制、读取、切分和索引等阶段。没有配置嵌入模型时不会建立向量，但仍会建立关键词索引。

<figure><img src="/files/A77zqRcaciVvropQOf9v" alt="包含多条已处理资料的员工差旅制度知识库"><figcaption><p>资料进入可用状态后，再抽查正文和 Chunks。</p></figcaption></figure>
{% endstep %}

{% step %}

### 5. 抽查正文和 Chunks

打开资料查看正文，或从资料行菜单查看 Chunks。重点检查标题顺序、表格、OCR 文字和关键句是否被错误拆开。
{% endstep %}

{% step %}

### 6. 完成召回测试

用一个答案明确的问题检查正确来源和片段。资料更新后，也要使用同一组问题重新测试。

<figure><img src="/files/25jlZBPzYcIUwWY6ejxn" alt="召回测试中的来源、相关度、片段内容和排序"><figcaption><p>最终验收要看来源、片段完整度和排序，不只看是否返回结果。</p></figcaption></figure>
{% endstep %}
{% endstepper %}

## 资料状态与处理方法

| 现象          | 可能原因               | 处理方法               |
| ----------- | ------------------ | ------------------ |
| 长时间处理中      | 文件较大、解析器或模型不可用     | 检查原文件、文档处理和嵌入模型    |
| 显示错误        | 复制、读取、切分或索引失败      | 打开错误信息，按失败阶段处理     |
| 正文缺失或乱码     | 文件处理器不适配、扫描内容未 OCR | 更换文档处理方式或配置 OCR    |
| Chunk 缺少关键句 | 分块边界不合适            | 调整分块后执行【重新索引】      |
| 新旧版本同时命中    | 同名资料选择了【全部保留】      | 删除旧条目，或重新导入并选择【替换】 |

## 重新索引与删除

切分、解析器或嵌入设置改变后，旧条目不会自动套用新设置。对单条资料使用【重新索引】，或批量选择资料后重新索引。

{% hint style="danger" %}
删除条目会移除当前知识库中的托管副本和索引。它不会删除原始文件或原笔记，但删除前仍要确认知识库中是否有唯一副本。
{% endhint %}

## 配置说明

| 配置项    | 产品默认值   | 建议起点       | 作用              | 适用场景       | 注意事项             |
| ------ | ------- | ---------- | --------------- | ---------- | ---------------- |
| 单次添加数量 | 最多 20 项 | 先添加少量代表性资料 | 控制一次导入规模        | 第一次建库或排错   | 大批量导入前先验证解析和召回   |
| 同名处理   | 发生冲突时选择 | 更新资料优先【替换】 | 决定新旧条目是否并存      | 制度、手册、笔记更新 | 【全部保留】可能让旧内容参与召回 |
| 重新索引   | 手动执行    | 设置变化后执行    | 让旧资料使用新解析、分块或模型 | 调优或修复资料    | 完成后必须重新做召回测试     |

## 用户案例

小林每月更新差旅制度。他把新文件以相同名称导入，并选择【替换】，等资料处理完成后抽查正文和 Chunks，再用固定问题测试住宿、交通和审批规则。

完成标准是：旧规则不再出现在召回结果中，新规则的条件和金额能够稳定命中。

## 常见问题

<details>

<summary>修改原笔记后，知识库会自动更新吗？</summary>

不会。笔记导入的是当时内容的快照。修改后需要重新添加并选择【替换】，或对对应资料执行【重新索引】。

</details>

<details>

<summary>网页为什么只抓到部分内容？</summary>

需要登录、依赖脚本渲染或存在访问限制的网页可能无法完整抓取。可以改用文件或笔记保存正文后再导入。

</details>

<details>

<summary>删除知识库条目会删除原文件吗？</summary>

不会删除原始文件或原笔记，但会移除知识库中的托管副本和索引。

</details>

## 继续阅读

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>文档解析与 OCR</strong></td><td>处理正文缺失、乱码和扫描内容。</td><td><a href="/pages/OUokG6l8WDpchzKVc8GN">/pages/OUokG6l8WDpchzKVc8GN</a></td></tr><tr><td><strong>检查资料与召回</strong></td><td>用固定问题验收检索质量。</td><td><a href="/pages/2UnkjUdpXro2JxR2fSG2">/pages/2UnkjUdpXro2JxR2fSG2</a></td></tr><tr><td><strong>数据、隐私与维护</strong></td><td>了解备份、删除和服务边界。</td><td><a href="/pages/Nr2zGl3eCdTnYon9h4Cq">/pages/Nr2zGl3eCdTnYon9h4Cq</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/knowledge-base/sources.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
