For the complete documentation index, see llms.txt. This page is also available as Markdown.

检查资料与召回

召回测试直接检查“问题能否找到正确片段”,不会先经过聊天模型润色。它能帮助你判断问题出在资料、解析、分块还是检索设置。

准备 3~5 个你已经知道答案的真实问题,并在每次更新资料、模型或分块后重复使用。固定问题比临时试问更容易发现退化。

准备测试问题

建议同时覆盖三类问题:

  • 精确事实,例如“国内一线城市住宿上限是多少?”

  • 条件规则,例如“海外租车在什么情况下可以报销?”

  • 容易混淆,例如“5000 元以上的出差由谁追加审批?”

不要只用资料标题或整句原文测试,那会高估真实使用效果。

完成一次召回测试

1

1. 打开召回测试

打开左侧导航【知识库】→ 选择知识库 → 进入【召回测试】。

2

2. 输入真实问题

输入一个答案明确的问题并执行测试。问题应接近日常说法,不要刻意复制资料原文。

3

3. 检查来源和片段

确认来源正确,片段同时包含回答所需的条件和结论。

召回测试中的命中来源、相关度、片段内容和排序
不要只看有没有结果,还要检查来源、片段完整度和顺序。
4

4. 对照现象定位问题

完全没有正确片段时先查资料、解析和分块;正确片段能出现但顺序不稳时,再考虑嵌入、重排或 Top K。

5

5. 单项调整并复测

每轮只修改一项设置。涉及解析、分块或索引时,先执行【重新索引】,再使用同一组问题复测。

怎样读结果

现象
说明
下一步

正确来源排在前面,片段完整

召回基本合格

再测试几种不同问法

完全没有正确结果

资料未就绪、内容缺失、问法差异大或阈值过高

依次检查资料、正文、Chunks 和检索设置

来源正确但片段缺少关键句

解析或分块边界不理想

查看 Chunks,调整后重新索引

旧版本和新版本同时出现

同名资料被全部保留

删除旧条目或用【替换】重新导入

正确项经常靠后

候选较多或排序不稳定

清理资料,考虑嵌入或重排模型

召回正确但聊天回答不准

问题更可能在提示词或聊天模型

保留召回设置,调整提问和聊天模型

调优闭环

用固定问题检查召回、定位问题、单项调整、重新索引并复测的质量调优闭环
固定问题 → 检查结果 → 定位层级 → 单项调整 → 必要时重新索引 → 复测。

推荐顺序:

  1. 确认资料正确,没有重复或过期版本。

  2. 检查解析正文和 Chunks。

  3. 问法与原文差异很大时,考虑嵌入模型。

  4. 候选大致正确但顺序不稳时,再考虑重排模型。

  5. 调整后重新索引,并重复同一组测试。

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
片段不完整时再检查分块设置;修改只影响新资料,旧资料需要重新索引。

配置说明

配置项
产品默认值
建议起点
作用
适用场景
注意事项

测试问题数量

3~5 个

建立可重复的质量基线

所有知识库

覆盖精确事实、条件规则和易混淆问题

Top K

6,可选 1~50

先保留 6

控制最终片段数量

覆盖与噪声之间取舍

调大可能占用更多上下文

相似度阈值

0.0,仅配置重排后显示

从 0.0 开始

过滤重排后的低分结果

重排后仍有噪声

设得过高会移除正确片段

复测方式

每轮只改一项

判断设置变化来自哪里

调优、更新资料或模型

修改分块或模型后先重新索引

预期结果

  • 正确来源稳定出现在前几条结果中。

  • 片段包含回答问题所需的条件和结论。

  • 换一种自然说法后,结果仍然稳定。

  • 更新资料或设置后,固定问题没有明显退化。

用户案例

小林发现“住宿费标准”用原文能命中,但“住酒店最多能报多少”不稳定。他先确认资料和 Chunks 正常,再配置嵌入模型并复测。正确片段出现后偶尔排在后面,于是才加入重排模型。

完成标准是:三种不同问法都能在前几条结果中找到同一条住宿标准,且片段包含适用城市和金额上限。

常见问题

完全没有正确片段,先调大 Top K 吗?

先检查资料正文和 Chunks。解析或切分错误时,调大 Top K 只会返回更多不正确或不完整的片段。

为什么看不到相似度阈值?

只有选择重排模型后,知识库设置中才会显示【相似度阈值】。

召回正确,聊天回答仍不准确怎么办?

保留当前召回设置,检查问题表达、对话上下文和聊天模型。此时问题通常已经不在资料检索层。

继续阅读

最后更新于

这有帮助吗?