常见问题
遇到知识库问题时,先判断失败发生在导入、解析、分块、召回还是回答层。一次只改变一个变量,才能知道哪项调整真正有效。
最快的定位方法是用同一个真实问题贯穿检查:正文有没有答案、Chunk 是否完整、召回是否正确、回答是否忠于来源。
5 步快速定位
问题应该反馈到哪里

截图、日志和示例资料中不要公开 API Key、内部文件内容、邮箱或本地敏感路径。
创建与导入
支持哪些来源和文件格式?
来源包括文件、Cherry Studio 笔记、本地目录和网页链接。文件格式包括 PDF、DOCX、DOC、PPTX、XLSX、XLS、Markdown、TXT、CSV、HTML 和 EPUB。
解析与召回
对话与 Agent
模型、数据与备份
配置说明:诊断基线
项目
推荐起点
只在什么情况下调整
Top K
6
正确片段被截掉或噪声过多
相似度阈值
配置重排后从 0.0 开始
低分噪声明显,且正确片段仍有余量
Chunk
保留默认智能分段
条件与结论被切开或片段过长
嵌入模型
BM25 不足时再增加
口语问法、同义表达无法稳定命中
重排模型
候选正确但顺序不稳时增加
不用于修复解析错误或缺失正文
用户案例
小林发现“住宿费标准”在聊天里回答错误。他先用相同问题做召回测试,看到正确来源根本没有出现;打开正文后发现双栏 PDF 已错序。更换处理器并重新索引后,召回正确,聊天回答也恢复正常。
这个过程只改变了解析器一个变量,因此能确认根因,而不是靠同时调大 Top K、Chunk 和阈值碰运气。
仍然无法解决时,请记录应用版本、操作系统、处理器、嵌入与重排模型、完整错误、脱敏最小样本、召回结果和预期来源。
继续阅读
最后更新于
这有帮助吗?

