知识库入门
最后更新于
这有帮助吗?
知识库把文件、笔记、目录或网页整理成可以反复检索的资料集合。先用召回测试确认系统能找到正确片段,再把知识库交给对话或 Agent 使用。
如果只是临时处理一小段文字,直接粘贴到对话更快。资料会反复使用、答案必须以内部材料为准时,再建立知识库。
查询员工制度、产品手册、项目资料
建立知识库
资料会重复使用,需要稳定引用原文
临时分析一个附件
在对话中直接上传
不需要长期维护和索引
资料还在持续整理
先用【笔记】梳理
避免未确认内容被当成正式答案
需要长期自动处理资料
建库后绑定 Agent
Agent 可以在任务中持续使用同一资料范围

知识库
围绕同一主题组织的一组资料和检索设置
资料条目
导入的一个文件、笔记、目录中的文件或网页快照
Chunk
资料切分后用于检索的小片段
召回
根据问题找出相关片段的过程
嵌入模型
把文字转换为向量,用于匹配不同表达但意思相近的内容;不是必选项
重排模型
对候选片段再次评分和排序;也是可选项
没有嵌入模型也能使用知识库,此时主要依靠 BM25 关键词检索。第一次体验可以先选【不使用】,把创建、导入和召回流程跑通。
知识库范围
—
一个明确主题
控制一起参与检索的资料
制度、产品、项目资料
权限或生命周期不同的内容应分开
嵌入模型
不使用
先不使用
决定是否加入向量检索
口语问法与原文差异较大
云端模型的计费与数据处理取决于服务商
测试问题
—
3~5 个真实问题
建立长期回归基线
每次更新资料或设置后
不要只用资料标题和原句测试
进入正式使用
—
资料、Chunks、召回三项都通过
避免把解析或检索问题带入对话
所有知识库
聊天模型无法补回没有召回的关键信息
需要的资料都显示为可用状态,没有长期停在处理中或错误状态。
随机打开一两条资料,正文和 Chunks 没有乱码、缺页或明显错序。
用固定问题进行召回测试,正确来源能够稳定出现在前几条结果中。
小林要让同事查询差旅制度。他创建【员工差旅制度】知识库,导入住宿、交通和审批三份资料,先不配置嵌入模型。三份资料就绪后,他用“北京住宿上限是多少”“5000 元以上谁审批”等问题测试。
完成标准是:每个问题都能找到正确制度来源,片段同时包含适用条件和结论。只有达到这个标准后,他才把知识库绑定到负责员工问答的 Agent。
最后更新于
这有帮助吗?
这有帮助吗?