For the complete documentation index, see llms.txt. This page is also available as Markdown.

知識庫入門

知識庫會將文件、筆記、目錄或者網頁整理成可以反覆檢索嘅資料集合。先用召回測試確認系統搵到正確片段,再將知識庫交畀對話或者 Agent 使用。

如果只係臨時處理一小段文字,直接貼去對話入面會快啲。資料會反覆使用、答案一定要以內部材料為準嘅時候,再建立知識庫。

咩時候適合使用

需求
建議做法
原因

查詢員工制度、產品手冊、項目資料

建立知識庫

資料會重複使用,需要穩定引用原文

臨時分析一個附件

喺對話中直接上傳

唔需要長期維護同索引

資料仲喺持續整理緊

先用【筆記】梳理

避免未確認內容被當成正式答案

需要長期自動處理資料

建庫後綁定 Agent

Agent 可以喺任務入面持續使用同一資料範圍

一次回答會經歷乜嘢

从资料解析、分块、BM25 与向量检索到合并、重排和 Top K 的知识库检索架构图
資料會先經過解析同切分,再用關鍵字或者語義搵出候選片段;聊天模型只負責根據召回內容組織回答。

先認識呢啲詞

名稱
喺本任務入面嘅含義

知識庫

圍繞同一主題組織嘅一組資料同檢索設定

資料條目

匯入嘅一個文件、筆記、目錄入面嘅文件或者網頁快照

Chunk

資料切分後用嚟檢索嘅小片段

召回

根據問題搵出相關片段嘅過程

嵌入模型

將文字轉換成向量,用嚟匹配唔同表達但意思相近嘅內容;唔係必選項

重排模型

對候選片段再次評分同排序;都係可選項

5 分鐘完成第一次使用

1

1. 建立一個邊界清楚嘅知識庫

打開左邊導航【知識庫】→ 點擊知識庫列表上方嘅新增按鈕。名稱用「對象 + 用途」,例如【員工差旅制度】。

2

2. 選擇檢索方式

第一次體驗可以將【嵌入模型】設為【唔使用】。需要匹配口語問法或者同義表達時,再配置嵌入模型。

3

3. 添加資料

進入知識庫後點擊添加資料按鈕,選擇【文件】、【筆記】、【目錄】或者【連結】。

知识库中的文件、笔记、目录和链接四种资料入口
按資料來源揀入口;唔好為咗減少操作而將無關目錄一齊匯入。
4

4. 等待資料變成就緒

處理完成後,資料會出現喺列表入面。抽查正文同 Chunks,確認冇亂碼、缺頁或者明顯錯序。

包含多条已处理资料的员工差旅制度知识库
資料就緒後都要抽查內容;匯入完成唔代表檢索質量已經合格。
5

5. 完成召回測試

打開【召回測試】,輸入一個你已經知道答案嘅真實問題,檢查正確來源有冇出現喺前幾條結果入面。

6

6. 進入對話或者綁定 Agent

召回穩定之後,喺對話輸入區選擇知識庫;需要長期工作流時,喺 Agent 編輯頁綁定知識庫。

推薦起點

配置項
產品預設值
建議起點
作用
適用場景
注意事項

知識庫範圍

一個明確主題

控制一齊參與檢索嘅資料

制度、產品、項目資料

權限或者生命周期唔同嘅內容應該分開

嵌入模型

唔使用

先唔使用

決定係咪加入向量檢索

口語問法同原文差異較大

雲端模型嘅收費同資料處理取決於服務商

測試問題

3~5 個真實問題

建立長期回歸基線

每次更新資料或者設定之後

唔好淨係用資料標題同原句測試

進入正式使用

資料、Chunks、召回三項都通過

避免將解析或者檢索問題帶入對話

所有知識庫

聊天模型無法補返冇召回到嘅關鍵資訊

點樣判斷已經可以使用

  • 需要嘅資料都顯示為可用狀態,冇長期停喺處理中或者錯誤狀態。

  • 隨機打開一兩條資料,正文同 Chunks 冇亂碼、缺頁或者明顯錯序。

  • 用固定問題做召回測試,正確來源可以穩定出現喺前幾條結果入面。

用戶案例

小林要俾同事查差旅制度。佢建立【員工差旅制度】知識庫,匯入住宿、交通同審批三份資料,先唔配置嵌入模型。三份資料就緒之後,佢用「北京住宿上限幾多」「5000 元以上邊個審批」等問題測試。

完成標準係:每個問題都可以搵到正確制度來源,片段同時包含適用條件同結論。只有達到呢個標準之後,佢先至將知識庫綁定到負責員工問答嘅 Agent。

常見問題

知識庫同聊天模型有咩分別?

知識庫負責喺你嘅資料入面搵片段,聊天模型負責理解問題同組織回答。召回階段冇搵到關鍵資訊時,單純換聊天模型通常都解決唔到問題。

資料匯入成功之後可以直接使用嗎?

仲需要抽查正文同 Chunks,並完成召回測試。匯入成功只代表處理流程結束,唔代表結果完整或者排序正確。

修改分塊設定之後,舊資料會自動變嗎?

唔會。要令已有資料使用新分塊設定,需要執行【重新索引】,再用同一組問題重測。

繼續閱讀

最後更新

呢個有冇幫助?