知識庫入門
最後更新
呢個有冇幫助?
知識庫會將文件、筆記、目錄或者網頁整理成可以反覆檢索嘅資料集合。先用召回測試確認系統搵到正確片段,再將知識庫交畀對話或者 Agent 使用。
如果只係臨時處理一小段文字,直接貼去對話入面會快啲。資料會反覆使用、答案一定要以內部材料為準嘅時候,再建立知識庫。
查詢員工制度、產品手冊、項目資料
建立知識庫
資料會重複使用,需要穩定引用原文
臨時分析一個附件
喺對話中直接上傳
唔需要長期維護同索引
資料仲喺持續整理緊
先用【筆記】梳理
避免未確認內容被當成正式答案
需要長期自動處理資料
建庫後綁定 Agent
Agent 可以喺任務入面持續使用同一資料範圍

知識庫
圍繞同一主題組織嘅一組資料同檢索設定
資料條目
匯入嘅一個文件、筆記、目錄入面嘅文件或者網頁快照
Chunk
資料切分後用嚟檢索嘅小片段
召回
根據問題搵出相關片段嘅過程
嵌入模型
將文字轉換成向量,用嚟匹配唔同表達但意思相近嘅內容;唔係必選項
重排模型
對候選片段再次評分同排序;都係可選項
冇嵌入模型都可以使用知識庫,呢個時候主要靠 BM25 關鍵字檢索。第一次體驗可以先揀【唔使用】,將建立、匯入同召回流程跑通。
知識庫範圍
—
一個明確主題
控制一齊參與檢索嘅資料
制度、產品、項目資料
權限或者生命周期唔同嘅內容應該分開
嵌入模型
唔使用
先唔使用
決定係咪加入向量檢索
口語問法同原文差異較大
雲端模型嘅收費同資料處理取決於服務商
測試問題
—
3~5 個真實問題
建立長期回歸基線
每次更新資料或者設定之後
唔好淨係用資料標題同原句測試
進入正式使用
—
資料、Chunks、召回三項都通過
避免將解析或者檢索問題帶入對話
所有知識庫
聊天模型無法補返冇召回到嘅關鍵資訊
需要嘅資料都顯示為可用狀態,冇長期停喺處理中或者錯誤狀態。
隨機打開一兩條資料,正文同 Chunks 冇亂碼、缺頁或者明顯錯序。
用固定問題做召回測試,正確來源可以穩定出現喺前幾條結果入面。
小林要俾同事查差旅制度。佢建立【員工差旅制度】知識庫,匯入住宿、交通同審批三份資料,先唔配置嵌入模型。三份資料就緒之後,佢用「北京住宿上限幾多」「5000 元以上邊個審批」等問題測試。
完成標準係:每個問題都可以搵到正確制度來源,片段同時包含適用條件同結論。只有達到呢個標準之後,佢先至將知識庫綁定到負責員工問答嘅 Agent。
最後更新
呢個有冇幫助?
呢個有冇幫助?