建立知識庫
最後更新
呢個有冇幫助?
建立時最重要嘅兩個選擇係名稱同嵌入模型。資料可以之後再加,但名稱邊界同檢索方式會影響後續維護。
第一次體驗可以將【嵌入模型】設做【唔使用】。知識庫仍然會用 BM25 關鍵詞檢索,先將導入同召回流程跑通就得。
優先用「對象 + 用途」,例如【員工差旅制度】、【產品售後手冊】或者【市場研究資料】。避免用【資料】、【測試】呢類之後無法判斷內容範圍嘅名稱。
唔使用
第一次體驗、關鍵詞明確
BM25 關鍵詞檢索
無
雲端嵌入模型
用戶問法同資料原文差異比較大
BM25 + 向量混合檢索
對應模型服務可正常調用
本地嵌入模型
希望喺本機完成向量化
BM25 + 本地向量檢索
先喺【本地模型】完成下載
打開【設定】→【本地模型】,喺【嵌入模型】區域下載可用模型。介面顯示嘅模型同下載大小可能會隨安裝環境變化,以而家列表為準。

本地嵌入只代表向量化喺本機完成。文檔解析、重排同聊天係咪使用雲端,仍然取決於各自選擇嘅服務同模型。
由只使用 BM25 嘅知識庫啟用嵌入模型時,可以建立向量索引。已有向量嘅知識庫更換嵌入模型時,介面會進入【重建知識庫】流程。
開始重建前先確認新模型可以正常調用。重建之後重新完成召回測試;唔好喺同一輪又更換模型、又修改分塊,否則無法判斷結果變化係嚟自邊度。
名稱
空
對象 + 用途
區分資料邊界
所有知識庫
權限或者生命週期唔同嘅資料應該分開
嵌入模型
唔使用
第一次體驗先唔使用
決定係咪加入向量檢索
口語問法、同義表達較多
雲端模型嘅計費同資料處理取決於服務商
本地嵌入模型
未下載
有本地處理需求時再下載
喺本機完成向量化
離線或者私隱要求較高
仍然要分開檢查解析、重排同聊天模型
新知識庫出現喺列表入面,名稱可以同其他知識庫區分。
你清楚而家用緊嘅係關鍵詞檢索定係混合檢索。
選擇嘅雲端模型可以調用,或者本地模型已經完成下載。
小林第一次建立【員工差旅制度】知識庫。佢先選擇【唔使用】嵌入模型,導入三份制度並完成召回測試。關鍵詞查詢穩定之後,佢再配置嵌入模型,用相同問題比較口語問法嘅結果。
完成標準係:升級檢索方式之後,原本嘅固定問題冇退化,口語問法可以更穩定咁搵到同一條制度。
最後更新
呢個有冇幫助?
呢個有冇幫助?