檢查資料同召回
最後更新
呢個有冇幫助?
召回測試會直接檢查「問題可唔可以搵到正確片段」,唔會先經過聊天模型潤色。佢可以幫你判斷問題出喺資料、解析、分塊定係檢索設定。
準備 3~5 個你已經知答案嘅真實問題,並且每次更新資料、模型或者分塊之後重複使用。固定問題比臨時試問更容易發現退化。
建議同時覆蓋三類問題:
精確事實,例如「國內一線城市住宿上限係幾多?」
條件規則,例如「海外租車喺咩情況下可以報銷?」
容易混淆,例如「5000 元以上嘅出差由邊個追加審批?」
唔好只用資料標題或者整句原文測試,咁會高估真實使用效果。
正確來源排喺前面,片段完整
召回基本合格
再測試幾種唔同問法
完全冇正確結果
資料未就緒、內容缺失、問法差異大或者閾值過高
依次檢查資料、正文、Chunks 同檢索設定
來源正確但片段缺少關鍵句
解析或者分塊邊界唔理想
查看 Chunks,調整後重新索引
舊版本同新版本同時出現
同名資料被全部保留
刪除舊條目或者用【替換】重新導入
正確項經常靠後
候選較多或者排序唔穩定
清理資料,考慮嵌入或者重排模型
召回正確但聊天回答唔準
問題更可能喺提示詞或者聊天模型
保留召回設定,調整提問同聊天模型
聊天模型補唔返召回階段冇搵到嘅關鍵資料。召回結果唔合格時,唔好先靠反覆更換聊天模型排錯。

推薦順序:
確認資料正確,冇重複或者過期版本。
檢查解析正文同 Chunks。
當問法同原文差異好大時,考慮嵌入模型。
候選大致正確但順序唔穩時,再考慮重排模型。
調整後重新索引,並重複同一組測試。

測試問題數量
—
3~5 個
建立可重複嘅質量基線
所有知識庫
覆蓋精確事實、條件規則同易混淆問題
Top K
6,可選 1~50
先保留 6
控制最終片段數量
覆蓋同噪聲之間取捨
調大可能會佔用更多上下文
相似度閾值
0.0,僅配置重排後顯示
由 0.0 開始
過濾重排後嘅低分結果
重排後仍然有噪聲
設得過高會移除正確片段
復測方式
—
每輪只改一項
判斷設定變化嚟自邊度
調優、更新資料或者模型
修改分塊或者模型後先重新索引
正確來源穩定出現喺前幾條結果中。
片段包含回答問題所需嘅條件同結論。
換一種自然講法之後,結果仍然穩定。
更新資料或者設定後,固定問題冇明顯退化。
小林發現「住宿費標準」用原文可以命中,但「住酒店最多可以報幾多」唔穩定。佢先確認資料同 Chunks 正常,再配置嵌入模型並復測。正確片段出現之後偶爾排喺後面,所以之後先加入重排模型。
完成標準係:三種唔同問法都可以喺前幾條結果中搵到同一條住宿標準,而且片段包含適用城市同金額上限。
最後更新
呢個有冇幫助?
呢個有冇幫助?