常見問題
遇到知識庫問題時,先判斷失敗發生喺導入、解析、分塊、召回定係回答層。一次只改一個變量,先至知道邊項調整真係有效。
最快嘅定位方法係用同一個真實問題一路檢查:正文有冇答案、Chunk 係咪完整、召回係咪正確、回答係咪忠於來源。
5 步快速定位
問題應該反饋去邊度

截圖、日誌同示例資料中唔好公開 API Key、內部文件內容、電郵或者本地敏感路徑。
創建與導入
支援邊啲來源同文件格式?
來源包括文件、Cherry Studio 筆記、本地目錄同網頁連結。文件格式包括 PDF、DOCX、DOC、PPTX、XLSX、XLS、Markdown、TXT、CSV、HTML 同 EPUB。
解析與召回
對話與 Agent
模型、數據與備份
配置說明:診斷基線
項目
推薦起點
只喺咩情況下調整
Top K
6
正確片段被截咗或者噪聲太多
相似度閾值
配置重排後由 0.0 開始
低分噪聲明顯,且正確片段仍然有餘量
Chunk
保留預設智能分段
條件同結論被切開或者片段過長
嵌入模型
BM25 唔足時再增加
口語問法、同義表達無法穩定命中
重排模型
候選正確但順序唔穩時增加
唔用嚟修復解析錯誤或者缺失正文
用戶案例
小林發現「住宿費標準」喺聊天入面回答錯誤。佢先用相同問題做召回測試,見到正確來源根本冇出現;打開正文後發現雙欄 PDF 已經錯序。更換處理器並重新索引後,召回正確,聊天回答亦恢復正常。
呢個過程只改咗解析器一個變量,所以可以確認根因,而唔係靠同時調大 Top K、Chunk 同閾值碰運氣。
如果仍然解決唔到,請記錄應用版本、操作系統、處理器、嵌入與重排模型、完整錯誤、脫敏最小樣本、召回結果同預期來源。
繼續閱讀
最後更新
呢個有冇幫助?

