文件解析同 OCR
最後更新
呢個有冇幫助?
知識庫只可以檢索已經解析出嚟嘅文字。掃描 PDF、雙欄論文、複雜表格同圖片型頁面,先將正文解析正確,再調整模型同召回參數。
判斷解析係咪合格,唔睇「導入成功」四隻字,而係睇正文順序、關鍵表格、金額日期同掃描文字可唔可以正確讀到。
Markdown、TXT、HTML
預設讀取
標題層級、編碼、換行
可複製文字嘅 PDF、DOCX、PPTX
先用預設處理
段落順序、頁眉頁腳、表格
掃描 PDF、截圖、圖片型頁面
本地或系統 OCR
識別語言、金額、日期、編號
多欄、公式或複雜表格 PDF
專用文檔處理器
閱讀順序、表格結構、腳註

切換處理器或 OCR 唔會自動修復已經索引咗嘅舊資料。必須重新索引相關條目,先可以比較新舊結果。
預設讀取
文本型常見格式
配置少、速度快
複雜排版同掃描頁可能會漏內容
System OCR
系統支援而且圖片清晰
唔使額外 API Key、速度快
準確率取決於操作系統、語言同圖像質量
本地 PaddleOCR
需要離線識別
文檔唔會離開本機
首次使用前需要下載本地模型
雲端或自託管處理器
雙欄、複雜表格、公式較多
版面分析能力通常更強
雲端方案會接收用嚟處理嘅文檔內容
敏感資料用雲端文檔處理器之前,先確認服務條款、數據保留策略同帳號權限。完全離線就需要解析、OCR、嵌入、重排同聊天各環節都用本地能力。
正文為空或者好短
文件係咪掃描件
啟用 OCR 或更換處理器
雙欄文字交錯
正文閱讀順序
使用擅長版面分析嘅處理器
表格變成零散文字
表頭、行列關係
更換處理器,或者將關鍵規則整理成 Markdown 筆記
頁眉頁腳反覆出現
Chunks 入面嘅重複噪聲
清理源文件或者換解析器,唔好只係提高 Top K
OCR 數字出錯
金額、日期、編號
提高圖像清晰度並人工核對高風險欄位
文件處理器
先用預設處理
正文錯序、表格遺失、掃描頁為空
重新索引樣本文檔
OCR
清晰掃描件優先本地或系統能力
圖片型頁面冇文字或者錯字好多
重新索引並核對關鍵字段
Chunk 大小同重疊
先保留知識庫預設設定
條件同結論被切開
每輪只改一項並重新索引
驗收問題
3~5 個真實問題
更換處理器、OCR 或分塊後
使用同一問題集比較
小林導入咗一份雙欄差旅制度 PDF。狀態已經就緒,但正文將左右兩欄交錯埋一齊,召回結果入面嘅審批條件亦都唔完整。佢冇先調高 Top K,而係改用更適合版面分析嘅處理器,重新索引同一份文件,再檢查正文同 Chunks。
完成標準係:審批條件可以按原文順序閱讀,金額同日期正確,固定問題可以召回包含完整條件嘅片段。
最後更新
呢個有冇幫助?
呢個有冇幫助?