文件處理
最後更新
呢個有冇幫助?
簡單講:呢個係 Cherry Studio「將 PDF/圖片/掃描件認字」嘅中央設定。
舉幾個例子,下面呢啲事都依賴佢:
呢啲場景背後都要先將「圖像入面嘅文字」變成「可以俾 AI 讀嘅文字」,呢一步技術上叫 OCR(Optical Character Recognition,光學字符辨識)。
Cherry Studio 將 OCR 設定統一放喺一個設定頁:你喺呢度設定一次,所有用到 OCR 嘅地方都會用同一套設定。
打開 設定 → 文件處理:

面板分兩部分,分別管「圖片識字」同「PDF 解析」。
適用對象:圖片(截圖、掃描件)、需要先識別成文字先可以俾 AI 讀嘅內容。
macOS:揀「系統 OCR」就得,唔使任何設定,借用系統自帶嘅識圖能力,離線、免費 ✅
Windows:揀「系統 OCR」即開即用;如果要識別非英文/中文以外嘅語種,需要喺 Windows 系統下載相應語言包
Linux / 進階:可選 Tesseract、Paddle OCR、OpenVINO 等
系統 OCR
最簡單,免設定,效果通常已經夠
Tesseract
經典開源 OCR,已內置喺 Cherry Studio 入面,支援自訂語言
Paddle OCR
中文辨識效果更好(百度開源),需要「星河社區存取權杖 + API URL」
OpenVINO
Intel 顯示卡可加速
唔確定時用預設系統 OCR,辨識效果唔理想再轉。
適用對象:帶表格/多欄/掃描頁嘅 PDF、長文檔。普通純文字 PDF 直接讀就得,唔使經過呢度。
MinerU(預設)
免費雲服務,專攻複雜版面 PDF(學術論文、合同等),要去 mineru.net 註冊攞 API Key
Paddle OCR
離線方案,需要配置星河社區存取權杖
第三方供應商
調用你已設定嘅某間 AI 服務商嘅視覺模型嚟識別(效果更智能但要收費)
喺 API Key 喺欄位填入 MinerU 申請到嘅 key
API Host 保持預設 https://mineru.net
切換到知識庫或者 Agent 時唔使額外設定,會自動用呢度嘅設定
你只用知識庫匯入純文字(.md / .txt / .docx 入面嘅純文字段落)→ 完全唔經文件處理
你只用對話功能、唔傳文件 → 同上
MinerU 對帶表格/多欄排版嘅 PDF 效果明顯優於 Tesseract,遇到學術論文等首選
離線場景請用 Paddle OCR 或 Tesseract(無網都行)
切換處理器後,之前已向量化嘅資料 唔會自動重做 —— 要手動重新匯入
如果您喺配置或使用過程中遇到任何疑問、Bug 或有功能改進建議,請參考 反饋同建議 入面提供嘅官方渠道。
最後更新
呢個有冇幫助?
呢個有冇幫助?