文档解析与 OCR
最后更新于
这有帮助吗?
知识库只能检索已经解析出的文字。扫描 PDF、双栏论文、复杂表格和图片型页面,先把正文解析正确,再调整模型和召回参数。
判断解析是否合格,不看“导入成功”四个字,而看正文顺序、关键表格、金额日期和扫描文字能否被正确读取。
Markdown、TXT、HTML
默认读取
标题层级、编码、换行
可复制文字的 PDF、DOCX、PPTX
先用默认处理
段落顺序、页眉页脚、表格
扫描 PDF、截图、图片型页面
本地或系统 OCR
识别语言、金额、日期、编号
多栏、公式或复杂表格 PDF
专用文档处理器
阅读顺序、表格结构、脚注

切换处理器或 OCR 不会自动修复已经索引的旧资料。必须重新索引相关条目,才能比较新旧结果。
默认读取
文本型常见格式
配置少、速度快
复杂排版和扫描页可能丢失内容
System OCR
系统支持且图片清晰
无需额外 API Key、速度快
准确率取决于操作系统、语言和图像质量
本地 PaddleOCR
需要离线识别
文档不离开本机
首次使用前需要下载本地模型
云端或自托管处理器
双栏、复杂表格、公式较多
版面分析能力通常更强
云端方案会接收用于处理的文档内容
敏感资料使用云端文档处理器前,先确认服务条款、数据保留策略和账号权限。完全离线需要解析、OCR、嵌入、重排和聊天各环节都使用本地能力。
正文为空或很短
文件是否为扫描件
启用 OCR 或更换处理器
双栏文字交错
正文阅读顺序
使用擅长版面分析的处理器
表格变成零散文字
表头、行列关系
更换处理器,或把关键规则整理成 Markdown 笔记
页眉页脚反复出现
Chunks 中的重复噪声
清理源文件或换解析器,不要只提高 Top K
OCR 数字出错
金额、日期、编号
提高图像清晰度并人工核对高风险字段
文件处理器
先用默认处理
正文错序、表格丢失、扫描页为空
重新索引样本文档
OCR
清晰扫描件优先本地或系统能力
图片型页面没有文字或错字较多
重新索引并核对关键字段
Chunk 大小与重叠
先保留知识库默认设置
条件与结论被切开
每轮只改一项并重新索引
验收问题
3~5 个真实问题
更换处理器、OCR 或分块后
使用同一问题集比较
小林导入一份双栏差旅制度 PDF。状态已经就绪,但正文把左右两栏交错在一起,召回结果中的审批条件也不完整。他没有先调高 Top K,而是换用更适合版面分析的处理器,重新索引同一文件,再检查正文和 Chunks。
完成标准是:审批条件按原文顺序可读,金额和日期正确,固定问题能召回包含完整条件的片段。
最后更新于
这有帮助吗?
这有帮助吗?