For the complete documentation index, see llms.txt. This page is also available as Markdown.

Разбор документов и OCR

База знаний может искать только уже распознанный текст. Для отсканированных PDF, двухколоночных статей, сложных таблиц и страниц, состоящих из изображений, сначала нужно правильно распознать основной текст, а затем настроить модель и параметры извлечения.

Чтобы понять, корректен ли разбор, смотрят не на слова «импорт успешно», а на порядок основного текста, ключевые таблицы, суммы, даты и то, правильно ли читается текст со сканов.

Сначала определите тип материалов

Тип материала
Рекомендуемая отправная точка
Обязательная проверка

Markdown, TXT, HTML

Читать по умолчанию

Иерархия заголовков, кодировка, переносы строк

PDF, DOCX, PPTX, из которых можно копировать текст

Сначала использовать обработку по умолчанию

Порядок абзацев, колонтитулы, таблицы

Сканированные PDF, скриншоты, страницы в виде изображений

Локальный или системный OCR

Язык распознавания, суммы, даты, номера

PDF с несколькими колонками, формулами или сложными таблицами

Специализированный обработчик документов

Порядок чтения, структура таблиц, сноски

Место разбора в цепочке поиска

资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图
Ошибки разбора продолжают передаваться в разбиение на фрагменты и поиск; нижележащая модель не может восстановить уже потерянный из основного текста контент.

Настройте и примите один образцовый документ

1

1. Выберите репрезентативный образец

Не импортируйте сразу всю партию. Выберите один документ, который лучше всего выявит проблемы, например отсканированный PDF с таблицами или инструкцию в две колонки.

2

2. Настройте возможности обработки

Откройте [Настройки] → [Обработка документов] и при необходимости настройте сервис разбора документов и OCR. Для облачных сервисов обычно нужен API-ключ или адрес сервиса; для локальных возможностей может потребоваться сначала скачать модель.

文档处理设置中的文件解析与 OCR 服务配置
Сначала приведите в рабочее состояние нужный сервис, затем вернитесь в базу знаний и выберите обработчик.
3

3. Импортируйте и дождитесь готовности

Добавьте образцовый документ в базу знаний. После завершения обработки откройте основной текст и проверьте заголовки, абзацы, номера страниц, таблицы и текст OCR.

4

4. Проверьте Chunks

Убедитесь, что ключевые условия и выводы не были разорваны; колонтитулы и оглавление не должны массово занимать фрагменты за счёт повторов.

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
Сначала проверьте разбиение после того, как основной текст стал правильным; ошибки разбора нельзя исправить простым увеличением размера chunk.
5

5. Повторно проверьте на реальных вопросах

В [Тесте извлечения] введите вопрос, ответ на который находится в этом документе. Результат должен содержать правильный источник, полные условия и ключевые числа.

6

6. Зафиксируйте схему и затем импортируйте пакетно

После того как образец пройдет проверку, импортируйте материалы того же типа партиями. Если обработчик, OCR или настройки разбиения изменились, выполните для старых материалов [Переиндексацию] и повторите тест.

Как выбрать обработчик и OCR

Выбор
Подходящий случай
Преимущества
Примечания

Читать по умолчанию

Обычные текстовые форматы

Меньше настроек, выше скорость

Сложная верстка и отсканированные страницы могут терять содержимое

System OCR

Поддерживается системой и изображение чёткое

Не нужен дополнительный API Key, высокая скорость

Точность зависит от ОС, языка и качества изображения

Локальный PaddleOCR

Нужно распознавание офлайн

Документ не покидает локальный компьютер

Перед первым использованием нужно скачать локальную модель

Облачный или self-hosted обработчик

Две колонки, сложные таблицы, много формул

Обычно более сильные возможности анализа макета

Облачное решение получает содержимое документа для обработки

Как выявлять типичные проблемы

Проявление
Сначала проверьте
Направление исправления

Основной текст пустой или очень короткий

Является ли файл сканом

Включите OCR или смените обработчик

Текст в две колонки перепутан

Порядок чтения основного текста

Используйте обработчик, сильный в анализе макета

Таблица превращается в разрозненный текст

Заголовки столбцов, связи строк и столбцов

Смените обработчик или приведите ключевые правила в порядок в Markdown-заметке

Колонтитулы повторяются снова и снова

Повторяющийся шум в chunks

Очистите исходный файл или смените парсер, не просто увеличивайте Top K

Ошибки OCR в цифрах

Суммы, даты, номера

Повышайте чёткость изображения и вручную проверяйте поля с высоким риском

Описание конфигурации

Параметр конфигурации
Рекомендуемая отправная точка
Когда менять
Действие после изменения

Обработчик файлов

Сначала использовать обработку по умолчанию

Неверный порядок основного текста, потеря таблиц, пустые скан-страницы

Переиндексировать образцовый документ

OCR

Для чётких сканов в приоритете локальные или системные возможности

На страницах в виде изображений нет текста или слишком много ошибок

Переиндексировать и проверить ключевые поля

Размер chunk и перекрытие

Сначала оставить настройки базы знаний по умолчанию

Условия и выводы разрываются

За один раз менять только один параметр и заново индексировать

Проверочный вопрос

3–5 реальных вопросов

После смены обработчика, OCR или разбиения на фрагменты

Сравнивайте по одному и тому же набору вопросов

Кейс пользователя

Сяо Линь импортировал PDF с правилами командировок в две колонки. Статус уже был готов, но в основном тексте левая и правая колонки перемешались, а условия согласования в результатах поиска оказались неполными. Он не стал сначала повышать Top K, а сменил обработчик на более подходящий для анализа макета, заново проиндексировал тот же файл и затем снова проверил основной текст и chunks.

Критерий завершения: условия согласования должны читаться в порядке оригинала, суммы и даты — быть верными, а на фиксированный вопрос должен находиться фрагмент с полными условиями.

Частые вопросы

Если основной текст правильный, нужно ли ещё проверять Chunks?

Да. Правильный основной текст лишь означает, что разбор выполнен корректно; условия и выводы всё ещё могут быть разделены при нарезке.

Можно ли исправить проблемы разбора, увеличив Top K?

Нет. Top K лишь определяет, сколько фрагментов возвращать, и не восстанавливает уже потерянный или перепутанный порядок содержимого основного текста.

Почему после смены обработчика результат не изменился?

Старые материалы всё ещё используют прежний индекс. Выполните [Переиндексацию] для соответствующих записей и затем повторно проверьте теми же вопросами.

Продолжить чтение

Последнее обновление

Это было полезно?