> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/russian/knowledge-base/document-preprocessing.md).

# Разбор документов и OCR

База знаний может извлекать только уже распознанный текст. Для сканированных PDF, двуколоночных статей, сложных таблиц и страниц в виде изображений сначала нужно правильно распознать основной текст, а затем настраивать модель и параметры поиска.

{% hint style="info" %}
Качество распознавания оценивают не по словам «импорт успешно», а по тому, правильно ли читаются порядок основного текста, ключевые таблицы, суммы, даты и текст со сканов.
{% endhint %}

## Сначала определите тип материалов

| Тип материалов                                                | Рекомендуемая отправная точка              | Обязательная проверка                                  |
| ------------------------------------------------------------- | ------------------------------------------ | ------------------------------------------------------ |
| Markdown, TXT, HTML                                           | Читать по умолчанию                        | Уровни заголовков, кодировка, переносы строк           |
| PDF, DOCX, PPTX с копируемым текстом                          | Сначала используйте обработку по умолчанию | Порядок абзацев, верхние и нижние колонтитулы, таблицы |
| Сканированные PDF, скриншоты, страницы в виде изображений     | Локальный или системный OCR                | Язык распознавания, сумма, дата, номер                 |
| PDF с несколькими колонками, формулами или сложными таблицами | Специализированный процессор документов    | Порядок чтения, структура таблиц, сноски               |

## Место распознавания в цепочке поиска

<figure><img src="/files/5a3e1c31d25e83a196491a1b9f856e11e791578e" alt="资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图"><figcaption><p>Ошибки распознавания дальше передаются в разбиение на чанки и поиск; последующая модель не может восстановить то, что уже потеряно из основного текста.</p></figcaption></figure>

## Настройте и примите один образцовый документ

{% stepper %}
{% step %}

### 1. Выберите репрезентативный образец

Не импортируйте сразу всю партию. Выберите документ, который лучше всего выявляет проблемы, например сканированный PDF с таблицами или инструкцию в две колонки.
{% endstep %}

{% step %}

### 2. Настройте возможности обработки

Откройте 【Настройки】→【Обработка документов】 и при необходимости настройте сервис распознавания документов и OCR. Для облачных сервисов обычно нужен API Key или адрес сервиса; локальные возможности иногда требуют предварительной загрузки модели.

<figure><img src="/files/d9620ecac7ded368b791ae66fbdf7faba2960de4" alt="文档处理设置中的文件解析与 OCR 服务配置"><figcaption><p>Сначала переведите нужный сервис в рабочее состояние, затем вернитесь в базу знаний и выберите процессор.</p></figcaption></figure>
{% endstep %}

{% step %}

### 3. Импортируйте и дождитесь готовности

Добавьте образцовый документ в базу знаний. После завершения обработки откройте основной текст и проверьте заголовки, абзацы, номера страниц, таблицы и текст OCR.
{% endstep %}

{% step %}

### 4. Проверьте чанки

Убедитесь, что ключевые условия и выводы не разорваны; верхние и нижние колонтитулы, а также оглавление не должны многократно занимать чанки.

<figure><img src="/files/c408d247a81e89d2eee11b4031c4239addf81367" alt="知识库高级设置中的智能分段、分隔符、分段大小和重叠大小"><figcaption><p>После того как основной текст распознан правильно, проверьте разбиение на чанки; ошибки распознавания нельзя исправить увеличением Chunk.</p></figcaption></figure>
{% endstep %}

{% step %}

### 5. Повторно проверьте на реальных вопросах

В 【Тесте поиска】 задайте вопрос, ответ на который есть в этом документе. Результат должен содержать правильный источник, полные условия и ключевые числа.
{% endstep %}

{% step %}

### 6. Зафиксируйте схему и затем импортируйте пакетно

После того как образец прошёл проверку, пакетно импортируйте документы того же типа. После изменения процессора, OCR или настроек разбиения выполните для старых материалов 【Переиндексацию】 и повторите тест.
{% endstep %}
{% endstepper %}

{% hint style="warning" %}
Переключение процессора или OCR не исправляет автоматически уже проиндексированные старые материалы. Нужно переиндексировать связанные записи, чтобы сравнить старые и новые результаты.
{% endhint %}

## Как выбрать процессор и OCR

| Выбор                              | Подходящие случаи                            | Преимущества                                      | На что обратить внимание                                                            |
| ---------------------------------- | -------------------------------------------- | ------------------------------------------------- | ----------------------------------------------------------------------------------- |
| Читать по умолчанию                | Обычные текстовые форматы                    | Мало настроек, высокая скорость                   | При сложной верстке и на сканированных страницах часть содержимого может потеряться |
| System OCR                         | Поддерживается системой и изображение чёткое | Не нужен дополнительный API Key, высокая скорость | Точность зависит от ОС, языка и качества изображения                                |
| Локальный PaddleOCR                | Требуется офлайн-распознавание               | Документ не покидает локальный компьютер          | Перед первым использованием нужно скачать локальную модель                          |
| Облачный или self-hosted процессор | Две колонки, сложные таблицы, много формул   | Обычно более сильные возможности анализа макета   | Облачное решение получает содержимое документа для обработки                        |

{% hint style="danger" %}
Перед использованием облачного процессора для конфиденциальных данных сначала проверьте условия обслуживания, политику хранения данных и права доступа к аккаунту. Для полностью офлайн-режима локальные возможности должны использоваться на всех этапах: распознавание, OCR, эмбеддинги, rerank и чат.
{% endhint %}

## Как находить типичные проблемы

| Проявление                                | Сначала проверьте                 | Направление исправления                                                                |
| ----------------------------------------- | --------------------------------- | -------------------------------------------------------------------------------------- |
| Основной текст пустой или очень короткий  | Является ли файл сканом           | Включите OCR или смените процессор                                                     |
| Текст в две колонки перемешан             | Порядок чтения основного текста   | Используйте процессор, хорошо анализирующий макет                                      |
| Таблицы превращаются в разрозненный текст | Заголовки, связи строк и столбцов | Смените процессор или оформите ключевые правила в Markdown-заметки                     |
| Верхние и нижние колонтитулы повторяются  | Повторяющийся шум в чанках        | Очистите исходный файл или смените парсер, не ограничивайтесь только увеличением Top K |
| Ошибки в числах OCR                       | Суммы, даты, номера               | Улучшите чёткость изображения и вручную проверьте поля с высоким риском                |

## Описание настройки

| Параметр настройки        | Рекомендуемая отправная точка                                         | Когда менять настройки                                                                | Действие после изменения                                    |
| ------------------------- | --------------------------------------------------------------------- | ------------------------------------------------------------------------------------- | ----------------------------------------------------------- |
| Процессор документов      | Сначала используйте обработку по умолчанию                            | Неправильный порядок основного текста, таблицы пропали, сканированные страницы пустые | Переиндексируйте образцовый документ                        |
| OCR                       | Для чётких сканов предпочтительны локальные или системные возможности | На страницах в виде изображений нет текста или много опечаток                         | Переиндексируйте и проверьте ключевые поля                  |
| Размер чанка и перекрытие | Сначала оставьте настройки базы знаний по умолчанию                   | Условия и выводы разорваны                                                            | За один раз меняйте только один параметр и переиндексируйте |
| Проверочный вопрос        | 3–5 реальных вопросов                                                 | После смены процессора, OCR или разбиения на чанки                                    | Сравнивайте на одном и том же наборе вопросов               |

## Сценарий пользователя

Сяолинь импортировал PDF с правилами командировок в две колонки. Статус уже был готов, но в основном тексте левая и правая колонки перемешались, а в результатах поиска не хватало полных условий согласования. Он не стал сначала увеличивать Top K, а выбрал процессор, лучше подходящий для анализа макета, заново проиндексировал тот же файл и затем проверил основной текст и чанки.

Критерий готовности такой: условия согласования читаются в порядке исходного текста, суммы и даты верны, а фиксированные вопросы находят фрагмент с полными условиями.

## Часто задаваемые вопросы

<details>

<summary>Если основной текст распознан правильно, нужно ли всё равно смотреть на Chunks?</summary>

Да. Правильный основной текст означает только то, что распознавание прошло успешно; условия и выводы всё ещё могут быть разделены при разбиении.

</details>

<details>

<summary>Может ли увеличение Top K исправить проблему распознавания?</summary>

Нет. Top K только управляет количеством возвращаемых фрагментов и не может восстановить уже потерянный или перепутанный порядок в основном тексте.

</details>

<details>

<summary>Почему после смены процессора результат не изменился?</summary>

Старые данные всё ещё используют прежний индекс. Выполните 【Переиндексацию】 для связанных записей и повторно проверьте тем же вопросом.

</details>

## Читать далее

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Добавление и организация материалов</strong></td><td>Выберите источник и проверьте статус обработки.</td><td><a href="/pages/f356578f978b2dfd1a2a4f6a12204cc99ea4e90c">/pages/f356578f978b2dfd1a2a4f6a12204cc99ea4e90c</a></td></tr><tr><td><strong>Проверка материалов и извлечения</strong></td><td>Проверьте распознавание и разбиение с помощью фиксированных вопросов.</td><td><a href="/pages/cb186404cc8d9f393c6d0efdfa6b1a265c83510f">/pages/cb186404cc8d9f393c6d0efdfa6b1a265c83510f</a></td></tr><tr><td><strong>Данные, конфиденциальность и сопровождение</strong></td><td>Подтвердите границы данных между локальной и облачной средой.</td><td><a href="/pages/c8a6f1b5836ae79ec3b4c719c9c7f566343b544e">/pages/c8a6f1b5836ae79ec3b4c719c9c7f566343b544e</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/russian/knowledge-base/document-preprocessing.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
