> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/russian/pre-basic/settings/doc-process.md).

# Обработка документов

Проще говоря:**Это центральная настройка Cherry Studio для преобразования «PDF / документов со сложной версткой» в упорядоченный текст.**

PDF с таблицами, многими колонками, сканированными страницами (научные статьи, договоры, отчеты и т. п.) при прямой подаче в модель часто читаются как полная мешанина. Обработка документов сначала с помощью специального движка разбирает их и превращает в структурированный текст, а затем передает в чат или [База знаний](/docs/russian/knowledge-base/knowledge-base.md) использование.

{% hint style="info" %}
**Обработка документов vs OCR**: это два отдельных раздела настроек.

* **Обработка документов**(эта страница): отвечает за **PDF / документы со сложной версткой** структурный разбор.
* [**OCR**](/docs/russian/pre-basic/settings/ocr.md): отвечает за **изображения / сканы** распознавание текста в них.

Обычные PDF с чистым текстом,`.md`/`.txt`/`.docx` и текстовые абзацы в них не требуют ни того, ни другого — можно читать напрямую.
{% endhint %}

### Вход в настройки

Откройте 【Настройки】→【Обработка документов】 и выберите движок разбора в выпадающем списке справа сверху,**выбранный движок станет значением по умолчанию**.

<figure><img src="https://3765361039-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2F0Ut5BptC3t8CtSU1UWpM%2Fuploads%2Fgit-blob-ccfff6a9d37c58e6342c96d246156fddce6c0ab1%2Fdoc-process-overview.png?alt=media" alt=""><figcaption><p>Настройки обработки документов: ① в правом верхнем выпадающем списке выберите движок разбора (по умолчанию MinerU); ниже введите API-ключ и API-адрес выбранного движка</p></figcaption></figure>

### Встроенные движки разбора

В обработке документов встроено 5 движков, по умолчанию **MinerU**:

| движок                   | Описание                                                                                                               | Способ подключения                                                                                                                                       |
| ------------------------ | ---------------------------------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------- |
| **MinerU**(по умолчанию) | Высококачественный инструмент извлечения PDF с открытым исходным кодом от OpenDataLab                                  | API-ключ ([mineru.net/apiManage](https://mineru.net/apiManage))                                                                                          |
| **PaddleOCR**            | OCR-система Baidu Paddle                                                                                               | Введите API-ключ ([сообщество Paddle Xinghe](https://aistudio.baidu.com/paddleocr/)); при самостоятельном развертывании укажите API-адрес вашего сервиса |
| **Doc2x**                | Продвинутый движок восстановления файлов                                                                               | API-ключ ([open.noedgeai.com](https://open.noedgeai.com/apiKeys))                                                                                        |
| **Mistral**              | Сервис разбора и понимания файлов                                                                                      | API-ключ ([mistral.ai](https://mistral.ai/api-keys))                                                                                                     |
| **Open MinerU**          | Самостоятельно разворачиваемый сервис MinerU, подходящий командам, которые хотят сами контролировать цепочку обработки | После самостоятельного развертывания укажите API-адрес (при необходимости — API-ключ)                                                                    |

### Настройка MinerU (вариант по умолчанию)

{% stepper %}
{% step %}

### Введите API-ключ

В поле 【API 密钥】 введите ключ, полученный в MinerU (нажмите справа «Получить ключ», чтобы перейти на страницу заявки; несколько ключей можно разделять запятыми).
{% endstep %}

{% step %}

### Проверьте API-адрес

【API 地址】можно оставить по умолчанию.
{% endstep %}

{% step %}

### Использовать напрямую в базе знаний / чате

При импорте сложных PDF автоматически используются настройки разбора отсюда; при переходе к базе знаний или чату дополнительная настройка не требуется.
{% endstep %}
{% endstepper %}

{% hint style="info" %}
**Переключиться на другой движок**: выберите его в выпадающем списке и укажите для него 【API 密钥】/【API 地址】 — после выбора он станет значением по умолчанию. При этом **PaddleOCR** и **Open MinerU** поддерживается самостоятельное развертывание — после установки укажите в 【API 地址】 адрес вашего собственного сервиса.
{% endhint %}

### Связь с базой знаний

* Обработка документов отвечает только за шаг «сложный документ → упорядоченный текст»;
* преобразованный текст далее идет на [Модель эмбеддингов](/docs/russian/knowledge-base/emb-models-info.md) векторизацию и добавление в базу;
* Подробный процесс «включения в базе знаний» см. [Предобработка документов базы знаний](/docs/russian/knowledge-base/document-preprocessing.md).

### Подсказки и советы

* У MinerU значительно лучше результаты на PDF с таблицами / многоколоночной версткой; для научных статей и т. п. это предпочтительный выбор;
* Нужно распознавать **текст на изображении**(скриншоты, сканы), а не структуру PDF, используйте [OCR](/docs/russian/pre-basic/settings/ocr.md).

***

### Получить помощь и отправить отзыв

Если у вас в процессе настройки или использования возникнут какие-либо вопросы, баги или предложения по улучшению функций, пожалуйста, обратитесь к [Отзывы и предложения](/docs/russian/question-contact/suggestions.md) официальным каналам, указанным там.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/russian/pre-basic/settings/doc-process.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
