For the complete documentation index, see llms.txt. This page is also available as Markdown.

Обработка документов

Проще говоря:Это центральная настройка Cherry Studio для преобразования «PDF / документов со сложной версткой» в упорядоченный текст.

PDF с таблицами, многими колонками, сканированными страницами (научные статьи, договоры, отчеты и т. п.) при прямой подаче в модель часто читаются как полная мешанина. Обработка документов сначала с помощью специального движка разбирает их и превращает в структурированный текст, а затем передает в чат или База знаний использование.

Обработка документов vs OCR: это два отдельных раздела настроек.

  • Обработка документов(эта страница): отвечает за PDF / документы со сложной версткой структурный разбор.

  • OCR: отвечает за изображения / сканы распознавание текста в них.

Обычные PDF с чистым текстом,.md/.txt/.docx и текстовые абзацы в них не требуют ни того, ни другого — можно читать напрямую.

Вход в настройки

Откройте 【Настройки】→【Обработка документов】 и выберите движок разбора в выпадающем списке справа сверху,выбранный движок станет значением по умолчанию.

Настройки обработки документов: ① в правом верхнем выпадающем списке выберите движок разбора (по умолчанию MinerU); ниже введите API-ключ и API-адрес выбранного движка

Встроенные движки разбора

В обработке документов встроено 5 движков, по умолчанию MinerU:

движок
Описание
Способ подключения

MinerU(по умолчанию)

Высококачественный инструмент извлечения PDF с открытым исходным кодом от OpenDataLab

API-ключ (mineru.net/apiManage)

PaddleOCR

OCR-система Baidu Paddle

Введите API-ключ (сообщество Paddle Xinghe); при самостоятельном развертывании укажите API-адрес вашего сервиса

Doc2x

Продвинутый движок восстановления файлов

API-ключ (open.noedgeai.com)

Mistral

Сервис разбора и понимания файлов

API-ключ (mistral.ai)

Open MinerU

Самостоятельно разворачиваемый сервис MinerU, подходящий командам, которые хотят сами контролировать цепочку обработки

После самостоятельного развертывания укажите API-адрес (при необходимости — API-ключ)

Настройка MinerU (вариант по умолчанию)

1

Введите API-ключ

В поле 【API 密钥】 введите ключ, полученный в MinerU (нажмите справа «Получить ключ», чтобы перейти на страницу заявки; несколько ключей можно разделять запятыми).

2

Проверьте API-адрес

【API 地址】можно оставить по умолчанию.

3

Использовать напрямую в базе знаний / чате

При импорте сложных PDF автоматически используются настройки разбора отсюда; при переходе к базе знаний или чату дополнительная настройка не требуется.

Переключиться на другой движок: выберите его в выпадающем списке и укажите для него 【API 密钥】/【API 地址】 — после выбора он станет значением по умолчанию. При этом PaddleOCR и Open MinerU поддерживается самостоятельное развертывание — после установки укажите в 【API 地址】 адрес вашего собственного сервиса.

Связь с базой знаний

  • Обработка документов отвечает только за шаг «сложный документ → упорядоченный текст»;

  • преобразованный текст далее идет на Модель эмбеддингов векторизацию и добавление в базу;

  • Подробный процесс «включения в базе знаний» см. Предобработка документов базы знаний.

Подсказки и советы

  • У MinerU значительно лучше результаты на PDF с таблицами / многоколоночной версткой; для научных статей и т. п. это предпочтительный выбор;

  • Нужно распознавать текст на изображении(скриншоты, сканы), а не структуру PDF, используйте OCR.


Получить помощь и отправить отзыв

Если у вас в процессе настройки или использования возникнут какие-либо вопросы, баги или предложения по улучшению функций, пожалуйста, обратитесь к Отзывы и предложения официальным каналам, указанным там.

Последнее обновление

Это было полезно?