Обработка документов
Проще говоря:Это центральная настройка Cherry Studio для «распознавания текста в PDF / изображениях / сканах».
Например, вот что всё от него зависит:
Вы перетаскиваете отсканированный PDF-договор в чат и хотите, чтобы ИИ понял его содержимое
Вы кладёте вБаза знаний, надеясь потом можно будет искать
ваш Агент нужно открыть и проанализировать какой-то скриншот из локальной папки
Во всех этих сценариях сначала нужно превратить «текст на изображении» в «текст, который может прочитать ИИ»; технически этот шаг называется OCR(Optical Character Recognition, оптическое распознавание символов).
Cherry Studio объединяет настройки OCR водной странице настроек: настроив здесь один раз, вы будете использовать одну и ту же конфигурацию во всех местах, где применяется OCR.
Путь к настройкам
Открыть Настройки → Обработка документов:

Панель разделена на две части: отдельно для «распознавания текста на изображениях» и отдельно для «разбора PDF».
1. Сервис OCR — распознавание текста на изображениях
Для: изображений (скриншотов, сканов), содержимого, которое сначала нужно распознать в текст, чтобы ИИ мог его прочитать.
macOS: достаточно выбрать «Системный OCR»,никаких настроек не требуется, используется встроенная в систему функция распознавания, офлайн, бесплатно ✅
Windows: выберите «Системный OCR» — и он готов к использованию; если нужно распознавать языки, отличные от английского/китайского, в Windows нужно скачать соответствующий языковой пакет
Linux / для продвинутых: доступны Tesseract, Paddle OCR, OpenVINO и др.
Сравнение OCR-движков
Системный OCR
Самый простой, без настройки, обычно даёт достаточный результат
Tesseract
Классический open-source OCR, уже встроен в Cherry Studio, поддерживает пользовательские языки
Paddle OCR
Лучше распознаёт китайский язык (open-source от Baidu), требуется «токен доступа к сообществу Xinghe + API URL»
OpenVINO
Можно ускорить на видеокартах Intel
Если не уверены, используйте системный OCR по умолчанию; если распознавание окажется слабым, потом переключите.
2. Поставщик обработки документов — для структурного разбора PDF / сложных документов
Для: PDF с таблицами/несколькими колонками/сканированными страницами, длинных документов. Обычные текстовые PDF можно читать напрямую, без этого шага.
MinerU(по умолчанию)
Бесплатный облачный сервис, специализируется на PDF со сложной версткой (научные статьи, договоры и т. п.), нужно перейти на mineru.net зарегистрироваться и получить API-ключ
Paddle OCR
Офлайн-решение, требуется настроить токен доступа к сообществу Xinghe
Сторонний провайдер
Использует визуальную модель одного из уже настроенных вами провайдеров ИИ для распознавания (умнее, но платно)
Настройка MinerU (вариант по умолчанию)
В API Key В поле введите key, полученный в MinerU
Хост API Оставьте по умолчанию
https://mineru.netПри переключении на базу знаний или Agent дополнительная настройка не нужна — будут автоматически использоваться параметры отсюда
Связь с базой знаний
Обработка документов отвечает только за шаг «не текст → текст»
Преобразованный текст далее идёт через модель эмбеддингов векторизацию и запись в базу
Подробный процесс «включения в базе знаний» см. Предобработка документов базы знаний
Когда настройка не нужна
Если вы импортируете в базу знаний только обычный текст (
.md/.txt/.docxтекстовые абзацы в .txt) → полностью без обработки документовЕсли вы используете только чат, без загрузки файлов → то же самое
Подсказки и советы
MinerU значительно лучше Tesseract справляется с PDF с таблицами/многоколоночной версткой; для научных статей и т. п. — выбор по умолчанию
Для офлайн-сценариев используйте Paddle OCR или Tesseract (работают и без сети)
После смены обработчика ранее уже векторизованные материалы не будут автоматически обработаны заново — потребуется вручную импортировать заново
💡 Получить помощь и отправить отзыв
Если вы в процессе настройки или использования столкнётесь с любыми вопросами, багами или предложениями по улучшению функций, пожалуйста, обратитесь к Обратная связь и предложения официальным каналам, указанным там.
Последнее обновление
Это было полезно?