For the complete documentation index, see llms.txt. This page is also available as Markdown.

Часто задаваемые вопросы

При проблемах с базой знаний сначала определите, на каком уровне произошёл сбой: при импорте, разборе, нарезке на чанки, ретриве или ответе. Меняйте только одну переменную за раз — так вы поймёте, какая настройка действительно работает.

Самый быстрый способ локализации — проверять один и тот же реальный вопрос по всей цепочке: есть ли ответ в тексте, полон ли чанк, корректен ли ретрив, соответствует ли ответ источнику.

5 быстрых шагов для локализации

1

1. Проверьте состояние материалов

Материалы должны быть в статусе «Готово». Если долго обрабатываются или показывают ошибку, сначала посмотрите сообщение об ошибке и убедитесь, что файл, процессор и сервис модели доступны.

2

2. Проверьте распознанный текст

Откройте предпросмотр текста и убедитесь, что ответ действительно есть, текст со сканов распознан, а двухколоночный макет и таблицы не перепутаны местами.

3

3. Проверьте чанки

Убедитесь, что нужные для вопроса условия и вывод находятся в понятных фрагментах; не позволяйте колонтитулам, нижним колонтитулам и оглавлению заполнять результаты.

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
Если текст правильный, но фрагменты неполные, снова настройте нарезку и переиндексируйте старые материалы.
4

4. Запустите тест ретривa

Проверьте название источника, релевантность и содержимое фрагмента. Полное отсутствие правильных фрагментов и правильные фрагменты, но слишком низко в выдаче, — это две разные проблемы.

召回测试中显示来源名称、相关度和命中片段的结果列表
Сначала докажите, что слой поиска вернул правильное доказательство, а уже потом настраивайте подсказку для диалога.
5

5. Проверьте диалог или Agent

Если ретрив правильный, а ответ ошибочный, убедитесь, что база знаний выбрана или привязана, требуйте отвечать только на основе источников и разбивайте вопрос на более мелкие факты.

Куда сообщать о проблеме

按不知道如何操作、稳定复现、希望增加能力和不希望整理材料选择反馈路径的关系图
Сначала выполните минимальную проверку; если проблему можно стабильно воспроизвести, приложите обезличенные шаги, ошибку и ожидаемый результат.

Создание и импорт

Можно ли создать базу знаний без модели эмбеддингов?

Да. После выбора «Не использовать» всё равно будет применяться ключевой поиск BM25. Если нужно лучше сопоставлять разные формулировки, позже добавьте модель эмбеддингов.

Какие источники и форматы файлов поддерживаются?

Источники включают файлы, заметки Cherry Studio, локальные каталоги и веб-ссылки. Поддерживаемые форматы: PDF, DOCX, DOC, PPTX, XLSX, XLS, Markdown, TXT, CSV, HTML и EPUB.

Сколько элементов можно добавить за раз?

За одну интерактивную операцию можно выбрать до 20 элементов. Больше материалов можно добавлять партиями или через вход в каталог.

При одинаковом имени материала выбрать «Сохранить все» или «Заменить»?

При обновлении регламентов, инструкций или снимков заметок обычно выбирают «Заменить». «Сохранить все» стоит выбирать только если версии действительно должны сосуществовать; тогда добавляйте дату или версию в имя.

Что делать, если материал всё время остаётся в обработке?

Проверьте, открывается ли файл, доступны ли процессор и OCR, а также настроен ли сервис модели. По сообщению об ошибке определите, сбой произошёл на этапе чтения, разбора или эмбеддинга.

Разбор и ретрив

Почему в отсканированном PDF нет текста?

Для сканов нужен OCR. Откройте «Настройки» → «Обработка документов», выберите доступный OCR и затем переиндексируйте документ. Для сложной верстки можно попробовать специализированный процессор документов.

Почему после изменения настроек Chunk результат не изменился?

Новые настройки не пересоздают старые материалы автоматически. Выполните «Переиндексацию» для соответствующих записей и снова проверьте тем же вопросом.

Что делать, если тест ретривa вообще ничего не находит?

Последовательно проверьте статус материалов, есть ли ответ в тексте, совпадают ли ключевые слова в исходнике, завершился ли эмбеддинг, не слишком ли высок порог рерангинга и не слишком ли мал Top K.

Что делать, если источник правильный, а фрагмент неполный?

Посмотрите чанки и убедитесь, не были ли условия и вывод разделены. При необходимости увеличьте размер чанка или перекрытие, либо приведите плохо структурированный исходник в порядок и затем переиндексируйте.

Что делать, если правильный результат слишком низко в выдаче?

Сначала удалите дубликаты и устаревшие материалы, затем рассмотрите модель эмбеддингов. Если кандидаты в целом правильные, но порядок нестабилен, можно усилить рерангинг и заново настроить пороги.

Какое значение Top K выбрать?

Можно начать с 6 и на фиксированном вопросе сравнить пропуски ретривa, шум и время. Top K можно настраивать в диапазоне 1–50; не стоит воспринимать его увеличение как универсальное решение.

Диалог и Agent

Что делать, если вход в базу знаний в диалоге недоступен?

Выберите модель, поддерживающую вызов инструментов, и удалите вложения текущего сообщения. Также убедитесь, что хотя бы одна база знаний содержит материалы со статусом «Готово».

Что делать, если в ответе не показываются источники?

Убедитесь, что в поле ввода действительно выбрана база знаний, а затем прогоните тот же вопрос через тест ретривa. Если ретрив не возвращает правильный фрагмент, сначала исправьте базу знаний.

Что делать, если ретрив правильный, а ответ всё равно неточный?

Попросите модель отвечать только на основе цитируемых источников, разбейте задачу на более мелкие фактические пункты и вручную проверьте важные выводы. В таком случае проблема обычно в подсказке, модели или организации контекста.

Почему Agent не видит базу знаний?

Откройте «Редактировать агент» → «База знаний», привяжите нужную базу к текущему Agent и включите «Поиск по базе знаний» в «Встроенных инструментах».

Меняет ли управление базой знаний сами материалы?

Да. «Управление базой знаний» поддерживает добавление, удаление и обновление документов. Не включайте его для задач только на чтение; перед записью проверьте цель, влияние и способ отката.

Модели, данные и резервное копирование

Почему при смене модели эмбеддингов требуется перестройка?

Векторы, созданные разными моделями эмбеддингов, нельзя напрямую смешивать. Сначала убедитесь, что новая модель работает, и сохраните полную резервную копию, а затем перестраивайте существующий векторный индекс.

Как связаны рерангинг и порог сходства?

Рерангинг заново оценивает кандидатов-фрагменты, а порог отфильтровывает низкооценённые результаты после рерангинга. Если рерангинг не настроен, порог сходства в настройках базы знаний не отображается.

Если локальная модель эмбеддингов скачана, это уже полностью офлайн?

Не обязательно. Разбор, OCR, рерангинг и чат тоже должны использовать только локальные возможности — тогда это действительно полностью офлайн-процесс.

Если изменить исходный файл или веб-страницу, обновление произойдёт автоматически?

Нет. Файлы, заметки и веб-страницы создают материалы на основе содержимого на момент импорта. Снова добавьте материал с тем же именем и выберите «Заменить», затем выполните тест ретривa.

Включает ли облегчённая резервная копия файлы базы знаний?

Нет, она не включает полный файл данных базы знаний. Для миграции или удаления используйте полную резервную копию и после восстановления проверьте материалы и ретрив.

Описание настроек: базовая диагностика

Пункт
Рекомендуемая отправная точка
Изменять только в каких случаях

Top K

6

Правильный фрагмент обрезается или слишком много шума

Порог сходства

Начните с 0.0 после настройки рерангинга

Низкооценённый шум заметен, и у правильного фрагмента ещё есть запас

Chunk

Оставить интеллектуальное разбиение по умолчанию

Условия и вывод разделяются или фрагмент слишком длинный

Модель эмбеддингов

Добавлять только если BM25 недостаточен

Разговорные формулировки и синонимы не удаётся стабильно находить

Модель переранжирования

Добавлять, если кандидаты в целом правильные, но порядок нестабилен

Не использовать для исправления ошибок разбора или отсутствующего текста

Кейс пользователя

Сяолин обнаружил, что на вопрос о «стандарте компенсации за проживание» в чате ответ неверный. Он сначала прогнал тот же вопрос через тест ретривa и увидел, что правильный источник вообще не появляется; открыв текст, он заметил, что двухколоночный PDF был перепутан по порядку. После замены процессора и переиндексации ретрив стал правильным, и ответ чата тоже пришёл в норму.

В этом процессе была изменена только одна переменная — парсер, поэтому удалось подтвердить первопричину, а не полагаться на удачу, одновременно увеличивая Top K, Chunk и порог.

Продолжить чтение

Последнее обновление

Это было полезно?