Часто задаваемые вопросы
При проблемах с базой знаний сначала определите, на каком уровне произошёл сбой: при импорте, разборе, нарезке на чанки, ретриве или ответе. Меняйте только одну переменную за раз — так вы поймёте, какая настройка действительно работает.
Самый быстрый способ локализации — проверять один и тот же реальный вопрос по всей цепочке: есть ли ответ в тексте, полон ли чанк, корректен ли ретрив, соответствует ли ответ источнику.
5 быстрых шагов для локализации
4. Запустите тест ретривa
Проверьте название источника, релевантность и содержимое фрагмента. Полное отсутствие правильных фрагментов и правильные фрагменты, но слишком низко в выдаче, — это две разные проблемы.

Куда сообщать о проблеме

Не публикуйте в скриншотах, логах и примерах материалов API-ключи, содержимое внутренних файлов, e-mail или локальные чувствительные пути.
Создание и импорт
Можно ли создать базу знаний без модели эмбеддингов?
Да. После выбора «Не использовать» всё равно будет применяться ключевой поиск BM25. Если нужно лучше сопоставлять разные формулировки, позже добавьте модель эмбеддингов.
Какие источники и форматы файлов поддерживаются?
Источники включают файлы, заметки Cherry Studio, локальные каталоги и веб-ссылки. Поддерживаемые форматы: PDF, DOCX, DOC, PPTX, XLSX, XLS, Markdown, TXT, CSV, HTML и EPUB.
Сколько элементов можно добавить за раз?
За одну интерактивную операцию можно выбрать до 20 элементов. Больше материалов можно добавлять партиями или через вход в каталог.
При одинаковом имени материала выбрать «Сохранить все» или «Заменить»?
При обновлении регламентов, инструкций или снимков заметок обычно выбирают «Заменить». «Сохранить все» стоит выбирать только если версии действительно должны сосуществовать; тогда добавляйте дату или версию в имя.
Что делать, если материал всё время остаётся в обработке?
Проверьте, открывается ли файл, доступны ли процессор и OCR, а также настроен ли сервис модели. По сообщению об ошибке определите, сбой произошёл на этапе чтения, разбора или эмбеддинга.
Разбор и ретрив
Почему в отсканированном PDF нет текста?
Для сканов нужен OCR. Откройте «Настройки» → «Обработка документов», выберите доступный OCR и затем переиндексируйте документ. Для сложной верстки можно попробовать специализированный процессор документов.
Почему после изменения настроек Chunk результат не изменился?
Новые настройки не пересоздают старые материалы автоматически. Выполните «Переиндексацию» для соответствующих записей и снова проверьте тем же вопросом.
Что делать, если тест ретривa вообще ничего не находит?
Последовательно проверьте статус материалов, есть ли ответ в тексте, совпадают ли ключевые слова в исходнике, завершился ли эмбеддинг, не слишком ли высок порог рерангинга и не слишком ли мал Top K.
Что делать, если источник правильный, а фрагмент неполный?
Посмотрите чанки и убедитесь, не были ли условия и вывод разделены. При необходимости увеличьте размер чанка или перекрытие, либо приведите плохо структурированный исходник в порядок и затем переиндексируйте.
Что делать, если правильный результат слишком низко в выдаче?
Сначала удалите дубликаты и устаревшие материалы, затем рассмотрите модель эмбеддингов. Если кандидаты в целом правильные, но порядок нестабилен, можно усилить рерангинг и заново настроить пороги.
Какое значение Top K выбрать?
Можно начать с 6 и на фиксированном вопросе сравнить пропуски ретривa, шум и время. Top K можно настраивать в диапазоне 1–50; не стоит воспринимать его увеличение как универсальное решение.
Диалог и Agent
Что делать, если вход в базу знаний в диалоге недоступен?
Выберите модель, поддерживающую вызов инструментов, и удалите вложения текущего сообщения. Также убедитесь, что хотя бы одна база знаний содержит материалы со статусом «Готово».
Что делать, если в ответе не показываются источники?
Убедитесь, что в поле ввода действительно выбрана база знаний, а затем прогоните тот же вопрос через тест ретривa. Если ретрив не возвращает правильный фрагмент, сначала исправьте базу знаний.
Что делать, если ретрив правильный, а ответ всё равно неточный?
Попросите модель отвечать только на основе цитируемых источников, разбейте задачу на более мелкие фактические пункты и вручную проверьте важные выводы. В таком случае проблема обычно в подсказке, модели или организации контекста.
Почему Agent не видит базу знаний?
Откройте «Редактировать агент» → «База знаний», привяжите нужную базу к текущему Agent и включите «Поиск по базе знаний» в «Встроенных инструментах».
Меняет ли управление базой знаний сами материалы?
Да. «Управление базой знаний» поддерживает добавление, удаление и обновление документов. Не включайте его для задач только на чтение; перед записью проверьте цель, влияние и способ отката.
Модели, данные и резервное копирование
Почему при смене модели эмбеддингов требуется перестройка?
Векторы, созданные разными моделями эмбеддингов, нельзя напрямую смешивать. Сначала убедитесь, что новая модель работает, и сохраните полную резервную копию, а затем перестраивайте существующий векторный индекс.
Как связаны рерангинг и порог сходства?
Рерангинг заново оценивает кандидатов-фрагменты, а порог отфильтровывает низкооценённые результаты после рерангинга. Если рерангинг не настроен, порог сходства в настройках базы знаний не отображается.
Если локальная модель эмбеддингов скачана, это уже полностью офлайн?
Не обязательно. Разбор, OCR, рерангинг и чат тоже должны использовать только локальные возможности — тогда это действительно полностью офлайн-процесс.
Если изменить исходный файл или веб-страницу, обновление произойдёт автоматически?
Нет. Файлы, заметки и веб-страницы создают материалы на основе содержимого на момент импорта. Снова добавьте материал с тем же именем и выберите «Заменить», затем выполните тест ретривa.
Включает ли облегчённая резервная копия файлы базы знаний?
Нет, она не включает полный файл данных базы знаний. Для миграции или удаления используйте полную резервную копию и после восстановления проверьте материалы и ретрив.
Описание настроек: базовая диагностика
Top K
6
Правильный фрагмент обрезается или слишком много шума
Порог сходства
Начните с 0.0 после настройки рерангинга
Низкооценённый шум заметен, и у правильного фрагмента ещё есть запас
Chunk
Оставить интеллектуальное разбиение по умолчанию
Условия и вывод разделяются или фрагмент слишком длинный
Модель эмбеддингов
Добавлять только если BM25 недостаточен
Разговорные формулировки и синонимы не удаётся стабильно находить
Модель переранжирования
Добавлять, если кандидаты в целом правильные, но порядок нестабилен
Не использовать для исправления ошибок разбора или отсутствующего текста
Кейс пользователя
Сяолин обнаружил, что на вопрос о «стандарте компенсации за проживание» в чате ответ неверный. Он сначала прогнал тот же вопрос через тест ретривa и увидел, что правильный источник вообще не появляется; открыв текст, он заметил, что двухколоночный PDF был перепутан по порядку. После замены процессора и переиндексации ретрив стал правильным, и ответ чата тоже пришёл в норму.
В этом процессе была изменена только одна переменная — парсер, поэтому удалось подтвердить первопричину, а не полагаться на удачу, одновременно увеличивая Top K, Chunk и порог.
Если проблема всё ещё не решается, запишите версию приложения, операционную систему, процессор, модели эмбеддинга и рерангинга, полную ошибку, обезличенный минимальный пример, результаты ретривa и ожидаемый источник.
Продолжить чтение
Последнее обновление
Это было полезно?
