> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/russian/knowledge-base/recall-test.md).

# Проверка материалов и извлечения

Тест на полноту извлечения напрямую проверяет, «можно ли найти правильный фрагмент», без предварительной шлифовки чат-моделью. Он помогает понять, в чем проблема: в материалах, парсинге, разбиении на фрагменты или настройках поиска.

{% hint style="info" %}
Подготовьте 3–5 реальных вопросов, ответы на которые вам уже известны, и повторно используйте их после каждого обновления материалов, модели или разбиения на фрагменты. Фиксированные вопросы легче выявляют деградацию, чем случайные пробные запросы.
{% endhint %}

## Подготовить тестовые вопросы

Рекомендуется одновременно охватить три типа вопросов:

* Точные факты, например: «Каков максимальный лимит на проживание в городах первого уровня в Китае?»
* Условные правила, например: «В каких случаях можно возместить аренду автомобиля за границей?»
* Легко путающиеся вопросы, например: «Кто должен дополнительно утверждать командировку на сумму свыше 5000 юаней?»

Не тестируйте только по заголовкам материалов или по полному исходному тексту — это завысит реальную эффективность использования.

## Выполнить один тест на полноту извлечения

{% stepper %}
{% step %}

### 1. Откройте тест на полноту извлечения

Откройте левую навигацию【База знаний】→ выберите базу знаний → войдите в【Тест на полноту извлечения】.
{% endstep %}

{% step %}

### 2. Введите реальный вопрос

Введите вопрос с однозначным ответом и запустите тест. Вопрос должен быть близок к повседневной формулировке, не копируйте намеренно исходный текст материалов.
{% endstep %}

{% step %}

### 3. Проверьте источник и фрагмент

Убедитесь, что источник верный, а фрагмент содержит и условия, и вывод, необходимые для ответа.

<figure><img src="/files/1e072bb8082483e7bfbf7dab3b4aa1e770755b45" alt="召回测试中的命中来源、相关度、片段内容和排序"><figcaption><p>Смотрите не только на наличие результата, но и на источник, полноту фрагмента и порядок.</p></figcaption></figure>
{% endstep %}

{% step %}

### 4. Сопоставьте наблюдение с проблемой

Если нет вообще правильного фрагмента, сначала проверьте материалы, парсинг и разбиение; если правильный фрагмент появляется, но порядок нестабилен, тогда рассмотрите embedding, reranking или Top K.
{% endstep %}

{% step %}

### 5. Меняйте только один параметр и проводите повторный тест

В каждом цикле изменяйте только одну настройку. Если затронуты парсинг, разбиение или индекс, сначала выполните【Переиндексацию】, затем повторно протестируйте тем же набором вопросов.
{% endstep %}
{% endstepper %}

## Как читать результаты

| Явление                                                           | Описание                                                                                         | Следующий шаг                                                                    |
| ----------------------------------------------------------------- | ------------------------------------------------------------------------------------------------ | -------------------------------------------------------------------------------- |
| Правильный источник находится в начале, фрагмент полный           | Полнота извлечения в основном приемлема                                                          | Еще раз протестируйте с несколькими разными формулировками                       |
| Совсем нет правильных результатов                                 | Материалы не готовы, контент отсутствует, формулировка сильно отличается или порог слишком высок | Последовательно проверьте материалы, основной текст, Chunks и настройки поиска   |
| Источник верный, но во фрагменте не хватает ключевого предложения | Пограничные условия парсинга или разбиения на фрагменты неидеальны                               | Посмотрите Chunks, внесите изменения и переиндексируйте                          |
| Старые и новые версии появляются одновременно                     | Все материалы с одинаковым именем сохранены                                                      | Удалите старые записи или импортируйте заново через【Заменить】                    |
| Правильные результаты часто оказываются ниже                      | Слишком много кандидатов или нестабильная сортировка                                             | Очистите материалы, рассмотрите embedding-модель или reranking-модель            |
| Извлечение верное, но ответ чат-модели неточный                   | Проблема, скорее всего, в промпте или чат-модели                                                 | Сохраните настройки извлечения, скорректируйте формулировку запроса и чат-модель |

{% hint style="warning" %}
Чат-модель не может восполнить отсутствие ключевых материалов, не найденных на этапе извлечения. Если результаты извлечения неудовлетворительны, не пытайтесь сначала отлаживать проблему постоянной заменой чат-модели.
{% endhint %}

## Замкнутый цикл настройки

<figure><img src="/files/bd53667e724880a06b8461ee77108ebd1bed714b" alt="用固定问题检查召回、定位问题、单项调整、重新索引并复测的质量调优闭环"><figcaption><p>Фиксированные вопросы → Проверка результатов → Определение уровня проблемы → Изменение одного параметра → При необходимости переиндексация → Повторный тест.</p></figcaption></figure>

Рекомендуемый порядок:

1. Убедитесь, что материалы корректны, нет дубликатов или устаревших версий.
2. Проверьте распарсенный основной текст и Chunks.
3. Если формулировка сильно отличается от исходного текста, рассмотрите embedding-модель.
4. Если кандидаты в целом верны, но порядок нестабилен, тогда рассмотрите reranking-модель.
5. После изменений переиндексируйте и повторите тот же набор тестов.

<figure><img src="/files/c408d247a81e89d2eee11b4031c4239addf81367" alt="知识库高级设置中的智能分段、分隔符、分段大小和重叠大小"><figcaption><p>Если фрагмент неполный, еще раз проверьте настройки разбиения; изменения влияют только на новые материалы, старые нужно переиндексировать.</p></figcaption></figure>

## Описание конфигурации

| Параметр конфигурации          | Стандартное значение продукта                    | Рекомендуемая отправная точка        | Назначение                                            | Сценарий применения                         | На что обратить внимание                                              |
| ------------------------------ | ------------------------------------------------ | ------------------------------------ | ----------------------------------------------------- | ------------------------------------------- | --------------------------------------------------------------------- |
| Количество тестовых вопросов   | —                                                | 3–5                                  | Создать повторяемую базу качества                     | Все базы знаний                             | Охват точных фактов, условных правил и легко путающихся вопросов      |
| Top K                          | 6, можно выбрать от 1 до 50                      | Сначала оставьте 6                   | Контроль количества итоговых фрагментов               | Баланс между полнотой и шумом               | Увеличение может занять больше контекста                              |
| Порог сходства                 | 0.0, отображается только при настройке reranking | Начните с 0.0                        | Фильтрация низкооцененных результатов после reranking | Шум сохраняется даже после reranking        | Слишком высокое значение может удалить правильные фрагменты           |
| Способ повторного тестирования | —                                                | Меняйте только один параметр за цикл | Определить, откуда происходят изменения настроек      | Настройка, обновление материалов или модели | После изменения разбиения или модели сначала выполните переиндексацию |

## Ожидаемый результат

* Правильный источник стабильно появляется в первых нескольких результатах.
* Фрагмент содержит и условия, и вывод, необходимые для ответа на вопрос.
* После переформулировки естественным образом результат по-прежнему стабилен.
* После обновления материалов или настроек фиксированные вопросы не показывают заметной деградации.

## Кейс пользователя

Сяо Лин заметил, что по запросу «норматив на проживание» исходный текст находился, а по формулировке «сколько максимум можно возместить за отель» результат был нестабилен. Сначала он проверил, что материалы и Chunks в порядке, затем настроил embedding-модель и повторил тест. После появления правильного фрагмента он иногда оказывался ниже, и только тогда была добавлена reranking-модель.

Критерий завершения: по трем разным формулировкам один и тот же стандарт проживания должен находиться в первых нескольких результатах, а фрагмент должен содержать применимый город и верхний лимит суммы.

## Частые вопросы

<details>

<summary>Если совсем нет правильного фрагмента, сначала увеличить Top K?</summary>

Сначала проверьте основной текст материалов и Chunks. Если ошибка в парсинге или разбиении, увеличение Top K лишь вернет больше неправильных или неполных фрагментов.

</details>

<details>

<summary>Почему не видно порога сходства?</summary>

Только после выбора reranking-модели в настройках базы знаний будет отображаться【Порог сходства】.

</details>

<details>

<summary>Извлечение верное, но ответ чат-модели все еще неточный — что делать?</summary>

Сохраните текущие настройки извлечения, проверьте формулировку вопроса, контекст диалога и чат-модель. В этом случае проблема обычно уже не на уровне поиска по материалам.

</details>

## Читать далее

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Настройки модели и поиска</strong></td><td>Настройка embedding, reranking, Top K и разбиения.</td><td><a href="/pages/4cd2dac273bd61362710743b0cb64beddcd1307b">/pages/4cd2dac273bd61362710743b0cb64beddcd1307b</a></td></tr><tr><td><strong>Парсинг документов и OCR</strong></td><td>Обработка отсутствующего основного текста, искажений и сканированного контента.</td><td><a href="/pages/53bb043e136eac8710d3cc6e17df25221eec9694">/pages/53bb043e136eac8710d3cc6e17df25221eec9694</a></td></tr><tr><td><strong>Использование в диалоге</strong></td><td>После успешного извлечения используйте базу знаний для ответов на вопросы.</td><td><a href="/pages/3505df22dfb79fa0c9109b65bd99132f2b2b6473">/pages/3505df22dfb79fa0c9109b65bd99132f2b2b6473</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/russian/knowledge-base/recall-test.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
