For the complete documentation index, see llms.txt. This page is also available as Markdown.

Введение в базу знаний

База знаний упорядочивает файлы, заметки, каталоги или веб-страницы в набор материалов, которые можно многократно искать. Сначала с помощью теста на извлечение подтвердите, что система находит правильные фрагменты, а затем передайте базу знаний для использования в диалоге или Agent.

Если нужно лишь быстро обработать небольшой отрывок текста, проще сразу вставить его в диалог. Когда материалы будут использоваться многократно и ответ должен опираться на внутренние данные, тогда уже создавайте базу знаний.

Когда это подходит для использования

Потребность
Рекомендуемый способ
Причина

Запросы о правилах для сотрудников, руководствах по продуктам, проектных материалах

Создать базу знаний

Материалы будут использоваться повторно, нужен стабильный доступ к исходному тексту

Временно проанализировать одно вложение

Непосредственно загрузить в диалог

Не требуется долгосрочное сопровождение и индексирование

Материалы ещё находятся в процессе постоянной整理

Сначала структурировать с помощью 【Заметки】

Избежать того, чтобы неподтверждённый контент считался официальным ответом

Требуется долгосрочная автоматическая обработка материалов

После создания базы привязать Agent

Agent может постоянно использовать один и тот же набор материалов в рамках задачи

Что происходит за один ответ

从资料解析、分块、BM25 与向量检索到合并、重排和 Top K 的知识库检索架构图
Сначала материалы проходят разбор и разбиение на фрагменты, затем по ключевым словам или по смыслу находятся кандидаты; языковая модель чата лишь на основе извлечённого контента формирует ответ.

Сначала познакомьтесь с этими терминами

Название
Значение в этой задаче

База знаний

Набор материалов и настроек поиска, организованный вокруг одной темы

Элемент материала

Один импортированный файл, заметка, файл из каталога или снимок веб-страницы

Chunk

Небольшой фрагмент, используемый для поиска после разбиения материалов

Извлечение

Процесс нахождения релевантных фрагментов по вопросу

Модель векторизации

Преобразует текст в векторы, чтобы сопоставлять формулировки с похожим смыслом; не является обязательной

Модель переранжирования

Повторно оценивает и сортирует кандидатные фрагменты; тоже является необязательной

Первое использование за 5 минут

1

1. Создайте базу знаний с чёткими границами

Откройте левую навигацию 【База знаний】 → нажмите кнопку добавления над списком баз знаний. В названии используйте схему «объект + назначение», например 【Правила командировок для сотрудников】.

2

2. Выберите способ поиска

Для первого знакомства можно установить для 【Модели векторизации】 значение 【Не использовать】. Если нужно сопоставлять разговорные формулировки или синонимы, затем настройте модель векторизации.

3

3. Добавьте материалы

После входа в базу знаний нажмите кнопку добавления материалов и выберите 【Файл】, 【Заметка】, 【Каталог】 или 【Ссылка】.

知识库中的文件、笔记、目录和链接四种资料入口
Выбирайте входной путь в зависимости от источника материалов; не импортируйте нерелевантные каталоги только ради сокращения шагов.
4

4. Дождитесь, пока материалы станут готовы

После завершения обработки материалы появятся в списке. Выборочно проверьте основной текст и Chunks, чтобы убедиться, что нет искажений, пропущенных страниц или явного нарушения порядка.

包含多条已处理资料的员工差旅制度知识库
Даже после того как материалы готовы, нужно выборочно проверять содержимое; завершённый импорт ещё не означает, что качество поиска уже соответствует требованиям.
5

5. Выполните тест на извлечение

Откройте 【Тест на извлечение】, введите реальный вопрос, на который вы уже знаете ответ, и проверьте, появляется ли правильный источник в первых результатах.

6

6. Перейдите к диалогу или привяжите Agent

Когда извлечение стабильно, выберите базу знаний в области ввода диалога; если нужен долгосрочный рабочий процесс, привяжите базу знаний на странице редактирования Agent.

Рекомендуемая отправная точка

Параметр
Значение по умолчанию продукта
Рекомендуемая отправная точка
Назначение
Сценарии применения
Примечания

Область базы знаний

Одна чётко определённая тема

Контролировать, какие материалы участвуют в поиске вместе

Правила, продукты, проектные материалы

Содержимое с разными правами доступа или жизненным циклом следует разделять

Модель векторизации

Не использовать

Сначала не использовать

Определяет, включать ли векторный поиск

Разговорные формулировки сильно отличаются от исходного текста

Тарификация и обработка данных облачной модели зависят от поставщика услуги

Тестовые вопросы

3–5 реальных вопросов

Создать долгосрочный базовый набор для регрессионной проверки

После каждого обновления материалов или настроек

Не тестируйте только по заголовкам материалов и дословным фразам

Перейти к использованию в продакшене

Материалы, Chunks и извлечение — всё проходит проверку

Избежать переноса проблем разбора или поиска в диалог

Все базы знаний

Языковая модель чата не может восстановить важную информацию, если она не была извлечена

Как понять, что уже можно использовать

  • Все нужные материалы отображаются как доступные и не остаются надолго в состоянии обработки или ошибки.

  • Случайно откройте один-два материала: в основном тексте и Chunks нет искажений, пропущенных страниц или явного нарушения порядка.

  • Используйте фиксированные вопросы для теста на извлечение: правильный источник должен стабильно появляться в первых результатах.

Пример пользователя

Сяолинь хотел, чтобы коллеги могли проверять правила командировок. Он создал базу знаний 【Правила командировок для сотрудников】, импортировал три материала о проживании, транспорте и согласовании и сначала не настраивал модель векторизации. После того как все три материала были готовы, он протестировал её вопросами вроде «Каков лимит на проживание в Пекине?» и «Кто утверждает суммы свыше 5000 юаней?»

Критерий завершения такой: на каждый вопрос должен находиться правильный источник правил, а фрагмент должен одновременно содержать условия применения и вывод. Только после этого он привязал базу знаний к Agent, отвечающему за вопросы сотрудников.

Частые вопросы

В чём разница между базой знаний и языковой моделью чата?

База знаний отвечает за поиск фрагментов в ваших материалах, а языковая модель чата — за понимание вопроса и формирование ответа. Если на этапе извлечения не найден ключевой информации, простая замена языковой модели обычно не помогает.

Можно ли сразу использовать после успешного импорта материалов?

Нужно ещё выборочно проверить основной текст и Chunks, а также выполнить тест на извлечение. Успешный импорт лишь означает завершение процесса обработки, но не гарантирует полноту или правильный порядок результатов.

Если изменить настройки разбиения, автоматически ли изменятся старые материалы?

Нет. Чтобы уже имеющиеся материалы использовали новые настройки разбиения, нужно выполнить 【Переиндексацию】, а затем повторно протестировать той же группой вопросов.

Читать далее

Последнее обновление

Это было полезно?