For the complete documentation index, see llms.txt. This page is also available as Markdown.

Введение в базу знаний

База знаний упорядочивает файлы, заметки, каталоги или веб-страницы в набор материалов, которые можно многократно искать. Сначала с помощью теста на извлечение убедитесь, что система находит нужные фрагменты, а затем передайте базу знаний для использования в диалоге или Agent.

Если нужно лишь временно обработать небольшой фрагмент текста, быстрее просто вставить его в диалог. Если материалы будут использоваться многократно и ответ должен опираться на внутренние источники, тогда стоит создать базу знаний.

Когда подходит использование

Требование
Рекомендуемый способ
Причина

Запросы к регламентам сотрудников, руководствам по продукту, материалам проектов

Создать базу знаний

Материалы будут использоваться повторно, нужно стабильно ссылаться на исходный текст

Временно проанализировать одно вложение

Загрузить напрямую в диалоге

Не требуется длительное сопровождение и индексация

Материалы всё ещё находятся в процессе подготовки

Сначала упорядочить в «Заметках»

Чтобы неподтверждённый контент не был принят за официальный ответ

Нужно долгое автоматическое обработка материалов

После создания базы привязать её к Agent

Agent может постоянно использовать один и тот же набор материалов в рамках задачи

Что происходит при одном ответе

从资料解析、分块、BM25 与向量检索到合并、重排和 Top K 的知识库检索架构图
Сначала материалы проходят разбор и разбиение на части, затем по ключевым словам или по смыслу находятся кандидаты на ответ; чат-модель только формирует ответ на основе извлечённого контента.

Сначала познакомьтесь с этими терминами

Название
Значение в этой задаче

База знаний

Набор материалов и настроек поиска, организованный вокруг одной темы

Элемент материала

Импортированный файл, заметка, файл из каталога или снимок веб-страницы

Chunk

Небольшой фрагмент, используемый для поиска после разбиения материалов

Извлечение

Процесс поиска релевантных фрагментов по вопросу

Модель эмбеддингов

Преобразует текст в вектор для сопоставления контента с разными формулировками, но схожим смыслом; не обязательна

Модель переранжирования

Повторно оценивает и сортирует кандидатов-фрагменты; тоже опциональна

Первое использование за 5 минут

1

1. Создайте базу знаний с чёткими границами

Откройте левую навигацию «База знаний» → нажмите кнопку добавления над списком баз знаний. Название используйте в формате «объект + назначение», например «Регламент командировок сотрудников».

2

2. Выберите способ поиска

Для первого знакомства можно установить для «Модели эмбеддингов» значение «Не использовать». Когда потребуется сопоставление разговорных формулировок или синонимов, настройте модель эмбеддингов.

3

3. Добавьте материалы

После входа в базу знаний нажмите кнопку добавления материалов и выберите «Файл», «Заметка», «Каталог» или «Ссылка».

知识库中的文件、笔记、目录和链接四种资料入口
Выбирайте вход в зависимости от источника материалов; не импортируйте лишние каталоги только ради сокращения операций.
4

4. Дождитесь, пока материалы станут готовы

После завершения обработки материалы появятся в списке. Проверьте выборочно основной текст и Chunks, чтобы убедиться, что нет искажений, пропусков страниц или явной перепутанной последовательности.

包含多条已处理资料的员工差旅制度知识库
Даже после готовности материалов нужно выборочно проверять контент; завершение импорта не означает, что качество поиска уже соответствует требованиям.
5

5. Выполните тест на извлечение

Откройте «Тест на извлечение», введите реальный вопрос, ответ на который вам уже известен, и проверьте, появляется ли правильный источник среди первых результатов.

6

6. Перейдите к диалогу или привяжите к Agent

После того как извлечение стабилизируется, выберите базу знаний в поле ввода диалога; для долгосрочного рабочего процесса привяжите базу знаний на странице редактирования Agent.

Рекомендуемая отправная точка

Параметр
Значение по умолчанию продукта
Рекомендуемое начальное значение
Назначение
Сценарий применения
Примечания

Область базы знаний

Одна чётко определённая тема

Контролирует, какие материалы участвуют в поиске вместе

Регламенты, продукты, материалы проектов

Содержимое с разными правами доступа или жизненным циклом следует разделять

Модель эмбеддингов

Не использовать

Сначала не использовать

Определяет, включать ли векторный поиск

Разница между разговорной формулировкой и исходным текстом довольно велика

Тарификация и обработка данных облачной модели зависят от поставщика услуги

Тестовые вопросы

3–5 реальных вопросов

Построить долгосрочную базу для регрессионной проверки

После каждого обновления материалов или настроек

Не тестируйте только по заголовкам материалов и дословным фразам

Перейти к промышленному использованию

Материалы, Chunks и извлечение — всё успешно прошло проверку

Чтобы не переносить в диалог проблемы разбора или поиска

Все базы знаний

Чат-модель не может восстановить важную информацию, если она не была извлечена

Как понять, что уже можно использовать

  • Все нужные материалы отображаются как доступные и не застревают долго в состоянии обработки или ошибки.

  • Случайно откройте один-два материала: в основном тексте и Chunks нет искажений, пропусков страниц или явной перепутанной последовательности.

  • Используйте фиксированные вопросы для теста на извлечение; правильный источник стабильно появляется среди первых результатов.

Пример пользователя

Сяолинь хотел, чтобы коллеги могли запрашивать регламент командировок. Он создал базу знаний «Регламент командировок сотрудников», импортировал три материала о проживании, транспорте и согласовании и сначала не настраивал модель эмбеддингов. После того как все три материала стали готовы, он протестировал систему вопросами вроде «Каков лимит на проживание в Пекине?» и «Кто утверждает суммы свыше 5000 юаней?»

Критерий завершения: по каждому вопросу удаётся найти правильный источник регламента, а фрагменты одновременно содержат применимые условия и вывод. Только после достижения этого уровня он привязал базу знаний к Agent, отвечающему за вопросы сотрудников.

Частые вопросы

Чем база знаний отличается от чат-модели?

База знаний отвечает за поиск фрагментов в ваших материалах, а чат-модель — за понимание вопроса и формирование ответа. Если на этапе извлечения не найдено ключевой информации, простая смена чат-модели обычно не помогает.

Можно ли сразу использовать материалы после успешного импорта?

Ещё нужно выборочно проверить основной текст и Chunks, а также выполнить тест на извлечение. Успешный импорт лишь означает, что процесс обработки завершён, но не гарантирует полноту или правильный порядок результатов.

После изменения настроек разбиения старые материалы изменятся автоматически?

Нет. Чтобы уже имеющиеся материалы использовали новые настройки разбиения, нужно выполнить «Переиндексацию», а затем повторно протестировать на той же группе вопросов.

Читать дальше

Последнее обновление

Это было полезно?