For the complete documentation index, see llms.txt. This page is also available as Markdown.

ナレッジベース入門

ナレッジベースは、ファイル、ノート、ディレクトリ、またはWebページを、繰り返し検索できる資料集合として整理します。まずリコールテストでシステムが正しい断片を見つけられることを確認し、その後ナレッジベースを会話やAgentに使わせます。

短い文章を一時的に処理するだけなら、そのまま会話に貼り付けるほうが早いです。資料が繰り返し使われ、答えは内部資料を基準にする必要があるときに、ナレッジベースを作成します。

どんなときに使うのが適切か

要件
推奨する方法
理由

社員規程、製品マニュアル、プロジェクト資料を検索する

ナレッジベースを作成する

資料が繰り返し使われ、原文を安定して引用する必要がある

添付ファイルを一時的に分析する

会話内で直接アップロードする

長期的なメンテナンスや索引付けが不要

資料がまだ整理中

まず【ノート】で整理する

未確認の内容が正式な回答として扱われるのを避ける

資料を長期的に自動処理する必要がある

作成後にAgentへ紐づける

Agentはタスクの中で同じ資料範囲を継続して使える

1回の回答で何が起こるか

从资料解析、分块、BM25 与向量检索到合并、重排和 Top K 的知识库检索架构图
資料はまず解析と分割を経てから、キーワードまたは意味検索で候補断片を見つけます。チャットモデルは、リコールされた内容をもとに回答を組み立てるだけです。

まずこれらの用語を知っておきましょう

名称
このタスクでの意味

ナレッジベース

同じテーマを中心にまとめられた資料群と検索設定

資料項目

取り込まれた1つのファイル、ノート、ディレクトリ内のファイル、またはWebページのスナップショット

Chunk

資料を分割した後に検索に使う小さな断片

リコール

質問に基づいて関連する断片を見つけ出す प्रक्रिया

埋め込みモデル

文字をベクトルに変換し、表現は異なっても意味が近い内容を照合するために使う。必須ではない

再ランキングモデル

候補断片を再度採点して並べ替える。これも任意

5分で初回利用を完了

1

1. 境界が明確なナレッジベースを作成する

左側ナビゲーションの【ナレッジベース】を開き、ナレッジベース一覧の上にある新規追加ボタンをクリックします。名前は「対象 + 用途」とし、たとえば【社員出張規程】のようにします。

2

2. 検索方式を選ぶ

初回体験では【埋め込みモデル】を【使わない】に設定してよいです。口語的な質問や同義表現に合わせる必要があるときに、埋め込みモデルを設定します。

3

3. 資料を追加する

ナレッジベースに入ったら、資料追加ボタンをクリックし、【ファイル】、【ノート】、【ディレクトリ】、または【リンク】を選びます。

知识库中的文件、笔记、目录和链接四种资料入口
資料ソースに応じて入口を選びます。操作を減らそうとして、関係ないディレクトリをまとめて取り込まないでください。
4

4. 資料が準備完了になるのを待つ

処理が完了すると、資料が一覧に表示されます。本文とChunksを抜き取り確認し、文字化け、欠落ページ、明らかな順序の乱れがないか確認します。

包含多条已处理资料的员工差旅制度知识库
資料が準備完了になってからも内容を抜き取り確認してください。取り込み完了は、検索品質が合格したことを意味しません。
5

5. リコールテストを完了する

【リコールテスト】を開き、すでに答えを知っている実際の質問を入力して、正しい出典が最初の数件の結果に出るか確認します。

6

6. 会話で使う、またはAgentに紐づける

リコールが安定したら、会話入力欄でナレッジベースを選択します。長期的なワークフローが必要な場合は、Agent編集ページでナレッジベースを紐づけます。

推奨の出発点

設定項目
製品のデフォルト値
推奨の開始点
役割
適用シーン
注意事項

ナレッジベースの範囲

明確な1つのテーマ

一緒に検索に参加する資料を制御する

規程、製品、プロジェクト資料

権限やライフサイクルが異なる内容は分けるべき

埋め込みモデル

使わない

まず使わない

ベクトル検索に含めるかどうかを決める

口語的な質問と原文の差が大きい

クラウドモデルの課金とデータ処理はサービス提供者によって異なる

テスト問題

3~5個の実際の質問

長期的な回帰基準を作る

資料や設定を更新するたびに

資料タイトルと原文だけでテストしない

本番利用に進む

資料、Chunks、リコールの3項目すべてに合格

解析や検索の問題を会話に持ち込まないようにする

すべてのナレッジベース

チャットモデルはリコールされていない重要情報を補えない

使えるようになったかどうかの判断方法

  • 必要な資料がすべて利用可能状態になっており、処理中やエラーのまま長く止まっていない。

  • 1~2件の資料をランダムに開き、本文とChunksに文字化け、欠落ページ、明らかな順序の乱れがないことを確認する。

  • 固定の質問でリコールテストを行い、正しい出典が安定して最初の数件の結果に出る。

ユーザー事例

小林さんは同僚が出張規程を検索できるようにしたいと考えました。彼は【社員出張規程】というナレッジベースを作成し、宿泊、交通、承認の3つの資料を取り込み、まず埋め込みモデルは設定しませんでした。3つの資料が準備完了になった後、「北京の宿泊上限はいくらか」「5000元超は誰が承認するのか」などの質問でテストしました。

完了基準は、各質問で正しい規程の出典が見つかり、断片に適用条件と結論の両方が含まれていることです。この基準を満たして初めて、彼はそのナレッジベースを社員Q&Aを担当するAgentに紐づけました。

よくある質問

ナレッジベースとチャットモデルの違いは何ですか?

ナレッジベースはあなたの資料から断片を見つける役割を担い、チャットモデルは質問を理解して回答を組み立てる役割を担います。リコール段階で重要情報が見つからない場合、単にチャットモデルを変更しても通常は解決しません。

資料の取り込みに成功したら、すぐ使えますか?

本文とChunksの抜き取り確認、そしてリコールテストも必要です。取り込み成功は処理フローが終わったことを示すだけで、結果が完全であることや並び順が正しいことを意味しません。

分割設定を変更した後、古い資料は自動的に変わりますか?

変わりません。既存資料に新しい分割設定を適用するには、【再インデックス】を実行し、同じ質問セットで再テストする必要があります。

続きを読む

最終更新

役に立ちましたか?