For the complete documentation index, see llms.txt. This page is also available as Markdown.

ナレッジベースの構築と検索テスト

ナレッジベースは、ファイル、Webページ、ノートを検索可能な断片に処理します。これは「資料にはどう書かれているか」に答えるのに適しており、モデルに文書全体を永久記憶させるものではありません。

資料を新規作成してインポート

1

1. 【ナレッジベース】→【ナレッジベースを新規作成】を開く

わかりやすい名前を入力し、利用可能な埋め込みモデルを選択します。埋め込みモデルは資料を検索可能な表現に変換する役割であり、会話に使うメインモデルとは別物です。

2

2. 資料ソースを選択する

ファイル、フォルダ、ノート、またはURLを追加できます。一般的な文書形式には PDF、DOCX、Markdown、Excel、TXT、CSV が含まれます。スキャン文書は、文字を取得するためにOCRが必要な場合があります。

3

3. 処理完了を待つ

ファイル詳細を開いてプレビューと分割を確認します。タイトルの欠落、文字化け、表の構造の欠損がある場合は、まず元ファイルを整理してから再処理してください。

4

4. リコールテストを行う

実際のユーザーが聞くような質問でテストし、ファイル名だけを入力しないでください。返された断片が関連しているか、完全な文脈を含んでいるかを確認してから、Agentに紐付けるか判断します。

新建知识库时的名称、嵌入模型和保存入口
ナレッジベースを新規作成する際は、まず名前を入力し、利用可能な埋め込みモデルを選択します。
员工差旅制度知识库中已就绪的笔记来源与召回测试入口
① 3つの出張資料はすべて準備完了;② 上部の【リコールテスト】をクリックして実際の質問を検証。
知识库对海外租车能否报销的召回测试结果
① 実際の業務で本当に聞かれる質問を入力する;② ヒットした資料、断片の内容、関連度を確認する。

実際の質問でリコール結果を検証する

資料が【準備完了】と表示されたら、実務で実際に起こりうる質問でテストします。たとえば規程ライブラリなら「海外で借りた車は精算できる?」と聞き、返ってきた内容が正しい資料に基づいているか、十分な文脈を含んでいるかを確認します。

表示される結果
次の手順

正しい資料にヒットし、断片で質問に十分答えられる

Agent に紐付けて使用できる

資料にはヒットしたが、断片が途中で切れている

まず元文書の構造を確認し、その後分割長を調整する

古い規程や無関係な資料にヒットする

古い資料を整理し、より明確なタイトルと内容を補う

まったく結果がない

資料の状態と質問の表現を確認し、むやみに返却数を増やさない

リコールテストに合格した後、Agentで完全なQAを検証します。こうすることで、「資料が見つからない」のか、「資料は見つかったが回答がよくない」のかを切り分けられます。

RAG設定の理解方法

RAGとは「先に資料を検索し、それからモデルに回答させる」ことを指します。一般的な設定では、分割長、重なり範囲、返却数、関連度の閾値を制御します。

設定
役割
推奨の開始値
いつ調整するか

分割長

各検索断片にどれだけの内容を含めるかを決める

まずはページの初期値を使う

断片がしばしば文を途中で切ったり、多くのテーマを混在させたりする場合

分割の重なり

隣接する断片のつながりを保持する

少し重なりを持たせる

条項が段をまたぎ、文脈がよく途切れる場合

返却数

一度にいくつの候補断片を提供するか

少量の結果から始める

重要な資料を取りこぼすときは増やし、ノイズが多すぎるときは減らす

関連度のしきい値

無関係な内容を除外する

リコールテストで判断する

無関係な結果が多いときは引き上げ、正しい断片が除外されるときは下げる

知识库 RAG 的分段、返回和过滤设置
リコール結果が不安定な場合に限り、資料構造に応じてRAG設定を調整します。

応用例:社内規程Q&Aライブラリの構築

現行規程を部門ごとに整理し、ファイル名にテーマと適用範囲を含めます。インポート後は「出張時の宿泊費が上限超過したらどう扱うか」「試用期間中の休暇は誰の承認が必要か」など、実際の質問でリコールテストを行います。断片が正確であることを確認したら、このナレッジベースだけを「規程Q&A」Agentに紐付け、回答時には資料名を明示するよう求めます。内容が不足している場合は、見つからなかったと明確に伝えます。

なぜインポート後にずっと結果が出ないのですか?

ファイルの処理状態、埋め込みモデルの接続、文書プレビューを確認してください。スキャン版PDFに抽出可能な文字がない場合は、先にOCRを設定するか、検索可能な版に置き換える必要があります。

最終更新

役に立ちましたか?