ナレッジベース入門
ナレッジベースは、ファイル、ノート、ディレクトリ、またはWebページを、繰り返し検索できる資料集合として整理します。まずリコールテストでシステムが正しい断片を見つけられることを確認し、その後ナレッジベースを会話やAgentに使わせます。
どんなときに使うのが適切か
社員規程、製品マニュアル、プロジェクト資料を検索する
ナレッジベースを作成する
資料が繰り返し使われ、原文を安定して引用する必要がある
添付ファイルを一時的に分析する
会話内で直接アップロードする
長期的なメンテナンスや索引付けが不要
資料がまだ整理中
まず【ノート】で整理する
未確認の内容が正式な回答として扱われるのを避ける
資料を長期的に自動処理する必要がある
作成後にAgentへ紐づける
Agentはタスクの中で同じ資料範囲を継続して使える
1回の回答で何が起こるか

まずこれらの用語を知っておきましょう
ナレッジベース
同じテーマを中心にまとめられた資料群と検索設定
資料項目
取り込まれた1つのファイル、ノート、ディレクトリ内のファイル、またはWebページのスナップショット
Chunk
資料を分割した後に検索に使う小さな断片
リコール
質問に基づいて関連する断片を見つけ出す प्रक्रिया
埋め込みモデル
文字をベクトルに変換し、表現は異なっても意味が近い内容を照合するために使う。必須ではない
再ランキングモデル
候補断片を再度採点して並べ替える。これも任意
埋め込みモデルがなくてもナレッジベースは使えます。その場合は主にBM25のキーワード検索に頼ります。初回体験ではまず【使わない】を選び、作成、取り込み、リコールの流れを通して試すのがおすすめです。
5分で初回利用を完了
推奨の出発点
ナレッジベースの範囲
—
明確な1つのテーマ
一緒に検索に参加する資料を制御する
規程、製品、プロジェクト資料
権限やライフサイクルが異なる内容は分けるべき
埋め込みモデル
使わない
まず使わない
ベクトル検索に含めるかどうかを決める
口語的な質問と原文の差が大きい
クラウドモデルの課金とデータ処理はサービス提供者によって異なる
テスト問題
—
3~5個の実際の質問
長期的な回帰基準を作る
資料や設定を更新するたびに
資料タイトルと原文だけでテストしない
本番利用に進む
—
資料、Chunks、リコールの3項目すべてに合格
解析や検索の問題を会話に持ち込まないようにする
すべてのナレッジベース
チャットモデルはリコールされていない重要情報を補えない
使えるようになったかどうかの判断方法
必要な資料がすべて利用可能状態になっており、処理中やエラーのまま長く止まっていない。
1~2件の資料をランダムに開き、本文とChunksに文字化け、欠落ページ、明らかな順序の乱れがないことを確認する。
固定の質問でリコールテストを行い、正しい出典が安定して最初の数件の結果に出る。
ユーザー事例
小林さんは同僚が出張規程を検索できるようにしたいと考えました。彼は【社員出張規程】というナレッジベースを作成し、宿泊、交通、承認の3つの資料を取り込み、まず埋め込みモデルは設定しませんでした。3つの資料が準備完了になった後、「北京の宿泊上限はいくらか」「5000元超は誰が承認するのか」などの質問でテストしました。
完了基準は、各質問で正しい規程の出典が見つかり、断片に適用条件と結論の両方が含まれていることです。この基準を満たして初めて、彼はそのナレッジベースを社員Q&Aを担当するAgentに紐づけました。
よくある質問
続きを読む
最終更新
役に立ちましたか?

