For the complete documentation index, see llms.txt. This page is also available as Markdown.

資料の確認と再現

再現テストでは「問題が正しい断片を見つけられるか」を直接確認し、先にチャットモデルで整えることはしません。これにより、問題が資料、解析、分割、または検索設定のどこにあるかを判断しやすくなります。

すでに答えを知っている実際の質問を3~5個用意し、資料、モデル、または分割を更新するたびに繰り返し使用します。固定した質問のほうが、一時的な試問より劣化を見つけやすくなります。

テスト用の質問を準備する

次の3種類の質問をあわせてカバーすることを推奨します。

  • 正確な事実、例えば「国内の一線都市での宿泊費の上限はいくらですか?」

  • 条件ルール、例えば「海外でのレンタカーはどのような場合に経費精算できますか?」

  • 紛らわしいもの、例えば「5,000元を超える出張は誰が追加承認しますか?」

資料のタイトルや全文そのままでテストするだけではいけません。それでは実際の使用効果を過大評価してしまいます。

再現テストを1回実施する

1

1. 再現テストを開く

左側ナビゲーションの【ナレッジベース】を開く → ナレッジベースを選択 → 【再現テスト】に入ります。

2

2. 実際の質問を入力する

答えが明確な質問を入力してテストを実行します。質問は日常的な言い方に近づけ、資料原文を意図的にそのまま写さないでください。

3

3. ソースと断片を確認する

ソースが正しいこと、そして断片に回答に必要な条件と結論の両方が含まれていることを確認します。

召回测试中的命中来源、相关度、片段内容和排序
結果があるかだけでなく、ソース、断片の完全性、順序も確認してください。
4

4. 現象を照らし合わせて問題を特定する

正しい断片がまったく出ない場合は、まず資料、解析、分割を確認します。正しい断片は出るが順序が安定しない場合は、埋め込み、再ランキング、またはTop Kを検討します。

5

5. 1項目ずつ調整して再テストする

各回で変更する設定は1つだけにします。解析、分割、またはインデックスに関わる場合は、まず【再インデックス】を実行し、その後同じ質問セットで再テストします。

結果の読み方

現象
説明
次の手順

正しいソースが前方にあり、断片が完全

再現率は基本的に合格

別の聞き方でもう少しテストする

正しい結果がまったくない

資料未準備、内容不足、質問の言い回しの差が大きい、または閾値が高すぎる

資料、本文、Chunks、検索設定を順に確認する

ソースは正しいが断片に重要な文が欠けている

解析または分割の境界が最適ではない

Chunksを確認し、調整後に再インデックスする

旧バージョンと新バージョンが同時に表示される

同名資料がすべて保持されている

古い項目を削除するか、【置換】で再インポートする

正しい項目がいつも後ろにある

候補が多すぎる、または並び順が不安定

資料を整理し、埋め込みモデルや再ランキングモデルを検討する

再現は正しいが、チャットの回答が不正確

問題はプロンプトまたはチャットモデルにある可能性が高い

再現設定はそのままにして、質問の仕方とチャットモデルを調整する

チューニングの閉ループ

用固定问题检查召回、定位问题、单项调整、重新索引并复测的质量调优闭环
固定した質問 → 結果を確認 → 階層を特定 → 1項目ずつ調整 → 必要なら再インデックス → 再テスト。

推奨順序:

  1. 資料が正しく、重複や古いバージョンがないことを確認する。

  2. 解析された本文とChunksを確認する。

  3. 質問の言い回しが原文と大きく異なる場合は、埋め込みモデルを検討する。

  4. 候補は概ね正しいが順序が安定しない場合は、再ランキングモデルを検討する。

  5. 調整後に再インデックスし、同じテストセットを繰り返す。

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
断片が不完全な場合は分割設定を再確認する。変更は新しい資料にしか反映されないため、古い資料は再インデックスが必要です。

設定の説明

設定項目
製品のデフォルト値
推奨の開始値
役割
適用場面
注意事項

テスト質問数

3~5個

再現可能な品質基準を作る

すべてのナレッジベース

正確な事実、条件ルール、紛らわしい質問をカバーする

Top K

6、オプションで1~50

まずは6のままにする

最終的な断片数を制御する

カバレッジとノイズのトレードオフ

大きくすると、より多くのコンテキストを占有する可能性がある

類似度しきい値

0.0、再ランキングを設定した場合のみ表示

0.0から開始する

再ランキング後の低スコア結果をフィルタリングする

再ランキング後もノイズが残る

高くしすぎると正しい断片が除外される

再テスト方法

各回で変更は1項目のみ

設定変更がどこから来たのかを判断する

チューニング、資料更新、またはモデル更新

分割やモデルを変更した後は先に再インデックスする

期待される結果

  • 正しいソースが安定して最初の数件の結果に現れる。

  • 断片には質問に答えるために必要な条件と結論が含まれている。

  • 自然な別の言い方に変えても、結果は引き続き安定している。

  • 資料または設定を更新した後も、固定質問に明らかな劣化がない。

ユーザー事例

小林さんは、「宿泊費の基準」は原文ではヒットするのに、「ホテル代はいくらまで精算できるか」は不安定だと気づきました。まず資料とChunksが正常か確認し、その後埋め込みモデルを設定して再テストしました。正しい断片が出るようになっても、時々後ろに表示されたため、最後に再ランキングモデルを追加しました。

合格基準は、3種類の異なる聞き方のどれでも、同じ宿泊基準が最初の数件の結果に見つかり、かつ断片に適用都市と金額上限が含まれていることです。

よくある質問

正しい断片がまったくない場合、まずTop Kを増やしますか?

まず資料本文とChunksを確認してください。解析や分割に誤りがあると、Top Kを増やしても不正確または不完全な断片がさらに増えるだけです。

なぜ類似度しきい値が見えないのですか?

再ランキングモデルを選択した場合にのみ、ナレッジベース設定で【類似度しきい値】が表示されます。

再現は正しいのに、チャットの回答がまだ不正確な場合は?

現在の再現設定は維持し、質問表現、会話コンテキスト、チャットモデルを確認してください。この段階では、問題はすでに資料検索層にないことが多いです。

続きを読む

最終更新

役に立ちましたか?