For the complete documentation index, see llms.txt. This page is also available as Markdown.

よくある質問

ナレッジベースの問題に遭遇したら、まず失敗がインポート、解析、分割、検索、回答のどの層で起きているかを判断します。一度に変える変数は1つだけにすると、どの調整が本当に有効か分かります。

最も速い切り分け方法は、同じ実際の問題で一貫して確認することです。本文に答えがあるか、チャンクが完全か、検索が正しいか、回答がソースに忠実かを見ます。

5ステップで素早く切り分け

1

1. 資料の状態を確認

資料は【準備完了】であるべきです。長時間処理中のまま、またはエラーが表示される場合は、まずエラー情報を確認し、ファイル、処理器、モデルサービスが利用可能かを確認します。

2

2. 解析された本文を確認

本文プレビューを開き、答えが実際に存在するか、スキャン文字が認識されているか、2カラムや表が順序崩れしていないかを確認します。

3

3. チャンクを確認

問題に必要な条件と結論が、理解可能な断片内にあるかを確認します。ヘッダー、フッター、目次が結果を埋め尽くさないようにします。

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小
本文は正しいのに断片が不完全な場合は、分割設定を調整してから古い資料を再インデックスします。
4

4. 検索テストを実行

ソース名、関連度、チャンク内容を確認します。正しいチャンクがまったく出ない場合と、正しいチャンクが後ろに並ぶ場合は、異なる2つの問題です。

召回测试中显示来源名称、相关度和命中片段的结果列表
まず検索層が正しい証拠を返していることを証明してから、会話プロンプトを調整します。
5

5. 会話またはエージェントを確認

検索は正しいのに回答が誤っている場合は、知識ベースが選択またはバインドされているかを確認し、ソースのみに基づいて回答するよう求め、質問をより小さな事実項目に分解します。

問題はどこに報告すべきか

按不知道如何操作、稳定复现、希望增加能力和不希望整理材料选择反馈路径的关系图
まず最小限の切り分けを完了します。安定して再現できる場合は、匿名化した手順、エラー、期待結果を添えます。

作成とインポート

埋め込みモデルなしで知識ベースを作成できますか?

はい。【使用しない】を選んでも、BM25のキーワード検索は引き続き使用されます。異なる表現への一致が必要になったら、埋め込みモデルを追加してください。

どのソースとファイル形式がサポートされていますか?

ソースには、ファイル、Cherry Studioノート、ローカルディレクトリ、Webリンクがあります。ファイル形式には、PDF、DOCX、DOC、PPTX、XLSX、XLS、Markdown、TXT、CSV、HTML、EPUBがあります。

一度に何件追加できますか?

対話形式で選択できるのは最大20件です。より多くの資料は分けて追加するか、ディレクトリの入口を使用してください。

同名資料は【すべて保持】と【置換】のどちらを選ぶべきですか?

制度、マニュアル、ノートのスナップショットを更新する場合は、通常【置換】を選びます。実際に共存が必要な版だけ【すべて保持】を選び、名前に日付やバージョンを入れてください。

資料がずっと処理中のままですが、どうすればよいですか?

ファイルを開けるか、処理器とOCRが利用可能か、モデルサービスが設定済みかを確認します。エラー情報に基づいて、失敗が読み取り、解析、埋め込みのどの段階かを判断します。

解析と検索

スキャンPDFに文字がないのはなぜですか?

スキャン文書にはOCRが必要です。【設定】→【文書処理】を開き、利用可能なOCRを選んでから、文書を再インデックスしてください。複雑なレイアウトでは専用の文書処理器を試せます。

Chunk設定を変更したのに結果が変わらないのはなぜですか?

新しい設定では、古い資料は自動で再作成されません。関連項目に対して【再インデックス】を実行し、同じ問題で再テストしてください。

検索テストに結果がまったく出ない場合はどうすればよいですか?

資料の状態、本文に答えが含まれているか、元のキーワードがヒットするか、埋め込みが完了しているか、再ランキングの閾値が高すぎないか、Top Kが小さすぎないかを順に確認します。

ソースは正しいのにチャンクが不完全な場合はどうすればよいですか?

チャンクを確認し、条件と結論が分断されていないか見ます。必要に応じてChunkや重なりを増やすか、構造が乱れたソース資料を整理されたノートにしてから再インデックスします。

正しい結果が後ろに並びすぎる場合はどうすればよいですか?

まず重複と古い資料を削除し、それから埋め込みモデルを検討します。候補はおおむね正しいのに順序が不安定な場合は、再ランキングを増やし、閾値を再調整できます。

Top Kはどのくらいに設定すべきですか?

6から始めて、固定の問題で検索漏れ、ノイズ、所要時間を比較できます。Top Kは1~50の間で調整でき、単に大きくすることを万能の修正と考えないでください。

会話とエージェント

会話内の知識ベース入口が使えない場合はどうすればよいですか?

ツール呼び出しに対応したモデルを選び、現在のメッセージ添付を削除します。さらに、少なくとも1つの知識ベースに準備完了の資料が含まれていることを確認してください。

回答にソースが表示されない場合はどうすればよいですか?

入力欄で実際に知識ベースが選択されていることを確認し、同じ問題を検索テストに入れます。検索で正しいチャンクが出ない場合は、まず知識ベースを修復します。

検索は正しいのに、回答がまだ不正確な場合はどうすればよいですか?

モデルに引用のみに基づいて回答するよう求め、タスクをより小さな事実項目に分解し、重要な結論は手動で確認します。この場合、問題は通常プロンプト、モデル、またはコンテキストの構成にあります。

エージェントが知識ベースを見られないのはなぜですか?

【エージェントを編集】→【知識ベース】を開き、対象のベースを現在のAgentにバインドし、【組み込みツール】で【知識ベース検索】を有効にします。

知識ベース管理は資料を変更しますか?

はい。【知識ベース管理】では、文書の追加、削除、更新ができます。読み取り専用の作業では有効にしないでください。書き込み操作の前に、対象、影響、ロールバック方法を確認してください。

モデル、データ、バックアップ

埋め込みモデルの変更で再構築が必要なのはなぜですか?

異なる埋め込みモデルが生成するベクトルは、そのまま混在させられません。新しいモデルが使えることを確認し、完全なバックアップを保持してから、既存のベクトル索引を再構築してください。

再ランキングと類似度閾値はどのような関係ですか?

再ランキングは候補チャンクを再採点し、閾値は再ランキング後の低スコア結果を除外します。再ランキングを設定していない場合、知識ベース設定には類似度閾値は表示されません。

ローカル埋め込みモデルをダウンロードしたら完全オフラインになりますか?

必ずしもそうではありません。解析、OCR、再ランキング、チャットもすべてローカル機能を使って初めて、完全なオフラインフローになります。

元のファイルやWebページを変更すると自動更新されますか?

されません。ファイル、ノート、Webページはインポート時の内容で資料が作成されます。同名資料を再追加して【置換】を選び、その後で検索テストを完了してください。

軽量バックアップには知識ベースのファイルが含まれますか?

完全な知識ベースデータファイルは含まれません。移行や削除の前には完全バックアップを使用し、復元後に資料と検索結果を確認してください。

設定の説明:診断ベースライン

項目
推奨の出発点
どんな場合にのみ調整するか

Top K

6

正しいチャンクが切り取られているか、ノイズが多すぎる

類似度しきい値

再ランキングを設定したら0.0から開始

低スコアのノイズが明らかで、正しいチャンクにまだ余裕がある

チャンク

デフォルトのスマート分割を維持

条件と結論が分断されている、またはチャンクが長すぎる

埋め込みモデル

BM25だけでは不十分なときに追加

口語的な言い回しや同義表現で安定してヒットしない

リランキングモデル

候補は正しいが順序が不安定なときに追加

解析エラーや本文欠落の修復には使わない

ユーザー事例

小林さんは「宿泊費基準」の質問にチャットで誤答が返るのに気づきました。まず同じ質問で検索テストを行うと、正しいソースがそもそも出てきません。本文を開くと、2カラムPDFの順序が崩れていることが分かりました。処理器を変更して再インデックスすると、検索は正しくなり、チャットの回答も正常に戻りました。

この過程では解析器の変数を1つだけ変えたため、Top K、Chunk、閾値を同時に大きくして運よく当てるのではなく、根本原因を特定できました。

続きを読む

最終更新

役に立ちましたか?