よくある質問
ナレッジベースの問題に遭遇したら、まず失敗がインポート、解析、分割、検索、回答のどの層で起きているかを判断します。一度に変える変数は1つだけにすると、どの調整が本当に有効か分かります。
最も速い切り分け方法は、同じ実際の問題で一貫して確認することです。本文に答えがあるか、チャンクが完全か、検索が正しいか、回答がソースに忠実かを見ます。
5ステップで素早く切り分け
問題はどこに報告すべきか

スクリーンショット、ログ、サンプル資料には、APIキー、内部ファイル内容、メールアドレス、ローカルの機密パスを公開しないでください。
作成とインポート
どのソースとファイル形式がサポートされていますか?
ソースには、ファイル、Cherry Studioノート、ローカルディレクトリ、Webリンクがあります。ファイル形式には、PDF、DOCX、DOC、PPTX、XLSX、XLS、Markdown、TXT、CSV、HTML、EPUBがあります。
同名資料は【すべて保持】と【置換】のどちらを選ぶべきですか?
制度、マニュアル、ノートのスナップショットを更新する場合は、通常【置換】を選びます。実際に共存が必要な版だけ【すべて保持】を選び、名前に日付やバージョンを入れてください。
資料がずっと処理中のままですが、どうすればよいですか?
ファイルを開けるか、処理器とOCRが利用可能か、モデルサービスが設定済みかを確認します。エラー情報に基づいて、失敗が読み取り、解析、埋め込みのどの段階かを判断します。
解析と検索
スキャンPDFに文字がないのはなぜですか?
スキャン文書にはOCRが必要です。【設定】→【文書処理】を開き、利用可能なOCRを選んでから、文書を再インデックスしてください。複雑なレイアウトでは専用の文書処理器を試せます。
検索テストに結果がまったく出ない場合はどうすればよいですか?
資料の状態、本文に答えが含まれているか、元のキーワードがヒットするか、埋め込みが完了しているか、再ランキングの閾値が高すぎないか、Top Kが小さすぎないかを順に確認します。
ソースは正しいのにチャンクが不完全な場合はどうすればよいですか?
チャンクを確認し、条件と結論が分断されていないか見ます。必要に応じてChunkや重なりを増やすか、構造が乱れたソース資料を整理されたノートにしてから再インデックスします。
正しい結果が後ろに並びすぎる場合はどうすればよいですか?
まず重複と古い資料を削除し、それから埋め込みモデルを検討します。候補はおおむね正しいのに順序が不安定な場合は、再ランキングを増やし、閾値を再調整できます。
会話とエージェント
会話内の知識ベース入口が使えない場合はどうすればよいですか?
ツール呼び出しに対応したモデルを選び、現在のメッセージ添付を削除します。さらに、少なくとも1つの知識ベースに準備完了の資料が含まれていることを確認してください。
回答にソースが表示されない場合はどうすればよいですか?
入力欄で実際に知識ベースが選択されていることを確認し、同じ問題を検索テストに入れます。検索で正しいチャンクが出ない場合は、まず知識ベースを修復します。
検索は正しいのに、回答がまだ不正確な場合はどうすればよいですか?
モデルに引用のみに基づいて回答するよう求め、タスクをより小さな事実項目に分解し、重要な結論は手動で確認します。この場合、問題は通常プロンプト、モデル、またはコンテキストの構成にあります。
知識ベース管理は資料を変更しますか?
はい。【知識ベース管理】では、文書の追加、削除、更新ができます。読み取り専用の作業では有効にしないでください。書き込み操作の前に、対象、影響、ロールバック方法を確認してください。
モデル、データ、バックアップ
埋め込みモデルの変更で再構築が必要なのはなぜですか?
異なる埋め込みモデルが生成するベクトルは、そのまま混在させられません。新しいモデルが使えることを確認し、完全なバックアップを保持してから、既存のベクトル索引を再構築してください。
再ランキングと類似度閾値はどのような関係ですか?
再ランキングは候補チャンクを再採点し、閾値は再ランキング後の低スコア結果を除外します。再ランキングを設定していない場合、知識ベース設定には類似度閾値は表示されません。
ローカル埋め込みモデルをダウンロードしたら完全オフラインになりますか?
必ずしもそうではありません。解析、OCR、再ランキング、チャットもすべてローカル機能を使って初めて、完全なオフラインフローになります。
元のファイルやWebページを変更すると自動更新されますか?
されません。ファイル、ノート、Webページはインポート時の内容で資料が作成されます。同名資料を再追加して【置換】を選び、その後で検索テストを完了してください。
設定の説明:診断ベースライン
Top K
6
正しいチャンクが切り取られているか、ノイズが多すぎる
類似度しきい値
再ランキングを設定したら0.0から開始
低スコアのノイズが明らかで、正しいチャンクにまだ余裕がある
チャンク
デフォルトのスマート分割を維持
条件と結論が分断されている、またはチャンクが長すぎる
埋め込みモデル
BM25だけでは不十分なときに追加
口語的な言い回しや同義表現で安定してヒットしない
リランキングモデル
候補は正しいが順序が不安定なときに追加
解析エラーや本文欠落の修復には使わない
ユーザー事例
小林さんは「宿泊費基準」の質問にチャットで誤答が返るのに気づきました。まず同じ質問で検索テストを行うと、正しいソースがそもそも出てきません。本文を開くと、2カラムPDFの順序が崩れていることが分かりました。処理器を変更して再インデックスすると、検索は正しくなり、チャットの回答も正常に戻りました。
この過程では解析器の変数を1つだけ変えたため、Top K、Chunk、閾値を同時に大きくして運よく当てるのではなく、根本原因を特定できました。
それでも解決しない場合は、アプリのバージョン、OS、処理器、埋め込み・再ランキングモデル、完全なエラー、匿名化した最小サンプル、検索結果、期待するソースを記録してください。
続きを読む
最終更新
役に立ちましたか?

