For the complete documentation index, see llms.txt. This page is also available as Markdown.

ドキュメント処理

簡単に言うと:これは Cherry Studio が「PDF / 複雑なレイアウトの文書」を整ったテキストとして読み取るための中心設定です。

表や複数カラム、スキャンページを含む PDF(学術論文、契約書、調査レポートなど)は、そのままモデルに投げると読みにくくなりがちです。文書処理ではまず専用の解析エンジンでそれらを構造の明確なテキストに変換し、その後、対話または ナレッジベース で使用します。

文書処理 vs OCR:この 2 つは別々のページ設定です。

  • ドキュメント処理(本ページ):担当 PDF / 複雑なレイアウトの文書 の構造化解析。

  • OCR:担当 画像 / スキャンデータ 内の文字認識。

通常のプレーンテキスト PDF、.md/.txt/.docx 内のテキスト段落はどちらも不要で、そのまま読み取ればOKです。

設定入口

【設定】→【文書処理】を開き、右上のドロップダウンで解析エンジンを選択します。選択したエンジンがそのままデフォルト

文書処理設定:① 右上のドロップダウンで解析エンジンを選択(デフォルトは MinerU);下に選択したエンジンの API キーと API アドレスを入力

内蔵解析エンジン

文書処理には 5 つのエンジンが内蔵されており、デフォルトは MinerU

エンジン
説明
接続方法

MinerU(デフォルト)

OpenDataLab が提供する高品質な PDF 抽出ツール

API キー(mineru.net/apiManage

PaddleOCR

百度飛桨 OCR 認識システム

API キーを入力(飛桨星河コミュニティ);自前でデプロイする場合は API アドレスを自分のサービスに向けてください

Doc2x

高度なファイル復元エンジン

API キー(open.noedgeai.com

Mistral

ファイル解析および理解サービス

API キー(mistral.ai

Open MinerU

自前でデプロイ可能な MinerU サービスで、処理フローを自分たちで管理したいチームに適しています

自前でデプロイした後、API アドレスを入力(必要に応じて API キーも入力)

MinerU の設定(デフォルト案)

1

API キーを入力

【API キー】欄に MinerU で取得した key を入力します(右側の「キーを取得」をクリックすると申請ページに移動します。複数のキーはカンマ区切りで入力可能です)。

2

API アドレスの確認

【API アドレス】はデフォルトのままで問題ありません。

3

ナレッジベース / 会話で直接使用

複雑な PDF を取り込むと、この解析設定が自動で適用されます。ナレッジベースや会話に切り替える際に追加設定は不要です。

他のエンジンに切り替える:ドロップダウンでそれを選び、そのエンジンの【API キー】/【API アドレス】を入力すればOKです。選択したものがデフォルトになります。なお PaddleOCROpen MinerU 自前でデプロイ可能です。デプロイ後は【API アドレス】を自分のサービスアドレスに設定してください。

ナレッジベースとの関係

  • 文書処理は「複雑な文書 → 整ったテキスト」への変換だけを担当します。

  • 変換後のテキストはそのまま 埋め込みモデル ベクトル化、格納へ進みます;

  • 「ナレッジベースで有効にする」詳しい手順は ナレッジベース文書の前処理

ヒントとコツ

  • MinerU は表や複数カラムのレイアウトを含む PDF で特に高い効果を発揮します。学術論文などではまず最優先で試してください;

  • 認識したいのが 画像内の文字(スクリーンショット、スキャンデータ)であって PDF の構造ではない場合は、代わりに OCR


ヘルプの取得とフィードバックの送信

設定または使用中に不明点、バグ、機能改善の提案がある場合は、 フィードバックと提案 に記載の公式チャネルをご参照ください。

最終更新

役に立ちましたか?