> For the complete documentation index, see [llms.txt](https://docs.cherryai.com.cn/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.cherryai.com.cn/docs/jp/knowledge-base/document-preprocessing.md).

# 文書解析と OCR

ナレッジベースは、すでに解析されたテキストしか検索できない。スキャンPDF、二段組の論文、複雑な表、画像ベースのページは、まず本文を正しく解析し、その後でモデルとリコールパラメータを調整する。

{% hint style="info" %}
解析が合格かどうかは、「インポート成功」の4文字ではなく、本文の順序、重要な表、金額や日付、スキャン文字が正しく読めるかで判断する。
{% endhint %}

## まず資料タイプを判断する

| 資料タイプ                       | 推奨の出発点         | 必ず確認する内容        |
| --------------------------- | -------------- | --------------- |
| Markdown、TXT、HTML           | デフォルトで読み取る     | 見出しレベル、エンコード、改行 |
| コピー可能な文字を含むPDF、DOCX、PPTX    | まずデフォルト処理を使う   | 段落順、ヘッダー・フッター、表 |
| スキャンPDF、スクリーンショット、画像ベースのページ | ローカルまたはシステムOCR | 認識言語、金額、日付、番号   |
| 二段組、数式、または複雑な表を含むPDF        | 専用文書処理器        | 読み取り順序、表構造、脚注   |

## 解析の検索パイプライン内での位置

<figure><img src="/files/edc5365fff3a4c1f05f12e1a504088b27b4673bc" alt="资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图"><figcaption><p>解析エラーはチャンク分割と検索まで引き継がれる。下流モデルは本文からすでに失われた内容を復元できない。</p></figcaption></figure>

## サンプル文書を1件設定して検収する

{% stepper %}
{% step %}

### 1. 代表的なサンプルを選ぶ

まず大量の資料を一括インポートしない。表付きのスキャンPDFや二段組のマニュアルなど、問題を最も露呈しやすい文書を1件選ぶ。
{% endstep %}

{% step %}

### 2. 処理能力を設定する

【設定】→【文書処理】を開き、必要に応じて文書解析サービスとOCRを設定する。クラウドサービスでは通常API KeyまたはサービスURLが必要で、ローカル機能では先にモデルのダウンロードが必要な場合がある。

<figure><img src="/files/785b24a4304ddd2421eb824eaaee975ddf8bb83e" alt="文档处理设置中的文件解析与 OCR 服务配置"><figcaption><p>使うサービスをまず利用可能な状態に設定してから、ナレッジベースに戻って処理器を選ぶ。</p></figcaption></figure>
{% endstep %}

{% step %}

### 3. インポートして完了を待つ

サンプル文書をナレッジベースに追加する。処理が完了したら本文を開き、見出し、段落、ページ番号、表、OCRテキストを確認する。
{% endstep %}

{% step %}

### 4. チャンクを確認する

重要な条件と結論が分断されていないことを確認する。ヘッダー、フッター、目次がチャンクを大量に重複して占有しないようにする。

<figure><img src="/files/e937624cc6e341c8a99acc957007adf8d1f9a94f" alt="知识库高级设置中的智能分段、分隔符、分段大小和重叠大小"><figcaption><p>本文が正しくなってから分割を確認する。解析エラーはチャンクサイズを大きくしても修正できない。</p></figcaption></figure>
{% endstep %}

{% step %}

### 5. 実際の質問で再テストする

【検索テスト】で、その文書に答えがある質問を1つ入力する。結果には正しい出典、完全な条件、重要な数値が含まれている必要がある。
{% endstep %}

{% step %}

### 6. 方案を固定してから一括インポートする

サンプルが合格したら、同種の資料を分けてインポートする。処理器、OCR、または分割設定を変更した後は、旧資料に対して【再インデックス】を実行し、テストを繰り返す。
{% endstep %}
{% endstepper %}

{% hint style="warning" %}
処理器やOCRを切り替えても、すでにインデックス済みの旧資料は自動では修復されない。新旧の結果を比較するには、関連項目を再インデックスする必要がある。
{% endhint %}

## 処理器とOCRの選び方

| 選択                | 適用ケース             | メリット                 | 注意事項                          |
| ----------------- | ----------------- | -------------------- | ----------------------------- |
| デフォルトで読み取る        | テキスト型の一般的な形式      | 設定が少なく、速度が速い         | 複雑なレイアウトやスキャンページでは内容を失う可能性がある |
| System OCR        | システムが対応しており、画像が鮮明 | 追加のAPI Keyが不要で、速度が速い | 精度はOS、言語、画像品質に左右される           |
| ローカルPaddleOCR     | オフライン認識が必要        | 文書が端末外に出ない           | 初回利用前にローカルモデルのダウンロードが必要       |
| クラウドまたはセルフホスト型処理器 | 二段組、複雑な表、数式が多い    | レイアウト解析能力が一般により強い    | クラウド方式では、処理のために文書内容が送信される     |

{% hint style="danger" %}
機密資料でクラウド文書処理器を使う前に、サービス規約、データ保持ポリシー、アカウント権限を確認する。完全オフラインにするには、解析、OCR、埋め込み、再ランキング、チャットの各工程でローカル機能を使う必要がある。
{% endhint %}

## 典型的な問題の特定方法

| 症状                 | まず確認            | 対応方針                              |
| ------------------ | --------------- | --------------------------------- |
| 本文が空、または非常に短い      | ファイルがスキャン文書かどうか | OCRを有効化するか、処理器を変更する               |
| 二段組の文章が交錯する        | 本文の読み順          | レイアウト解析に強い処理器を使う                  |
| 表がばらばらのテキストになる     | 表見出し、行列関係       | 処理器を変更するか、重要なルールをMarkdownノートに整理する |
| ヘッダー・フッターが繰り返し出現する | チャンク内の重複ノイズ     | 元ファイルを整理するか、解析器を替える。Top Kだけを上げない  |
| OCRの数字が誤る          | 金額、日付、番号        | 画像の鮮明度を上げ、高リスクの項目は手動確認する          |

## 設定の説明

| 設定項目        | 推奨の出発点                       | いつ調整するか                  | 調整後のアクション             |
| ----------- | ---------------------------- | ------------------------ | --------------------- |
| 文書処理器       | まずデフォルト処理を使う                 | 本文の順序違い、表の欠落、スキャンページが空   | サンプル文書を再インデックスする      |
| OCR         | 鮮明なスキャン文書はローカルまたはシステム機能を優先する | 画像ベースのページに文字がない、または誤字が多い | 再インデックスして重要項目を確認する    |
| チャンクサイズと重なり | まずナレッジベースのデフォルト設定を維持する       | 条件と結論が切り分けられている          | 1回で1項目だけ変更し、再インデックスする |
| 検収問題        | 実際の質問3～5件                    | 処理器、OCR、または分割を変更した後      | 同じ質問セットで比較する          |

## ユーザー事例

小林さんは、二段組の出張規程PDFを1件インポートした。状態はすでに完了になっていたが、本文では左右2列が交錯し、検索結果の承認条件も不完全だった。彼はまずTop Kを上げるのではなく、レイアウト解析により適した処理器に切り替え、同じファイルを再インデックスしてから、本文とチャンクを再確認した。

合格基準は、承認条件が原文順に読めること、金額と日付が正しいこと、固定質問で完全な条件を含むチャンクを検索できること。

## よくある質問

<details>

<summary>本文が正しくても、チャンクも確認する必要がありますか？</summary>

必要です。本文が正しいのは解析が合格したことを意味するだけで、条件と結論は分割時に分かれてしまう可能性があります。

</details>

<details>

<summary>Top Kを増やせば解析問題は修復できますか？</summary>

できません。Top Kは返すチャンク数を制御するだけで、本文中ですでに失われた、または順序が崩れた内容は復元できません。

</details>

<details>

<summary>処理器を変えても結果が変わらないのはなぜですか？</summary>

旧資料がまだ元のインデックスを使っているからです。関連項目を【再インデックス】してから、同じ質問で再テストしてください。

</details>

## 続きを読む

<table data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>資料を追加・整理する</strong></td><td>ソースを選択し、処理状態を確認する。</td><td><a href="/pages/52419c0c8143ffa7c66f9f3048af576a7b985d6b">/pages/52419c0c8143ffa7c66f9f3048af576a7b985d6b</a></td></tr><tr><td><strong>資料と再現を確認する</strong></td><td>固定質問で解析と分割を検収する。</td><td><a href="/pages/e3b03b5648a5fd135fedd068ff34a7f23055261c">/pages/e3b03b5648a5fd135fedd068ff34a7f23055261c</a></td></tr><tr><td><strong>データ、プライバシー、保守</strong></td><td>ローカルとクラウドのデータ境界を確認する。</td><td><a href="/pages/1731dc3d21dfd63a18e7784003c212f3d875d167">/pages/1731dc3d21dfd63a18e7784003c212f3d875d167</a></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.cherryai.com.cn/docs/jp/knowledge-base/document-preprocessing.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
