ドキュメント解析とOCR
最終更新
役に立ちましたか?
ナレッジベースは、すでに解析されたテキストしか検索できない。スキャンPDF、二段組の論文、複雑な表、画像ベースのページは、まず本文を正しく解析し、その後でモデルとリコールパラメータを調整する。
解析が合格かどうかは、「インポート成功」の4文字ではなく、本文の順序、重要な表、金額や日付、スキャン文字が正しく読めるかで判断する。
Markdown、TXT、HTML
デフォルトで読み取る
見出しレベル、エンコード、改行
コピー可能な文字を含むPDF、DOCX、PPTX
まずデフォルト処理を使う
段落順、ヘッダー・フッター、表
スキャンPDF、スクリーンショット、画像ベースのページ
ローカルまたはシステムOCR
認識言語、金額、日付、番号
二段組、数式、または複雑な表を含むPDF
専用文書処理器
読み取り順序、表構造、脚注

処理器やOCRを切り替えても、すでにインデックス済みの旧資料は自動では修復されない。新旧の結果を比較するには、関連項目を再インデックスする必要がある。
デフォルトで読み取る
テキスト型の一般的な形式
設定が少なく、速度が速い
複雑なレイアウトやスキャンページでは内容を失う可能性がある
System OCR
システムが対応しており、画像が鮮明
追加のAPI Keyが不要で、速度が速い
精度はOS、言語、画像品質に左右される
ローカルPaddleOCR
オフライン認識が必要
文書が端末外に出ない
初回利用前にローカルモデルのダウンロードが必要
クラウドまたはセルフホスト型処理器
二段組、複雑な表、数式が多い
レイアウト解析能力が一般により強い
クラウド方式では、処理のために文書内容が送信される
機密資料でクラウド文書処理器を使う前に、サービス規約、データ保持ポリシー、アカウント権限を確認する。完全オフラインにするには、解析、OCR、埋め込み、再ランキング、チャットの各工程でローカル機能を使う必要がある。
本文が空、または非常に短い
ファイルがスキャン文書かどうか
OCRを有効化するか、処理器を変更する
二段組の文章が交錯する
本文の読み順
レイアウト解析に強い処理器を使う
表がばらばらのテキストになる
表見出し、行列関係
処理器を変更するか、重要なルールをMarkdownノートに整理する
ヘッダー・フッターが繰り返し出現する
チャンク内の重複ノイズ
元ファイルを整理するか、解析器を替える。Top Kだけを上げない
OCRの数字が誤る
金額、日付、番号
画像の鮮明度を上げ、高リスクの項目は手動確認する
文書処理器
まずデフォルト処理を使う
本文の順序違い、表の欠落、スキャンページが空
サンプル文書を再インデックスする
OCR
鮮明なスキャン文書はローカルまたはシステム機能を優先する
画像ベースのページに文字がない、または誤字が多い
再インデックスして重要項目を確認する
チャンクサイズと重なり
まずナレッジベースのデフォルト設定を維持する
条件と結論が切り分けられている
1回で1項目だけ変更し、再インデックスする
検収問題
実際の質問3~5件
処理器、OCR、または分割を変更した後
同じ質問セットで比較する
小林さんは、二段組の出張規程PDFを1件インポートした。状態はすでに完了になっていたが、本文では左右2列が交錯し、検索結果の承認条件も不完全だった。彼はまずTop Kを上げるのではなく、レイアウト解析により適した処理器に切り替え、同じファイルを再インデックスしてから、本文とチャンクを再確認した。
合格基準は、承認条件が原文順に読めること、金額と日付が正しいこと、固定質問で完全な条件を含むチャンクを検索できること。
最終更新
役に立ちましたか?
役に立ちましたか?