For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR

OCR(Optical Character Recognition、光学文字認識)は、 画像内の文字を、コピー可能でAIが読み取れるテキストに変える。以下のことはすべてそれに依存しています:

  • スクリーンショット/スキャン画像をチャット欄にドラッグして、AIに中の文字を読ませたい

  • 画像形式の請求書や資料を ナレッジベースに入れて、後で検索できるようにしたい

  • エージェント ローカルの画像を開いて分析する

OCRは独立した設定ページです。【設定】→【OCR】で一度認識エンジンを設定すれば、画像内の文字認識を使うすべての場所で同じ設定が使われます。

OCR設定:① 右上のドロップダウンで認識エンジンを選択(図ではMistral)、下に選んだエンジンのAPIキーとAPIアドレスを入力

認識エンジンを選択

パネル右上のドロップダウンでOCRエンジンを切り替えます、選択したエンジンがそのままデフォルト。内蔵エンジン:

エンジン
接続/動作方式
対象

System OCR

オフライン、設定不要

システム標準の認識(macOS Live Text / Windows OCR)を利用し、すぐ使えて最速

PaddleOCR

API キーを入力(飛桨星河コミュニティ);自己ホストする場合はAPIアドレスを自分のサービスに向けます。任意の解析モデル

ローカルリソースを使いたくないが、Paddleの認識精度は欲しい

ローカルPaddleOCR

オフライン。まず【設定】→【ローカルモデル】でローカルOCRモデル(約140MB)をダウンロードする必要があります

中国語認識の精度が高く、完全にローカルで動作。プライバシー重視

Tesseract OCR

オフライン、組み込み済み

定番のオープンソースOCR。多言語対応で、フォールバックとして使えます

Mistral

Mistral APIキー

マルチモーダル大規模モデルで認識し、複雑なレイアウト/手書きなどにもより賢く対応

Intel OV OCR

ローカル実行(Intel OpenVINO、NPU加速)

Windows+Intel Core Ultra(NPU搭載)で、かつOVモデルをデプロイ済みの場合にのみ表示、それ以外のデバイスではこの項目は表示されません

System OCRを選ぶと、パネルには macOS Live Text / Windows OCRエンジンが利用可能です(システムが非対応の場合、この項目はドロップダウンに表示されません)。

文書処理との違い

多くの人がOCRと ドキュメント処理 混同しますが、一言で区別すると:

  • OCR:担当 画像 / スキャンデータ 内の文字認識(画像→文字)。

  • ドキュメント処理:担当 PDF / 複雑なレイアウトの文書 の構造化解析(表や複数カラム付きのPDF→整形テキスト)。

両者は互いに独立しており、それぞれ別設定です。プレーンテキストPDF、.md/.txt/.docx 内の文字段落はどちらも介さず、そのまま読めます。


ヘルプの取得とフィードバックの送信

設定または使用中に不明点、バグ、機能改善の提案がある場合は、 フィードバックと提案 に記載の公式チャネルをご参照ください。

最終更新

役に立ちましたか?