クラウドOCRを使わず、スキャンPDFから編集可能な文字を抽出する
- スキャンPDFを1つ、またはローカルのPNG・JPEG・WebP画像を選び、必要なページを指定します。
- 認識言語を英語・簡体字中国語・繁体字中国語から選びます。横向きの原稿は回転し、必要に応じて切り抜きやコントラストを調整します。
- 文字認識を実行し、編集可能なテキストを原稿と照合します。誤認識を修正してからTXTまたはMarkdownで出力します。
名前と数字を原稿と照合する
注文書に「Order 2048」とある場合は、認識された数字と前後の句読点を確認してからコピーします。冒頭だけが必要ならページ1–3を指定し、文書全体の処理を避けられます。
表の構造、手書き、薄い文字の認識は保証されません。初回はOCRエンジンと言語データをダウンロードしますが、文書はローカルで処理します。テキストファイルではなく検索可能なPDFが必要な場合は、検索可能なPDF作成ツールを使用してください。
