OCRmyPDF
スキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。
OCRmyPDFとは
OCRmyPDF(MPL-2.0・GitHubスター約34,700)は、画像だけのスキャンPDFにOCRを掛けて、見た目はそのままに文字層だけを追加する道具です。元のページ画像は保持されるため、体裁を崩さずに検索・コピー・全文検索の対象にできます。全文検索や文書管理の前段として使われます。日本語にも対応します。
要点: スキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。
主な用途
- スキャンした書類を検索できるPDFにする
- 紙の書類の全文検索への取込
- 電子保存する書類の下処理
OCRmyPDFを使ったシステム開発
OCRmyPDFは、そのまま納品する完成品ではなく、システムを作るための道具です。OCRmyPDFを組み込んだ自社向けの仕組みを、AIエージェントと対話しながら実装します。要件を伺ってから最短1営業日で動くデモをお出しし、触って確認いただいてから発注を判断できます。完成後はソースコードごとお渡しします。
OCRmyPDFを使った開発を相談OCRmyPDFの日本語対応(実測)
OCRmyPDFの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)
GitHubの公開ファイル一覧から、日本語ロケールに当たるファイルを数えた結果です。配布用にまとめたビルド成果物は除いています。調査日時点の内容で、翻訳の網羅率や品質までは示しません。
OCRmyPDFの基本情報
| ライセンス | MPL-2.0 |
|---|---|
| 主な言語 | Python |
| GitHubスター | 34,668(文書管理カテゴリ 150件中 11位) |
| 初回公開 | 2013年12月 |
| 最終更新 | 2026年9月 |
| 日本語ロケール | 日本語ファイルなし(読み取り対象として日本語に対応) |
OCRmyPDFを使った開発のよくある質問
見た目は変わりませんか?
変わりません。元のページ画像はそのまま残し、見えない文字層だけを追加します。
全文検索やAIチャットの前段に使えますか?
向いています。画像だけのPDFは全文検索でも翻訳でもAIチャットでも扱えないため、先にこの処理を通します。
OCRmyPDFを使って何が作れますか?
OCRmyPDFの標準機能を土台に、自社データとの連携、画面、自動処理、通知などを組み合わせた仕組みを作れます。用途を伺えば、実現できる範囲と進め方を具体的にお伝えします。
OCRmyPDFを使った開発を依頼できますか?
可能です。要件と稼働環境を確認し、最短1営業日で動くデモをお出しします。発注後はサーバー設置と稼働確認まで一つの流れで対応し、ソースコードごとお渡しします。
OSSを探しているなら、当社の完成品も
同じ「行政・公共データを住所から使える形にする」考え方で、当社が作って公開しているプロダクトです。すべて無料で試せます。
業務システムの買い切り版は Kurage App Store、 外注をAI自動化に置き換える相談は 業務のAI自動化 へ。
文書管理の他のOSSと比べる
同じカテゴリから、スター数・ライセンス・日本語対応を並べました。
