KurageさんKurage Payload CMS
開発に使うツール

OCRmyPDF

スキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。

OCRmyPDFとは

OCRmyPDF(MPL-2.0・GitHubスター約34,700)は、画像だけのスキャンPDFにOCRを掛けて、見た目はそのままに文字層だけを追加する道具です。元のページ画像は保持されるため、体裁を崩さずに検索・コピー・全文検索の対象にできます。全文検索や文書管理の前段として使われます。日本語にも対応します。

要点: スキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。

主な用途

  • スキャンした書類を検索できるPDFにする
  • 紙の書類の全文検索への取込
  • 電子保存する書類の下処理

OCRmyPDFを使ったシステム開発

OCRmyPDFは、そのまま納品する完成品ではなく、システムを作るための道具です。OCRmyPDFを組み込んだ自社向けの仕組みを、AIエージェントと対話しながら実装します。要件を伺ってから最短1営業日で動くデモをお出しし、触って確認いただいてから発注を判断できます。完成後はソースコードごとお渡しします。

OCRmyPDFを使った開発を相談

OCRmyPDFの日本語対応(実測)

OCRmyPDFの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)

GitHubの公開ファイル一覧から、日本語ロケールに当たるファイルを数えた結果です。配布用にまとめたビルド成果物は除いています。調査日時点の内容で、翻訳の網羅率や品質までは示しません。

OCRmyPDFの基本情報

ライセンスMPL-2.0
主な言語Python
GitHubスター34,668(文書管理カテゴリ 150件中 11位)
初回公開2013年12月
最終更新2026年9月
日本語ロケール日本語ファイルなし(読み取り対象として日本語に対応)

OCRmyPDFを使った開発のよくある質問

見た目は変わりませんか?

変わりません。元のページ画像はそのまま残し、見えない文字層だけを追加します。

全文検索やAIチャットの前段に使えますか?

向いています。画像だけのPDFは全文検索でも翻訳でもAIチャットでも扱えないため、先にこの処理を通します。

OCRmyPDFを使って何が作れますか?

OCRmyPDFの標準機能を土台に、自社データとの連携、画面、自動処理、通知などを組み合わせた仕組みを作れます。用途を伺えば、実現できる範囲と進め方を具体的にお伝えします。

OCRmyPDFを使った開発を依頼できますか?

可能です。要件と稼働環境を確認し、最短1営業日で動くデモをお出しします。発注後はサーバー設置と稼働確認まで一つの流れで対応し、ソースコードごとお渡しします。

OSSを探しているなら、当社の完成品も

同じ「行政・公共データを住所から使える形にする」考え方で、当社が作って公開しているプロダクトです。すべて無料で試せます。

業務システムの買い切り版は Kurage App Store、 外注をAI自動化に置き換える相談は 業務のAI自動化 へ。

文書管理の他のOSSと比べる

同じカテゴリから、スター数・ライセンス・日本語対応を並べました。

文書管理の一覧へ
OSSスターライセンス日本語ロケール
OCRmyPDF(このページ)34,668MPL-2.0日本語ファイルなし(読み取り対象として日本語に対応)
sftpgo12,435AGPL-3.0日本語ファイルなし
copyparty46,339MIT日本語ファイルなし
croc40,067MIT日本語ファイルなし
ShareX39,273GPL-3.0日本語ファイルなし