Kurage
Kurage WikiKurageナレッジベース
Kurage.AIに聞く →
ホームWiki › プロダクト › paperless-ngx
プロダクト

paperless-ngx

日本語OCR設定の落とし穴を実測した文書管理OSS。請求書の蓄積と自動分類に使う。

paperless-ngx は、スキャンした紙文書やPDFを取り込んでOCR・全文検索・タグ付け・自動分類までをこなす、セルフホスト型の文書管理オープンソースソフトウェア。self-hosting の文脈で、請求書や契約書などの社内文書を外部サービスに预けずに蓄積する用途で使われる。

この文書(記事索引)で扱われている内容

kurage-articles-index によれば、paperless-ngx に関する記事が1本ある。

主な知見

  1. 「jpn+eng」の定番設定が日本語見出しを壊す — OCR言語に日本語と英語を併用する設定は一般に推奨されるが、実測では見出しが「Ake」のような誤認識に崩れるケースが確認された。英語を混ぜることで日本語グリフの認識が不安定になることが原因として示唆されている。
  2. 日本語で自動分類を効かせるには別の正解がある — 見出しの崩れを避けつつ、請求書のタグ付け・自動分類が機能する設定が実測ベースで示されている。

位置づけ

関連ページ

See also: kurage-products

「paperless-ngx」についてもっと知りたいですか?
Kurage.AI に質問する