1. PDFを分類して必要ページだけOCRする処理ライブラリ

    [PROGRAMMING]

    PDF内の文字有無やページ構成を見て、OCRが必要な部分だけを振り分ける「pdf-inspector」が紹介された。PythonやNode.js、ブラウザ向け実装があり、既存テキストの抽出も行えるという。