紙媒体をスキャンして作成された画像化PDFの場合、通常のテキスト抽出コマンドでは認識できない。そこで登場するのが、近年目覚ましい進化を遂げた OCR (光学文字認識) テクニックだ。人工知能によるパターン認識モデルが組み込まれたことで、傾いた文字や複雑な罫線構造の解析精度が爆発的に向上した。
現在の IT・オフィスソフトウェア業界 では、OCRとクラウド処理を組み合わせたデータ抽出サービスが相次いで投入されている。スマホで撮影した領収書や紙の帳票であっても、高精度にテキスト化し、エクセルの行と列へと正しくマッピングする。かつての人海戦術によるデータ入力作業は、完全に過去のものとなりつつある。