有料の変換ソフトや怪しい海外サイトに頼る前に、すでに手元にある日常的なツールで実践できる「裏技」を検証します。実は、日常的に使っているOfficeやクラウドサービスに、極めて強力な変換エンジンが標準搭載されています。
裏技1:Microsoft Word本体の「直接読み込み」機能
意外と知られていないのが、Word自身が持つPDFリフロー変換機能です。特別なプラグインを追加する必要すらありません。
手順はシンプルです。Wordを起動し、「ファイル」メニューの「開く」から対象のPDFファイルを選択するだけです。「PDFから編集可能なWord文書に変換します。元のPDFとまったく同じ表示にはならない場合があります」という確認ダイアログが表示されますが、そのまま「OK」を押します。
Microsoftが長年蓄積したオフィス文書の解析アルゴリズムが作動し、一般的な契約書や報告書などのテキスト主体文書であれば、驚くほどの再現度で編集可能なDOCXファイルへと復元されます。テキストボックスでガチガチに固められることなく、通常の段落として読み込まれるため、変換後の修正作業が格段にスムーズです。
裏技2:Googleドキュメントの「OCR日本語文字認識」連動
「紙の書類をスキャンしたPDF」で、文字情報が画像化されている場合に威力を発揮するのが、GoogleドライブとGoogleドキュメントの組み合わせです。
PDFファイルをGoogleドライブにアップロードした後、ファイルを右クリックして「アプリで開く」>「Google ドキュメント」を選択します。これだけで、Googleが誇る世界最高峰水準のクラウドOCRエンジンが自動的に走り、画像内の日本語を恐るべき精度でテキストデータ化してくれます。
上部に元画像、下部にOCR抽出された編集可能テキストが並ぶため、文字の校正も容易です。そのまま「ファイル」>「ダウンロード」>「Microsoft Word(.docx)」を選択すれば、実質的にスキャンPDFのWord変換が完了します。かすれたFAX文書や、斜めにスキャンされた書類のテキスト救出において、現在でも極めて頼りになるアプローチです。