なぜ、PDF上の綺麗な表をコピーしてExcelにペーストすると、階段状にズレたり1マスの中に全データが圧縮されたりするのでしょうか。大手ITベンダーのシステム設計担当者は「そもそも両者のファイル形式が想定している役割が正反対だからだ」と証言します。
PDFは、紙の印刷物をデジタル上で完全に再現するために設計されたフォーマットです。内部データは「X軸・Y軸の特定座標にこの文字を配置する」という絶対座標で描かれています。視覚的には整然とした罫線に見えても、プログラム内部では単なる独立したテキストの集まりとベクトル線画に過ぎません。セルという概念自体がデータ内部に存在しないケースがほとんどです。
これに対し、Excelは行と列が交差する「格子状のセル構造」によってデータを相対的に管理します。絶対座標の文字列を強引に流し込めば、Excel側は行の区切りや列の境界線を正しく判別できず、結果として悲惨なレイアウト崩壊を引き起こします。
この根本問題を解決するには、単なるコピー&ペーストを直ちにやめ、PDF内部のテーブルタグを構造解析して取り込む「論理的抽出」か、描画状態を保持したまま埋め込む「カプセル化」を選択する必要があります。