日本の文字コード規格の礎となったのは、1978年に当時の通商産業省工業技術院によって制定されたJIS C 6226(旧JIS、後のJIS X 0208)です。この規格において、常用漢字を中心とするJIS第1水準に加え、地名や人名など特殊な用途をカバーするためにJIS第2水準の漢字群(3,384字)が選定されました。
当時、委員会の担当者たちは網羅的な文字収集を行うため、主に以下の4つの大規模資料を典拠としました。
- 国土行政区画総覧:全国の地名・字名を網羅した行政資料
- 日本生命人名外字表:生命保険契約者の氏名に使われていた特殊漢字
- 電電公社字種表:電報や電話帳管理のために収集された外字リスト
- 行政管理庁漢字表:住民票や行政システム用の漢字一覧
しかし、当時は現代のようなデジタルデータベースなど存在せず、すべては「手書き台帳」や「マイクロフィルム」によるアナログ管理でした。印刷所の暗室で拡大撮影された文字には、原紙の折れ目、紙粉による黒点、インクのにじみ、切り貼りの影などが無数に含まれていたのです。
文字コード作成ワーキンググループの調査員たちは、限られた期間の中で膨大な文字を手作業でトレースし、清書していきました。その過程で「元の文字の傷やゴミを漢字の構成要素と見誤る」「くずし字を別の部首として解釈する」といったヒューマンエラー(誤写・誤読)が多発し、結果として地球上のどの辞書にも載っていない「幽霊文字」が約60文字も正規規格として刻み込まれてしまったのです。