日本語のデジタル処理には、歴史的な規格の変遷が色濃く影を落としている。かつて日本のオフィスオートメーションを支えたJIS X 0208(JIS漢字コードの時代から、世界標準であるUnicode環境へと移行したことで、漢字の表現力は飛躍的に拡大した。しかし、これが検索の現場に新たな混乱を持ち込んでいる。
例えば「辻」という文字一つをとっても、しんにょうの点が1つのグリフと2つのグリフが併存する。Microsoft IMEなどの入力エンジンが進化し、サードパーティ製のフォント環境が混在した結果、同じ見た目でありながら異なる文字コードポイント(Unicode)が割り当てられた文字が同一シート上に散らばってしまう。
通常の文字列一致検索は、バイナリレベルで完全一致を求める。コードポイントが1ビットでも異なれば、エクセルは容赦なく「不一致」と判定を下す。この仕様を理解していないと、存在しているはずのデータを「消えた」と誤認し、重大なビジネス判断のミスを招くことになりかねない。