文字認識の基盤を理解するうえで欠かせないのが、長年オープンソース界を支えてきたTesseract OCRと、クラウド基盤で圧倒的な処理能力を誇るGoogle Cloud Vision APIに代表される先端エンジンの存在だ。前者がローカル環境での軽量かつ高速なテキスト抽出を得意とする一方、後者は膨大な学習データに基づく高精度な画像解析力を持ち味とする。
さらに画面への入力を直接解析する手書き文字認識では、書き順や筆圧の軌跡を幾何学ベクトルとして抽出するアルゴリズムが採用されている。静止画の解析と動的なストローク情報の双方向処理によって、似たような部首を持つ別字の誤同定を防ぎ、どんなに癖のある筆跡であっても正確な辞書データへと辿り着く仕組みが構築されている。