一体どのような技術を使えば、あそこまで本物そっくりの声を作り出せるのでしょうか。その中核にあるのが、オープンソースで配布されている深層学習型の音声変換技術「RVC(Retrieval-based Voice Conversion)」です。
RVCは、少量のクリアな音声データ(数十〜数十分程度)をAIに読み込ませることで、その声質やイントネーションの特徴量を抽出し、特定の人物の声に変換できる「RVC うーたん 音声モデル」を構築します。これによって、マイクに向かって一般人が吹き込んだ音声やテキスト読み上げ音声を、リアルタイムで間宮くるみさん演じるうーたんの声質へと置き換える仕組みが成立しています。
ネット上の掲示板や動画共有サイトでは、一部のユーザーによって「AIボイス うーたん 作り方」といった手順解説や学習済みモデルファイルの違法な二次配布が行われていました。特別な専門知識を持たない一般ユーザーでも容易にクローン音声を生成できる環境が整ってしまったことが、爆発的な拡散を後押しした最大の技術的要因です。