ボイスクローニング(音声クローニング)とは
Voice Cloning / 音声クローニング
数秒〜数十秒の音声サンプルから話者の声質・話し方を再現し、任意のテキストを読み上げさせる技術
概要
ボイスクローニングとは、特定の話者による数秒〜数十秒程度の音声サンプルから声質・抑揚・話し方の特徴を学習し、任意のテキストをその声で読み上げさせる技術を指す。 音声合成(TTS)モデルの応用として発展し、少量のサンプルで話者性を再現できるゼロショット/Few-shotの手法が登場したことで、専門的な収録なしに個人の声を再現できるようになった。 ナレーションの多言語吹き替えや発話障害を持つ人の音声再建といった活用がある一方、本人の同意なく声を模倣し、なりすましや詐欺に悪用されるリスクが課題として指摘されている。
比較
- 音声合成 — 音声合成(TTS)がテキストから汎用的に音声を生成する技術であるのに対し、ボイスクローニングは特定話者の声質を再現することに特化した応用技術