音声合成とは
TTS / Text-to-Speech / テキスト読み上げ
テキストから人間の音声を生成する技術。ニューラル方式の登場で自然さが向上した
ひとことで言うと
文章を人間の声で読み上げる技術。最近は本人そっくりの声を数秒のサンプルから再現できるまでになっている。
概要
音声合成(TTS)とは、テキストから人間の音声を生成する技術を指す。 従来は録音素片の接続や統計モデルによる方式が主流だったが、ニューラルネットワークによる波形生成の登場で自然さが向上した。 近年は、数秒のサンプルから話者の声質を再現するボイスクローニング、感情や話速の制御、LLMと組み合わせたリアルタイム音声対話への展開が進む。 一方で、本人になりすました音声による詐欺や偽情報への悪用も課題として議論されている。
歴史
ニューラル音声合成の転機としては、2016年にDeepMindの発表した波形生成モデルWaveNetが知られる。
比較
- Whisper — Whisperが音声をテキストへ変換する音声認識モデルであるのに対し、音声合成はテキストから音声を生成する逆方向の技術