Re Reference AI

技術

生成AIとは

Generative AI / ジェネレーティブAI

テキスト・画像・音声・動画・コードなどの新しいコンテンツを生成できるAIの総称

生成AI深層学習

ひとことで言うと

文章や画像、音声、動画などを新しく「作り出す」タイプのAIのまとめ言葉。ChatGPTのような文章AIも、画像を描くAIもここに含まれる。

概要

生成AIとは、テキスト・画像・音声・動画・コードなどの新しいコンテンツを生成できるAIの総称を指す。 入力データの分類や予測を主な目的とする従来の識別系AIと対比され、LLMによる文章生成や拡散モデルによる画像生成が代表例になる。 2022年のStable DiffusionやChatGPTの公開を境に一般へ普及し、AI活用の中心的な領域として産業・行政・教育の各分野で導入が進んでいる。

背景

深層学習の初期の成功は画像認識や音声認識といった識別タスクが中心だった。 GAN拡散モデルTransformerに基づくLLMの発展により生成の品質が実用水準へ達し、識別系のAIと区別する言葉として生成AIが定着した。

利点

  • 文章・画像・音声・動画・コードといった多様な種類のコンテンツを、専用の制作スキルがなくても短時間で生成できる
  • たたき台やアイデア出し、定型的なコンテンツ作成を自動化でき、人間は仕上げや意思決定に注力できる
  • 1つのモデルで多様なタスク・様式を扱えるため、タスクごとに個別のモデルを開発する必要性を減らせる

欠点

  • 事実と異なる内容をもっともらしく生成するハルシネーションが起こりうる
  • 学習データに含まれる著作権や個人情報の扱い、生成物の権利関係が法的・倫理的な論点になっている
  • 本物と区別しにくい文章・画像・音声・動画を生成できるため、誤情報の拡散やなりすましに悪用されるリスクがある

比較

  • 基盤モデル基盤モデルが大規模事前学習という開発手法の観点からモデルを捉える言葉であるのに対し、生成AIはテキスト・画像・音声等の新しいコンテンツを生成するという機能・用途の観点からモデルを捉える言葉。両者は同じモデルを指すことも多いが視点が異なる

関連用語

LLM拡散モデルGAN基盤モデルマルチモーダル

よくある質問

生成AIとLLMの違いは?

LLMは生成AIのうち言語を中心に扱うモデルを指す。生成AIは画像・音声・動画などを生成するモデルも含む、より広い総称になる。

生成AIと識別系AI(判別モデル)の違いは?

識別系AIは入力データを既存のカテゴリに分類したり数値を予測したりすることを主な目的とするのに対し、生成AIは学習データにない新しいコンテンツを生み出すことを目的とする。同じ深層学習の技術基盤を利用することも多いが、扱うタスクの性質が異なる。

関連Zenn記事