Soraとは
OpenAI Sora
OpenAIが開発する、テキストから動画を生成するAIモデル
ひとことで言うと
文章で「こんな映像がほしい」と伝えると動画を作ってくれる、OpenAIの動画生成AI。
概要
Soraとは、OpenAIが開発するテキスト指示から動画を生成するAIモデルを指す。 テキストプロンプトから、複数のキャラクターや背景の一貫性を保った動画を生成でき、拡散モデルとTransformerを組み合わせた構成で学習されている。 OpenAIはSoraを物理世界のシミュレータとしての性質を持つモデルへの一歩と位置づけており、動画生成AIの代表例として注目されている。
背景
従来の動画生成モデルは短尺・低解像度・被写体の一貫性の維持が難しいといった制約を抱えていた。 OpenAIは、画像生成で培った拡散モデルの技術とTransformerによる大規模学習を組み合わせることで、より長く一貫性のある動画を生成できるモデルとしてSoraを開発した。
歴史
2024年2月にOpenAIが発表し、同年12月に一般提供を開始した。2025年には後継のSora 2と専用アプリを公開した。
利点
- テキストの指示だけで、複数のキャラクターや背景の一貫性を保った動画を生成できる
- カメラワークや被写体の動きを含む動画を生成でき、絵コンテやプロトタイプ映像の制作を効率化できる
欠点
- ガラスが割れる、物を食べるといった基本的な物理現象の因果関係を正確にシミュレートできないなど、物理法則の理解には限界がある
- 実在の人物や作品に類似した映像を生成しうる懸念があり、権利・肖像に関する扱いが論点になっている
- 高品質な動画生成には相応の計算コストがかかるため、生成時間や利用回数に制限を設けるサービスもある
比較
- Veo — いずれもテキストから動画を生成するモデルで、SoraはOpenAI、VeoはGoogle DeepMindが開発している
関連用語
よくある質問
Soraは物理世界のシミュレータなのか?
OpenAIはSoraの技術報告で、大規模な動画データからの学習を通じて3次元的な一貫性のある動きなどの性質が創発的に現れたと報告し、物理世界のシミュレータへの一歩と位置づけている。ただし、物体同士の相互作用の物理的な正確さには限界があり、完全な物理シミュレータとして扱えるわけではない。
参考文献
- Official WebsiteOpenAI Sora
- Research PaperVideo generation models as world simulators (OpenAI)