Diffusion LLMとは
拡散型LLM / Diffusion Language Model
自己回帰的に1トークンずつ生成するのでなく、ノイズ除去過程を繰り返してテキストを並列生成するLLM
ひとことで言うと
文章を先頭から順番に1語ずつ作るのでなく、全体を少しずつきれいに整えていくことで文章を作るLLM。
概要
Diffusion LLMは、画像生成で普及した拡散モデルの仕組みをテキスト生成に応用したLLM。 従来主流のGPT系の自己回帰型LLMは、直前までの文脈をもとに次の1トークンを順番に生成していく。Diffusion LLMはこれに対し、ランダムなノイズやマスクされたトークン列から出発し、複数のトークンを同時に予測・修正する処理を繰り返しながら、文章全体を並列に洗練させていく。 この生成方式により、理論上は生成ステップ数をトークン数から切り離せるため、長い文章でも少ないステップ数で高速に生成できる可能性を持つ。 また、生成途中の文章全体を見ながら修正できるため、自己回帰型モデルが苦手とする、後半の内容に合わせて前半を書き直すような処理とも相性が良いとされる。 2025年前後から、Inception LabsのMercuryや中国の研究チームによるLLaDA、Google DeepMindのGemini Diffusionなど、実用規模のDiffusion LLMが相次いで登場し、自己回帰型に代わる生成方式として注目を集めている。
背景
自己回帰型LLMは高い生成品質を持つ一方、トークンを1つずつ順番にしか生成できないため、長い出力ほど生成に時間がかかるという構造的な制約がある。 Diffusion LLMは、画像生成分野で高速化・並列化に成果を上げてきた拡散モデルの仕組みをテキストに適用することで、この逐次生成の制約を緩和し、生成速度と品質の両立を狙う方向性として研究が進められてきた。
歴史
2021年: テキストへ拡散モデルを応用する初期の研究(Diffusion-LM等)が学術分野で登場。 2025年2月: 中国の研究チームがマスク型のDiffusion LLM「LLaDA」を発表し、8Bパラメータ規模で自己回帰型モデルに匹敵する性能を報告。 2025年: Inception Labsが商用のDiffusion LLM「Mercury」およびコーディング特化版「Mercury Coder」を公開。 2025年: Google DeepMindが実験的なDiffusion LLM「Gemini Diffusion」を発表。
利点
- 生成ステップを複数トークンにまたがって並列化しやすく、理論上は自己回帰型より高速な生成が期待できる
- 生成途中の文章全体を繰り返し修正できるため、後続の内容と整合するよう前半を書き直すような処理と相性が良い
欠点
- 自己回帰型LLMと比べて研究・実装の蓄積が浅く、学習手法やスケーリングの知見が発展途上
- 既存の自己回帰型LLM向けに最適化された推論エンジンやツール群をそのまま流用しにくい
比較
関連用語
よくある質問
自己回帰型LLMより速いのか?
複数トークンを並列に予測できるため理論上は高速化の余地が大きいが、実際の速度は実装や推論エンジンの最適化度合いに左右される。Mercuryのように高速性を前面に打ち出す製品もあれば、品質と速度のバランスを取る設計もあり、一概に自己回帰型より常に速いとは言えない。
既存のLLMエコシステム(推論エンジン等)はそのまま使えるのか?
自己回帰型LLM向けに最適化されたKVキャッシュや投機的デコーディングなどの技術は、生成方式が異なるDiffusion LLMにそのまま適用しにくい。専用の推論最適化や新しいツールの整備が課題になっている。