Re Reference AI

技術

計算効率とは

Computational Efficiency

同じ性能をより少ない計算量・メモリ・時間で達成できるかを表す、モデルの学習・推論における効率性の指標

モデル圧縮推論最適化

概要

計算効率は、モデルの学習や推論において、一定の性能を達成するために必要な計算量(FLOPs)・メモリ使用量・処理時間がどれだけ少なく済むかを表す概念。 モデルサイズを大きくすれば性能は向上しやすいが、その分だけ計算コストも増大するため、限られた計算資源のもとでいかに高い性能を引き出すかという観点から多様なアプローチが追求されている。 具体的には、量子化知識蒸留プルーニングといったモデル圧縮技術、Mixture of Expertsのように入力ごとに使用するパラメータを絞る条件付き計算の設計、Speculative Decodingのような推論高速化技術などが挙げられる。 Scaling Lawsの文脈では、同じ計算予算(Compute Budget)のもとでモデルサイズと学習データ量をどう配分すれば損失を最小化できるかという計算効率の最適化も、重要な研究テーマになっている。

比較

  • 量子化量子化は、モデルの重みを低ビット化することで計算効率を高める代表的な手法の1つ
  • MoEMoEは、条件付き計算によって一部の専門家のみを使うことでパラメータ数当たりの計算効率を高めるアーキテクチャ
  • スケーリング則スケーリング則は、限られた計算予算のもとでモデルサイズとデータ量をどう配分すれば計算効率よく性能を高められるかを扱う経験則

関連用語

量子化知識蒸留プルーニングMoEスケーリング則推論最適化