並列計算
並列計算に関連する用語(14件)
並列計算は、複数の計算資源で処理を同時実行して高速化する技術です。GPUによる行列演算の並列化や、複数GPU・ノードにまたがる分散学習がAIの大規模化を支えています。
用語一覧
GPU
Graphics Processing Unit / グラフィックス処理装置
大量の演算を並列処理できる専用プロセッサで、深層学習の学習・推論を支える計算基盤
CUDA
Compute Unified Device Architecture
NVIDIA製GPU上で汎用並列計算を行うための並列計算プラットフォーム・プログラミングモデル
TPU
Tensor Processing Unit
Googleが開発した、ニューラルネットワークの行列演算に特化した専用プロセッサ
ROCm
Radeon Open Compute
AMD GPUで汎用計算するためのオープンソースの並列計算プラットフォーム
DeepSpeed
ZeRO
ZeROによる分散学習を中心に、大規模モデルの学習・推論を効率化するMicrosoftのオープンソースライブラリ
テンソル演算
Tensor Operation
多次元配列であるテンソルに対する加算・乗算・畳み込みなどの数値演算群。深層学習の計算基盤
データ並列
Data Parallelism
モデルの複製を複数デバイスに配置し、ミニバッチを分割して並列に学習を進める分散学習手法
モデル並列
Model Parallelism
モデル自体を複数デバイスに分割して配置し、単一デバイスのメモリに収まらない大規模モデルを学習・推論させる分散学習手法
パイプライン並列
Pipeline Parallelism
モデルの層を複数のステージに分割し、ステージ間でマイクロバッチをパイプライン状に流して並列に学習する分散学習手法
バッチ分割
Batch Splitting
1回の学習ステップで扱うバッチをデバイスのメモリに収まる小さな単位へ分割し、順次または並列に処理する手法
テンソル並列
Tensor Parallelism / テンソル並列化 / 層内並列
各層内の行列演算そのものを複数デバイスに分割して並列計算する、層内並列とも呼ばれるモデル並列の一手法
マイクロバッチ
Micro-batch / Microbatch
パイプライン並列においてミニバッチをさらに細かく分割した処理単位で、ステージ間の待機時間削減に使う
バブル最小化
Bubble Minimization / パイプラインバブル削減
パイプライン並列でデバイスが計算開始・終了時に生じる待機時間(バブル)を、スケジューリング等の工夫で削減する取り組み
条件付き計算
Conditional Computation
入力ごとにネットワークの一部だけを選択的に計算に使うことで、パラメータ数を増やしても計算コストを抑える設計思想