Re Reference AI

インフラ

Groqとは

LPU / GroqCloud

LLM推論に特化した独自チップLPUを開発する半導体企業と、その高速推論クラウドサービス

ハードウェア推論最適化

ひとことで言うと

AIの回答生成を極端に速くする専用チップを作る会社。GPUの代わりに独自チップを使い、毎秒数百トークンの速さで文章を生成する。

概要

Groqとは、LLM推論に特化した独自チップLPU(Language Processing Unit)を開発する米国の半導体企業、および同社の推論サービスを指す。 LPUはGPUと異なり決定的な実行スケジューリングを前提とした設計で、メモリ帯域のボトルネックを抑え、トークン生成の速度に特化している。 オープンウェイトモデルを毎秒数百トークン規模で生成するクラウドサービスGroqCloudを提供し、応答速度が体験を左右する音声対話やエージェント用途での利用が広がっている。 イーロン・マスクのAI企業xAIが開発するチャットボットGrokとは無関係の別企業になる。

歴史

2016年に、GoogleでTPUの開発に関わったJonathan Rossらが設立した。2024年頃からLLMの高速推論サービスで広く知られるようになった。

利点

  • LPUの専用設計により、GPUベースの推論より高いトークン生成速度を実現しやすい
  • 決定的な実行スケジューリングにより、応答時間のばらつきを抑えやすい

欠点

  • 学習用途には向かず、推論に特化して設計されている
  • 対応モデルやカスタマイズの自由度は、GPUベースの自前ホスティングより制約される場合がある

比較

  • GrokGroqはLLM推論用チップと推論サービスを提供する半導体企業、GrokはxAIが開発するLLM。名前が似ているが無関係
  • GPUGPUが学習・推論の双方に使われる汎用の並列計算チップであるのに対し、LPUはLLMのトークン生成速度に特化した設計を採る

関連用語

GPUTPUNPU推論

よくある質問

GroqとGrokは同じ会社か。

無関係の別の存在になる。GroqはLPUと呼ぶ推論特化チップを開発する半導体企業、GrokはxAIが開発するLLMの名称で、名前が似ているだけの偶然になる。

LPUとGPUの違いは何か。

GPUが学習・推論を含む汎用の並列計算に使われるのに対し、LPUはLLMのトークン生成というワークロードに特化して設計されたチップで、決定的なスケジューリングによりメモリ帯域のボトルネックを抑える設計を採る。

参考文献

  • Official WebsiteGroq

関連Zenn記事