モデル
モデルに分類される用語(46件)
モデルは、LLMや画像認識モデルなどAIが学習・推論に用いる具体的な実装を指す分類です。GPT・Llama・GeminiのようなLLMから、AlphaGoのような特化型AIまで、個々のモデル・システムがここに含まれます。
用語一覧
LLM
大規模言語モデル / Large Language Model
大量のテキストコーパスで学習し、言語を予測・生成するニューラルネットワーク
BERT
Bidirectional Encoder Representations from Transformers
文中の前後の文脈を双方向に参照して単語表現を学習する、Transformerエンコーダベースの事前学習済み言語モデル
SLM
Small Language Model / 小規模言語モデル
数億〜数十億パラメータ程度の、軽量で特定用途に最適化された言語モデル
推論モデル
Reasoning Model
出力前に長い内部推論過程を生成し、複雑な問題の精度を高めるよう最適化されたLLM
埋め込みモデル
Embedding Model
テキストや画像などを埋め込みベクトルへ変換する専用のニューラルネットワークモデル
GPT
Generative Pre-trained Transformer
OpenAIが開発する、デコーダのみのTransformerに基づく生成AIモデルファミリー
Claude
Anthropicが開発する、安全性とアライメントを重視した大規模言語モデルファミリー
Gemini
Google Gemini / Bard
Googleが開発する、テキスト・画像・音声等を統合的に扱うマルチモーダル大規模言語モデルファミリー
Llama
LLaMA
Metaが開発する、研究・商用利用向けに重みを公開しているオープンウェイトの大規模言語モデルファミリー
Mistral
Mistral AI
フランスのMistral AIが開発する、効率性を重視したオープンウェイトの大規模言語モデルファミリー
DeepSeek
DeepSeek AI
中国のDeepSeekが開発する、高いコスト効率と推論能力を特徴とするオープンウェイトの大規模言語モデルファミリー
Qwen
通義千問
中国のAlibaba Cloudが開発する、多言語対応を強みとするオープンウェイトの大規模言語モデルファミリー
Phi
Microsoftが開発する、高品質な学習データを重視した小規模言語モデルファミリー
Gemma
Googleが公開する、Geminiの研究成果をもとに構築された軽量なオープンウェイトモデルファミリー
AlexNet
2012年のImageNet画像認識コンペティションで圧勝し、深層学習ブームの契機となった畳み込みニューラルネットワーク
YOLO
You Only Look Once
画像を1回のネットワーク推論で処理し、物体の位置と種類をリアルタイムに検出する物体検出モデル
PaLM
Pathways Language Model
Googleが開発した、Pathwaysという分散学習システムを用いて学習された大規模言語モデル
Grok
イーロン・マスク率いるxAIが開発する、X(旧Twitter)との統合を特徴とする大規模言語モデルファミリー
Cohere
Command R
カナダのCohereが開発する、企業向けRAG・検索用途に強みを持つLLM・埋め込みモデルファミリー
Stable Diffusion
Stability AIが公開した、オープンウェイトの拡散モデルベースによるテキストから画像を生成するモデル
Whisper
OpenAIが公開した、多言語対応のオープンソース音声認識(ASR)モデル
CLIP
Contrastive Language-Image Pre-training
画像とテキストを同じ埋め込み空間へ対応づけ、両者の意味的な近さを比較できるようにするOpenAIのマルチモーダルモデル
VLM
Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)
画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル
基盤モデル
Foundation Model / ファウンデーションモデル
大量のデータで事前学習され、ファインチューニングやプロンプトによって幅広いタスクへ適応できる汎用モデル
フロンティアモデル
Frontier Model / フロンティアAI
その時点で最も高い能力を持つ一群の基盤モデルを指す、主に安全性・政策の文脈で使われる言葉
Sora
OpenAI Sora
OpenAIが開発する、テキストから動画を生成するAIモデル
Veo
Google Veo
Google DeepMindが開発する、テキストや画像から音声付きの動画を生成するAIモデル
Midjourney
ミッドジャーニー
芸術的な画風に強みを持つ、テキストから画像を生成するサブスクリプション型AIサービス
FLUX
FLUX.1 / Flux
Stable Diffusionの元開発メンバーが設立したBlack Forest Labsによる画像生成AIモデルのシリーズ
Kimi
Kimi K2 / Moonshot AI Kimi
中国のMoonshot AIが開発するLLMシリーズ。オープンウェイトの大規模MoEモデルKimi K2で注目された
SAM
Segment Anything Model / Segment Anything
点やボックスの指示だけで画像内の任意の物体を切り出せる、Metaのセグメンテーション基盤モデル
AlphaFold
アルファフォールド
アミノ酸配列からタンパク質の立体構造を予測する、Google DeepMindのAIモデル
AlphaGo
アルファ碁
深層学習とモンテカルロ木探索を組み合わせ、囲碁で人間のトップ棋士に初めて勝利したGoogle DeepMindのAI
VLA
Vision-Language-Action / VLAモデル
視覚と言語の理解に行動の生成を統合し、カメラ映像と自然言語の指示からロボットの動作を出力する基盤モデル
Ornith
Ornith-1.0
AlibabaのQwen 3.5とGoogleのGemma 4を基盤に、エージェント型コーディング向けへ強化学習で自己改善させたオープンウェイトLLMファミリー
Sentence-BERT
SBERT
シャム(Siamese)ネットワーク構造でBERTを微調整し、コサイン類似度で比較可能な文単位の埋め込みを高速に得られるモデル
Fable
Claude Fable 5 / Claude Fable
Anthropicが2026年6月に発表した、Claudeファミリーの中でも「Mythosクラス」に位置づけられる最上位モデル
FocoNet
複数観測点の地震波形データからTransformerで震源メカニズム(発震機構解)を推定する機械学習モデル
RPNet
2枚の画像からカメラ間の相対姿勢(回転・並進ベクトル)をEnd-to-Endで直接推定するニューラルネットワーク
T5
Text-to-Text Transfer Transformer
あらゆる自然言語処理タスクをテキスト入力からテキスト出力への変換として統一的に扱うGoogleのエンコーダ・デコーダ型言語モデル
SimCLR
Simple Framework for Contrastive Learning of Visual Representations
データ拡張と対照学習によって画像の表現をラベルなしで学習する自己教師あり学習フレームワーク
マルチモーダルLLM
Multimodal LLM / MLLM
テキストに加え画像・音声・動画など複数モダリティの入出力を単一モデルで扱える大規模言語モデル
GPT-4V
GPT-4 Vision / GPT-4 with Vision
GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント
Claude Opus
Anthropicが提供するClaudeモデルファミリーの中で、最も高い性能を重視して設計された最上位モデルライン
Orca
GPT-4が生成する詳細な推論過程を模倣学習させることで、小規模ながら高い推論能力を目指したMicrosoft Researchの言語モデル
Jev
TypeSafe AIが2026年9月に発表した、文字列を生成せず型安全な構造化決定を並列出力する「System One Model」