画像認識
画像認識に関連する用語(11件)
画像認識は、画像に写っている物体や状況をコンピュータで識別する技術です。CNNの発展により実用化が進み、現在はマルチモーダルLLMによる柔軟な画像理解へと進化しています。
用語一覧
CNN
Convolutional Neural Network / 畳み込みニューラルネットワーク
畳み込み演算により画像などグリッド状データの局所的な特徴を検出するニューラルネットワーク
AlexNet
2012年のImageNet画像認識コンペティションで圧勝し、深層学習ブームの契機となった畳み込みニューラルネットワーク
YOLO
You Only Look Once
画像を1回のネットワーク推論で処理し、物体の位置と種類をリアルタイムに検出する物体検出モデル
矩形領域
Bounding Box / バウンディングボックス
物体検出タスクにおいて、画像内の対象物の位置と範囲を囲んで示す矩形の座標情報
VLM
Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)
画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル
SAM
Segment Anything Model / Segment Anything
点やボックスの指示だけで画像内の任意の物体を切り出せる、Metaのセグメンテーション基盤モデル
ViT
Vision Transformer / ビジョントランスフォーマー
画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ
U-Net
ユーネット
縮小と拡大の経路をスキップ接続でつないだU字型のネットワーク。セグメンテーションと拡散モデルで標準的な構成
MediaPipe
顔検出・姿勢推定・手指トラッキング等のリアルタイム推論パイプラインをモバイル/Web/エッジ上に構築できるGoogleのオープンソースフレームワーク
ML Kit
ML Kit for Firebase
テキスト認識・バーコードスキャン・顔検出等の学習済みモデルをAndroid/iOSアプリへ組み込める、Googleのオンデバイス機械学習SDK
インテリジェントビジョンセンサー
Intelligent Vision Sensor / AIセンサー
撮像回路にAI推論用のプロセッサとメモリを一体化し、撮像からAI処理までをセンサー単体で完結できるイメージセンサー