画像認識
画像認識に関連する用語(19件)
画像認識は、画像に写っている物体や状況をコンピュータで識別する技術です。CNNの発展により実用化が進み、現在はマルチモーダルLLMによる柔軟な画像理解へと進化しています。
用語一覧
CNN
Convolutional Neural Network / 畳み込みニューラルネットワーク
畳み込み演算により画像などグリッド状データの局所的な特徴を検出するニューラルネットワーク
AlexNet
2012年のImageNet画像認識コンペティションで圧勝し、深層学習ブームの契機となった畳み込みニューラルネットワーク
YOLO
You Only Look Once
画像を1回のネットワーク推論で処理し、物体の位置と種類をリアルタイムに検出する物体検出モデル
矩形領域
Bounding Box / バウンディングボックス
物体検出タスクにおいて、画像内の対象物の位置と範囲を囲んで示す矩形の座標情報
VLM
Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)
画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル
SAM
Segment Anything Model / Segment Anything
点やボックスの指示だけで画像内の任意の物体を切り出せる、Metaのセグメンテーション基盤モデル
ViT
Vision Transformer / ビジョントランスフォーマー
画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ
U-Net
ユーネット
縮小と拡大の経路をスキップ接続でつないだU字型のネットワーク。セグメンテーションと拡散モデルで標準的な構成
MediaPipe
顔検出・姿勢推定・手指トラッキング等のリアルタイム推論パイプラインをモバイル/Web/エッジ上に構築できるGoogleのオープンソースフレームワーク
ML Kit
ML Kit for Firebase
テキスト認識・バーコードスキャン・顔検出等の学習済みモデルをAndroid/iOSアプリへ組み込める、Googleのオンデバイス機械学習SDK
インテリジェントビジョンセンサー
Intelligent Vision Sensor / AIセンサー
撮像回路にAI推論用のプロセッサとメモリを一体化し、撮像からAI処理までをセンサー単体で完結できるイメージセンサー
RPNet
2枚の画像からカメラ間の相対姿勢(回転・並進ベクトル)をEnd-to-Endで直接推定するニューラルネットワーク
ResNet
Residual Network / 残差ネットワーク
スキップ接続で勾配消失を回避し、非常に深いネットワークの学習を可能にした画像認識アーキテクチャ
動画理解
Video Understanding / 映像理解
動画中の物体・行動・場面展開などを認識し、内容を意味的に理解するタスク
アクション認識
Action Recognition / 行動認識
動画中の人物の動作や行動をフレーム系列から認識するタスク
時空間特徴
Spatiotemporal Features
動画データから空間的なパターンと時間的な変化を同時に捉えた特徴表現
GPT-4V
GPT-4 Vision / GPT-4 with Vision
GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント
医療診断支援
Medical Diagnosis Assistance / Diagnostic AI
画像診断やカルテ情報の解析によって医師の診断を補助するAI技術
バーチャル試着
Virtual Try-on / VTO
AIが衣服やアクセサリーを利用者の画像・映像上に合成し試着体験を提供する技術