Re Reference AI

画像認識

画像認識に関連する用語(19件)

画像認識は、画像に写っている物体や状況をコンピュータで識別する技術です。CNNの発展により実用化が進み、現在はマルチモーダルLLMによる柔軟な画像理解へと進化しています。

用語一覧

CNN

Convolutional Neural Network / 畳み込みニューラルネットワーク

畳み込み演算により画像などグリッド状データの局所的な特徴を検出するニューラルネットワーク

アーキテクチャ深層学習画像認識

AlexNet

2012年のImageNet画像認識コンペティションで圧勝し、深層学習ブームの契機となった畳み込みニューラルネットワーク

モデル画像認識深層学習

YOLO

You Only Look Once

画像を1回のネットワーク推論で処理し、物体の位置と種類をリアルタイムに検出する物体検出モデル

モデル画像認識

矩形領域

Bounding Box / バウンディングボックス

物体検出タスクにおいて、画像内の対象物の位置と範囲を囲んで示す矩形の座標情報

技術画像認識

VLM

Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)

画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル

モデルマルチモーダルLLM画像認識

SAM

Segment Anything Model / Segment Anything

点やボックスの指示だけで画像内の任意の物体を切り出せる、Metaのセグメンテーション基盤モデル

モデル画像認識Meta

ViT

Vision Transformer / ビジョントランスフォーマー

画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ

アーキテクチャ画像認識Transformer

U-Net

ユーネット

縮小と拡大の経路をスキップ接続でつないだU字型のネットワーク。セグメンテーションと拡散モデルで標準的な構成

アーキテクチャ画像認識ニューラルネットワーク

MediaPipe

顔検出・姿勢推定・手指トラッキング等のリアルタイム推論パイプラインをモバイル/Web/エッジ上に構築できるGoogleのオープンソースフレームワーク

インフラフレームワークエッジAI画像認識

ML Kit

ML Kit for Firebase

テキスト認識・バーコードスキャン・顔検出等の学習済みモデルをAndroid/iOSアプリへ組み込める、Googleのオンデバイス機械学習SDK

インフラフレームワークエッジAI画像認識

インテリジェントビジョンセンサー

Intelligent Vision Sensor / AIセンサー

撮像回路にAI推論用のプロセッサとメモリを一体化し、撮像からAI処理までをセンサー単体で完結できるイメージセンサー

インフラハードウェアエッジAI画像認識

RPNet

2枚の画像からカメラ間の相対姿勢(回転・並進ベクトル)をEnd-to-Endで直接推定するニューラルネットワーク

モデル画像認識深層学習

ResNet

Residual Network / 残差ネットワーク

スキップ接続で勾配消失を回避し、非常に深いネットワークの学習を可能にした画像認識アーキテクチャ

アーキテクチャ画像認識深層学習

動画理解

Video Understanding / 映像理解

動画中の物体・行動・場面展開などを認識し、内容を意味的に理解するタスク

技術マルチモーダル画像認識

アクション認識

Action Recognition / 行動認識

動画中の人物の動作や行動をフレーム系列から認識するタスク

技術画像認識系列モデリング

時空間特徴

Spatiotemporal Features

動画データから空間的なパターンと時間的な変化を同時に捉えた特徴表現

技術画像認識系列モデリング

GPT-4V

GPT-4 Vision / GPT-4 with Vision

GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント

モデルマルチモーダル画像認識

医療診断支援

Medical Diagnosis Assistance / Diagnostic AI

画像診断やカルテ情報の解析によって医師の診断を補助するAI技術

技術画像認識

バーチャル試着

Virtual Try-on / VTO

AIが衣服やアクセサリーを利用者の画像・映像上に合成し試着体験を提供する技術

技術画像認識マルチモーダル