Re Reference AI

技術

矩形領域とは

Bounding Box / バウンディングボックス

物体検出タスクにおいて、画像内の対象物の位置と範囲を囲んで示す矩形の座標情報

画像認識

ひとことで言うと

画像の中の物体の位置を示すために囲む、四角い枠のこと。

概要

矩形領域(バウンディングボックス)とは、物体検出タスクにおいて、画像内に写る対象物の位置と範囲を示すために用いられる、対象物を囲む矩形の座標情報。 一般に、矩形の左上と右下の座標、または中心座標と幅・高さの組み合わせで表現される。 物体検出モデルは、画像内の各候補物体についてこの矩形領域の座標とクラス(物体の種類)を予測するタスクとして定式化されることが多く、予測した矩形領域と正解の矩形領域の重なり具合(IoU: Intersection over Union)が、検出精度を評価する代表的な指標として使われる。

背景

画像内の物体の位置を表現するには、物体の輪郭を正確に切り出すよりも簡便な表現が必要とされる場面が多かった。 矩形領域は、物体の輪郭そのものではなく、物体を囲む矩形という単純な形状で位置と範囲を近似的に表現するために広く採用されてきた。

利点

  • 座標4つの数値だけで物体の位置と範囲を表現でき、データとして扱いやすい
  • IoU等、矩形同士の重なりに基づく評価指標が確立されており、モデルの精度を定量的に比較しやすい

欠点

  • 物体の正確な輪郭までは表現できず、細長い物体や斜めの物体では矩形内に背景が多く含まれてしまう
  • 物体同士が密集・重なっている場面では、矩形領域だけでは個々の物体を正確に区別しにくい場合がある

比較

  • YOLOYOLOは、画像内の物体の矩形領域とクラスを同時に予測する代表的な物体検出モデル

関連用語

YOLOCNN

関連Zenn記事