Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

Detection Transformer(DETR)

Carion et al. (2020), End-to-End Object Detection with Transformers

これまでのTwo-stage系(アンカー・RPN・RoI Pooling)、One-stage系(アンカー・グリッド)、Anchor-free系(centerness)は、いずれも「大量の候補(アンカーやグリッドセル、画素)を用意し、そこから重複した予測をNMSで間引く」という設計だった。DETR(DEtection TRansformer) は、物体検出を集合予測(set prediction)問題として定式化し直すことで、アンカー・RPN・NMSといった手作りのコンポーネントを一切使わずに、CNN+Transformerのみでend-to-endに学習できるようにした。

アーキテクチャ

  1. CNNバックボーン(ResNetなど)で画像から特徴マップを抽出する

  2. 特徴マップを1次元に平坦化し、位置エンコーディング(positional encoding)を加えてTransformer Encoderに入力する(各位置間の関係をSelf-Attentionで学習する)

  3. 学習可能な NN 個のベクトル(object queries、N=100N=100 程度、画像中に存在しうる物体数の上限として十分大きく取る)をTransformer Decoderに入力する。DecoderはEncoderの出力に対してCross-Attentionを行い、各object queryを1つの物体(または「物体なし」)に対応する出力に変換する

  4. 各queryの出力をFFN(Feed-Forward Network)に通し、クラスラベル(「物体なし」クラスを含む)とバウンディングボックス (cx,cy,w,h)(cx, cy, w, h)(画像サイズで正規化)を予測する

出力は常に固定長 NN 個の予測だが、実際の物体数は画像ごとに異なるため、多くのqueryは「物体なし(∅\varnothing)」を予測することになる。NMSのような後処理なしで、Decoderのself-attention同士が「同じ物体を2つのqueryが重複して予測しないように」相互作用することを学習で獲得する。

二部マッチングによる集合予測損失

出力が固定長 NN 個の予測集合であるのに対し、正解も可変個のボックス集合 y={y1,…,yM}y = \{y_1, \ldots, y_M\}(M≤NM \leq N、足りない分は「物体なし」∅\varnothing でパディングして長さ NN にそろえる)として与えられる。学習にあたっては、NN個の予測とNN個の正解(パディング含む)の 最適な1対1対応 を見つける必要がある。

DETRはこれを 二部マッチング問題(bipartite matching) として定式化し、 ハンガリアン・アルゴリズム(Hungarian algorithm) で解く。

σ^=arg⁡min⁡σ∈SN∑i=1NLmatch(yi,y^σ(i))\hat{\sigma} = \arg\min_{\sigma \in \mathfrak{S}_N} \sum_{i=1}^{N} L_{\mathrm{match}}(y_i, \hat{y}_{\sigma(i)})
  • SN\mathfrak{S}_N:NN個の要素の置換全体の集合

  • σ\sigma:予測と正解の対応付け(どの予測がどの正解を担当するか)

  • LmatchL_{\mathrm{match}}:ペアごとのマッチングコスト。分類確率とボックスの類似度から計算する

Lmatch(yi,y^σ(i))=−1{ci≠∅} p^σ(i)(ci)+1{ci≠∅} Lbox(bi,b^σ(i))L_{\mathrm{match}}(y_i, \hat{y}_{\sigma(i)}) = -\mathbb{1}_{\{c_i \neq \varnothing\}}\, \hat{p}_{\sigma(i)}(c_i) + \mathbb{1}_{\{c_i \neq \varnothing\}}\, L_{\mathrm{box}}(b_i, \hat{b}_{\sigma(i)})

最適な対応 σ^\hat{\sigma} が見つかったら、通常のcross entropy損失とbbox損失を、その対応にもとづいて計算する(Hungarian loss)。

LHungarian(y,y^)=∑i=1N[−log⁡p^σ^(i)(ci)+1{ci≠∅} Lbox(bi,b^σ^(i))]L_{\mathrm{Hungarian}}(y, \hat{y}) = \sum_{i=1}^{N} \left[ -\log \hat{p}_{\hat{\sigma}(i)}(c_i) + \mathbb{1}_{\{c_i \neq \varnothing\}}\, L_{\mathrm{box}}(b_i, \hat{b}_{\hat{\sigma}(i)}) \right]

このマッチングにより、各正解ボックスに対して「担当する予測」がちょうど1つに決まるため、複数の予測が同じ物体に重複して割り当てられることがなくなる。学習がうまく進めば、推論時にもqueryごとの出力がほぼ重複しなくなり、NMSなしでそのまま最終出力として使える。

ボックス損失:L1L_1 + GIoU

ボックス回帰の損失 LboxL_{\mathrm{box}} には、L1L_1損失とGIoU損失を組み合わせて使う。

Lbox(bi,b^σ(i))=λiou Liou(bi,b^σ(i))+λL1 ∥bi−b^σ(i)∥1L_{\mathrm{box}}(b_i, \hat{b}_{\sigma(i)}) = \lambda_{\mathrm{iou}}\, L_{\mathrm{iou}}(b_i, \hat{b}_{\sigma(i)}) + \lambda_{L1}\, \lVert b_i - \hat{b}_{\sigma(i)} \rVert_1

単純なL1L_1損失だけだと、大きいボックスと小さいボックスで同じ絶対誤差でも意味合いが異なってしまう(スケール依存)。かといって通常のIoUは、2つのボックスが全く重なっていない場合に常に0になり、「どれだけ離れているか」の勾配が得られない。

GIoU(Generalized IoU)(Rezatofighi et al., 2019)はこれを解消する。2つのボックス A,BA, B を囲む最小の矩形を CC とすると、

GIoU(A,B)=IoU(A,B)−∣C∖(A∪B)∣∣C∣\mathrm{GIoU}(A, B) = \mathrm{IoU}(A, B) - \frac{|C \setminus (A \cup B)|}{|C|}

GIoU∈[−1,1]\mathrm{GIoU} \in [-1, 1] で、重なりがない場合でも CC に対する隙間の割合に応じて -1 に向かって連続的に値が変化するため、重なりがないボックス同士でも意味のある勾配が得られる。Liou=1−GIoUL_{\mathrm{iou}} = 1 - \mathrm{GIoU} として損失に使う。

特徴とトレードオフ

メリット

  • アンカー生成、RPN、NMSなど手作りのコンポーネントが不要になり、パイプライン全体がシンプルになる

  • Self-Attentionにより画像全体の大域的な文脈を捉えられるため、重なり合った物体や大きな物体の検出に強い

デメリット

  • 学習の収束が非常に遅い(原論文ではCOCOで500 epoch学習しており、Faster R-CNNの数十epochに比べて大幅に多い)

  • Encoderの計算量が特徴マップの画素数に対して2乗オーダー(O(H2W2)O(H^2W^2))で増えるため、高解像度の特徴マップを使いにくく、小さい物体の検出精度が相対的に弱い

この「収束の遅さ」と「小物体への弱さ」を、Self-AttentionをすべてのピクセルではなくCross-Attention由来の少数のサンプリング点に限定することで解決しようとしたのが、次に扱う Deformable DETR になる。

実行例:DETR による推論

Facebook Researchの公式実装を torch.hub 経由で読み込み、COCO事前学習済みの detr_resnet50 でサンプル画像を検出する。

Using cache found in /home/mitama/.cache/torch/hub/facebookresearch_detr_main
<Figure size 600x400 with 1 Axes>

参考文献