物体识别

物体识别(),又译做“物体检测”、“目标检测”,是计算机视觉及影像處理中的術語,指的是让计算机去分析一张图片或者一段影片中的物体,并标记出来,这需要给神经网络大量的物体数据去训练它,这样才能进行识别。目前人臉檢測是物體識別領域中被廣泛研究的題目之一。

應用
物體識別在計算機視覺任務中被廣泛應用,有許多基於物體識別之下游任務,如圖像自動標註、物體計數、人臉識別。物體識別亦可應用於物件追蹤,例如:追蹤球類比賽中的球與追蹤影片中的人物。

球類追蹤
由於羽球或網球體積小且瞬間移動速度快,因此是球類追蹤中較難精確實現的任務之。

==== TrackNet ,並利用產生的熱點圖來表示球體所在位置的機率分佈。由於TrackNet試圖克服上述「部分影片幀中消失」的問題,模型的輸入為相鄰的三個幀,輸出則為中間幀的結果。其輸出可以表示為P(i,j,k),代表在座標(i,j)與深度k的位置上的機率,最終輸出為h(i,j)=argmax_kP(i,j,k),即是使用各座標上機率最高的深度作為輸出。

在訓練神經網路方面,為了學習球體位置的機率分佈,TrackNet使用高斯分佈來建模球體在真實位置(x_0,y_0)的熱點圖,表示如下:

G(x, y)=\lfloor(\frac{1}{2\pi\sigma^2}e^{-\frac{(x-x_0)^2+(y-y_0)^2}{2\sigma^2}})(2\pi\sigma^2\centerdot 255)\rfloor

損失函數則是使用交叉熵,定義為:

H_Q(P)=-\sum_{i,j,k}Q(i,j,k)logP(i,j,k),其中Q(i,j,k) = \begin{cases} 1, & \text{if } G(i,j)=k \\ 0, & \text{otherwise.} \end{cases}

方法
近代常見的物體識別方法多為基於深度神經網路模型之方法,核心概念為利用神經網路模型抽取影像之特徵圖,並以此識別出物體類別與位置。

=== End-to-End Object Detection with Transformers

}}

评论 (0)

  • 还没有评论,来抢沙发吧。