【姿態估計文章閱讀】PifPaf: Composite Fields for Human Pose Estimation

原創

2020-06-23 11:54

一、CVPR2019，內容上還是比較厲害的，代碼：https://github.com/vita-epfl/openpifpaf

二、主要思想

1、提出了Part Intensity Field (PIF)來提升heatmap在高分辨率下的精度

2、利用Part Association Field (PAF)來連接joints

3、本文方法主要比較放在了低分辨率下、遮擋情況以及擁擠等

4、本文利用更加有效的loss，Laplace loss 以及soomth L1 loss來完成迴歸偏移量的迴歸和置信度的迴歸

三、模型的主要結構

這個部分放一個圖就可以一目瞭然，//2就是步長=2，也就是下采樣了：

四、Part Intensity Field (PIF)

文章之所以採用這個是因爲，我們預測的heatmap都是在比原圖小的低分辨率下預測的，一個像素位置可能會造成8像素以上的偏差。以往很多方案中都是採用的雙線性插值，將heatmap還原到原圖大小再去進行argmax或者nms，但是這樣畢竟與直接預測有着差距。

因此文章中借鑑了“Towards Accurate Multi-person Pose Estimation in the Wild”中Coarse to fine的思想，粗略的heatmap結合offset的思想。當然在本文中採用的方式略有不同。

從網絡結構圖上面的介紹可以發現，PIF這部分預測的通道數=17*5，這個5就是這5個量，第一個是置信度；第二、三個是預測的offset向量；第四個使用在loss上的，其實就是動態的去限定了一個loss計算時候的注意力更加集中在groundtruth附近的區域；第五個用於還原到高分辨率時候的高斯的sigma，這樣的話對於不同大小的joint就能產生不同的尺度。

可以從上圖中發現，原始的預測的“置信度map”比較粗糙了，這種直接nms/argmax必然會引入一些誤差--對應到evaluation時候的不同“閾值”選擇的時候，效果會有所不同。

這個公式的意思就是對於需要還原的圖中的某個位置(x,y)，他的置信度是通過融合“預測的所有位置的置信度*對應位置估計的高斯分佈在這個位置的值”

這個方式，從效果圖上來看，還是比較好的，而且對於圖中的不同大小的joint，也有着不同的sigma，也是比較符合人的直觀理解，這樣的效果也會比統一sigma的heatmap的MSELoss看起來更加合理些。

五、Part Association Fields（PAF）

這是另一個核心部分，從網絡結構圖的介紹可以發現，這部分需要預測19*7個通道，也就是定義了19個connection，每個connection中包含了7個量：，第一個代表了置信度，兩個座標offset vector分別指向兩個joint，以及兩個寬度因子。

如何生成的？

對於每個位置，會先去找到離這個位置最近的joint是哪個，然後確定下來；再去更具定義的joint 之間的connection去找到這個點對應的另一個joint。應用的時候，對於置信度的閾值設定了0.5，這樣就可以產生如下效果：

六、Adaptive Regression Loss

對於大尺度的目標而言，joint的一點點座標偏移，這個error帶來的影響是比較小的，但是同樣的情況對於小目標而言就是另一隻情況了。

七、Greedy Decoding 也就是組裝算法

這裏的話，比如選擇從頭頂開始，那麼會選擇整個圖中置信度最高的那個頭開始，然後利用paf把這個joint 連到下一個joint，直到把這個人組裝好了，這個人就定下來了。然後選擇下一個頭，再來一遍。

那麼對於某個joint ，如何去利用paf？

對於向量X，利用上面這個公式，能給每個paf 的預測向量打分，當然是選擇分最高那個。

八、實驗

後續再看看，實驗中有沒有重要的細節，看看代碼，再來補充～～～

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型時代的智能索引與搜索解決方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

軟件測試從自動化到智能化，大模型開始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發——AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應用還存在缺乏

2024-04-22 11:16:30

Create 2024 分論壇：百度大模型安全解決方案護航開發者一起創造未來

4月16日，百度Create AI開發者大會在深圳國際會展中心（寶安）舉行，大會以“創造未來”爲主題，匯聚了當前科技和產業革命中的開發者先鋒力量。自去年3月16日發佈知識增強大語言模型文心一言以來，百度不斷推動文心大模型的升級迭代，每一次版

2024-04-19 21:33:25

AI大模型應用架構（ALLMA）白皮書解讀

隨着人工智能技術的不斷髮展，AI大模型成爲推動生產、生活方式變革，助推產業智能化轉型升級，驅動數字經濟高質量發展等社會經濟發展方面的新引擎。爲了全面展示AI大模型的發展全貌，爲各界提供新思路，本文將對AI大模型應用架構（ALLMA）白皮書進

2024-04-19 11:29:39

文心大模型ERNIE-Tiny：輕量化技術的全面解讀

隨着人工智能技術的日益成熟，大模型成爲了衆多領域的研究熱點。大模型通過龐大的數據量和複雜的網絡結構，實現了對數據的深度挖掘和高效處理。然而，大模型的龐大體積和高計算成本也限制了其在一些實際場景中的應用。爲了解決這一問題，文心大模型ERNIE

2024-04-18 11:29:53

文檔圖像大模型

隨着信息技術的快速發展，文檔處理已經成爲日常生活和工作中不可或缺的一部分。傳統的文檔處理方法往往需要人工參與，效率低下且易出錯。近年來，隨着深度學習技術的突破，文檔圖像大模型在智能文檔處理領域嶄露頭角，爲提升文檔處理性能提供了新的解決方案。

2024-04-18 11:29:52

24小時熱門文章

最新文章

最新評論文章