目前的系統可以看成兩個部分。
第一個部分是:讓電腦找到人體。
這部分我們使用 MediaPipe Pose Landmarker,從攝影機影像中取得肩膀、髖部、膝蓋、腳踝等人體關鍵點。
也就是把原本的影像:「一個人在做動作」
轉換成電腦比較容易處理的:「一組人體座標資料」。
第二個部分則是:這些人體座標代表什麼?
例如在蚌殼式裡,我們想知道:
如果膝蓋到達目標範圍
→ 判斷已經打開。
如果髖部的位置變化超過設定範圍
→ 標記可能出現骨盆旋轉。
這樣做有一個很大的好處:
每一個判斷都比較容易知道原因。
例如系統提示:「請保持骨盆穩定。」
我們可以回頭知道,是因為哪一組關鍵點、哪一個角度或哪一個數值超過設定條件。
如果一開始就直接訓練一個模型,輸入影片後只得到:
「正確」或「錯誤」
雖然看起來很方便,但我們還需要大量有標記的動作資料。
例如: