訓練報告 · 跌倒

fall_sq_v805b — 新增 ch8 / ch20 真實資料後重訓

2026-08-05 · session:模型訓練 · MobileNetV3-Large · person-crop 384×384 正方形

結論:維持現役 pat16,v805b 不上版

同一個測試集對照,新版沒有比現役好(整體 AP 0.9904 vs 0.9953)。 依「沒退步才上版」原則維持現行模型。

但這次的資料不是白做 —— 它讓 ch20 從「幾乎無法評估」變成可以評估, 也讓 ch8 第一次有了資料。真正的判斷要等 ch8 的「倒地」樣本生成完才能下。

整體對照

同一個測試集 · 正 795 人 / 負 4,107 人

兩個模型都沒看過這批新測試資料(現役 pat16 的訓練集與新測試集交集為 0),對照有效。

pat16(現役)

0.9953
整體 AP
建議門檻 0.58 → 抓到 95.2%(漏 38 人)· 誤報 3 次

v805b(本次)

0.9904
整體 AP
建議門檻 0.83 → 抓到 95.1%(漏 39 人)· 誤報 13 次

抓到率幾乎相同,但誤報從 3 次變 13 次。這是典型的「納入大量新場域資料後稀釋原有場域」, 與 PPE 全資料重訓的兩次實證同一個型態。

逐鏡頭

21 支鏡頭的表現

AP 欄位的箭頭是 v805b 相對現役的變化。「建議設定」是 v805b 在該鏡頭 先確保抓到 95% 以上、再取誤報最低的門檻。

鏡頭考試用
倒地
考試用
沒倒地
v805b APpat16 AP建議門檻該點表現
新東陽 ch10411721.0001.000thr 0.95抓到 100% · 誤報 0.0%
新東陽 ch1252160.991 ▲0.0030.988thr 0.95抓到 90% · 誤報 6.2%
新東陽 ch2078940.997 ▼0.0031.000thr 0.74抓到 96% · 誤報 1.1%
新東陽 ch2123141.000 ▲0.0030.997thr 0.87抓到 96% · 誤報 0.0%
新東陽 ch2235631.0001.000thr 0.60抓到 97% · 誤報 0.0%
新東陽 ch2333361.0001.000thr 0.95抓到 100% · 誤報 0.0%
新東陽 ch2425481.0001.000thr 0.57抓到 96% · 誤報 0.0%
新東陽 ch621551.0001.000thr 0.95抓到 100% · 誤報 0.0%
新東陽 ch801,449沒有「倒地」樣本,只能看誤報0.0%0.0%
興農 151-11472070.998 ▼0.0021.000thr 0.94抓到 96% · 誤報 0.0%
興農 151-14442081.0001.000thr 0.95抓到 100% · 誤報 0.0%
興農 152-1431680.999 ▼0.0011.000thr 0.92抓到 95% · 誤報 0.0%
興農 152-14477631.0001.000thr 0.95抓到 96% · 誤報 0.0%
興農 152-6411891.0001.000thr 0.95抓到 95% · 誤報 0.0%
興農 155-148730.979 ▼0.0170.996thr 0.46抓到 96% · 誤報 2.7%
興農 155-547840.980 ▼0.0140.994thr 0.95抓到 96% · 誤報 2.4%
興農 155-7513540.999 ▼0.0011.000thr 0.95抓到 98% · 誤報 0.0%
愛烙達 頻道15-3樓後方走道2220.984 ▼0.0120.996
愛烙達 頻道16-3樓走道+貨梯21500.996 ▲0.0020.994thr 0.95抓到 95% · 誤報 4.0%
天銳國際 測試144280.998 ▲0.0010.997thr 0.62抓到 95% · 誤報 3.6%
天銳國際 測試232341.0001.000thr 0.86抓到 97% · 誤報 0.0%

🔴 這次要特別注意的兩件事

ch8 的「零倒地樣本」風險

ch8 這次進來 4,483 個人,但全部都是「沒倒地」 —— 倒地的樣本還在生成中。

表面上看 v805b 在 ch8 的誤報是 2 次 / 1,449,現役 pat16 是 36 次, 看起來大勝。但這正是要小心的地方:

只餵負樣本,模型可能學到的是「這個場景一律不算跌倒」, 而不是「這個場景的人站得好好的」。若真是如此,ch8 真的有人倒下時模型也不會反應 —— 誤報降低是假象,代價是完全失去偵測力。
要等生成的 ch8 倒地樣本進來、能量測抓到率之後,這個數字才有意義。

ch20 的畫質瓶頸

這次 ch20 用的是主線畫面(1472×704),畫面中一個人約 89×167 像素, 測試集從 2 個倒地樣本變成 78 個,AP 0.997。

但實際上線接的是 480×240 的低畫質線路,同一個人只有 17×41 像素。 實測 200 張低畫質畫面、308 個人,模型全部判成「沒倒地」
ch20 要能上線,得請場域把主線畫面接進來;在那之前這批高畫質資料的價值是 「證明畫質夠的話這支做得到」,不是能直接上線。

模型與推論資訊

設定

Backbone
MobileNetV3-Large (ra_in1k)
參數量
4.20 M
架構
binary BCE · 1 head + partial-label mask
訓練 imgsz
384 × 384
推論 imgsz
384 × 384(同訓練)
crop 形狀
正方形 · bbox 外擴 0.15
前段偵測器
person_yolo26m_v20260715
偵測推論 imgsz
1280(場域遠景小目標)
batch / epochs
96 / 40
patience
16(ep07 最佳,ep23 早停)
lr / wd
3e-4 / 0.01
aug / mixup
strong / 0.2
訓練 / 驗證 / 測試
13,362 / 3,274 / 5,243
val mAP
0.9696

為什麼是正方形?躺著的人在畫面上是橫向扁平的, 沿用站姿的直立長方形裁切等於把人上下拉長 2–3 倍。改成正方形後,同樣資料下 AP 從 0.385 提升到 0.736、誤報降 62%。這是這個模型最關鍵的一個設定。

資料變化

這一版新增了什麼

來源內容人數說明
新東陽 ch8舊系統 39 段告警錄影 → 297 張畫面4,483 全部「沒倒地」。畫面 100% 乾淨(零灰畫面),SAM3 描輪廓
新東陽 ch207 個主線畫面批次 → 61 張520 87 個真實倒地。SAM3 重描輪廓後判定,與原人工標註一致
合計總 crop 16,833 → 21,879+5,046

標註方式這一版改為 SAM3 人形輪廓(polygon)取代矩形框。 SAM3 抓到的人比原本多:ch8 從 4,533 → 6,147、ch20 從 482 → 520,多出來的主要是遠景排隊人群。

後續

接下來做什麼

產出:模型訓練 session · 2026-08-05 · 5090-2 · runs/fallcls_fall_sq_v805b