👓 glasses_v20260730 眼鏡辨識 實驗報告

🧪 這是測試實驗,未上版、未 R2、未進 demo。目的:測「全身 person crop 對眼鏡(小物件)能學到多少」,並作為「全身 vs 頭部聚焦」討論的資料點。

MobileNetV3-L binary | cvat #43 辦公室眼鏡真實料 | 全身 crop 384×384 | 未部署

best.pt ⬇ (實驗版)

做法

cvat #43(person bbox + glasses[yes/no] 屬性)→ 匯出 person polygon→bbox 全身 crop → MobileNetV3 二元分類(戴/沒戴)。刻意用全身 crop 不切頭部(眼鏡在全身裡極小),看能學到多少。

訓練資料

train 454(戴 342/沒戴 112)· val 56 · test 57(戴 43/沒戴 14)· pos_weight 0.327(壓多數的「戴」)

⚠️ 只 hank/chen 2 人的真實料,train/test 同 2 人 → per-person,泛化上限,數字偏樂觀。

全身 crop 樣本(眼鏡在頂端很小)

全身站姿 crop(aspect ~2.5-3.3),眼鏡在頭部(最頂 ~15%)佔像素極少。

📈 訓練曲線

結果(test n=57)

指標
val glasses AP0.9931 @ep11
test glasses AP0.9756
@0.5 accuracy0.930
FN(戴→判沒戴)0/43(戴的全抓到)
FP(沒戴→判戴)4/14

實驗判讀

  1. 全身 crop 也學得動眼鏡(AP 0.976、recall 100%)—— 即使眼鏡超小,model 抓到臉部區信號
  2. 弱點在 FP:沒戴的 4/14 被誤判戴(全身低解析,戴 vs 沒戴細節難分)
  3. AP 0.976 偏樂觀:test 同 2 人、場景相似,是實驗上限非泛化
  4. 下一步(可選):同 test 比「頭部聚焦 crop」是否把 FP 壓下 → 回答「小物件要不要 head-ROI」

ckpt(本地,未 R2):~/factory_ppe/runs/glasses_v20260730/best.pt