HitBack:以階層語意交叉注意力與背景對比實現弱監督語意分割
要教電腦把照片裡的動物一筆一畫描出來,最理想的做法是先餵給它幾萬張已經描好輪廓的範本,可是這種標註得靠人一張一張慢慢描,成本高得嚇人。於是研究者退而求其次:只告訴電腦這張照片裡有一隻鬣狗,剩下的位置讓它自己猜。這就是所謂的弱監督語意分割。電腦用來猜的工具叫熱力圖,顏色愈紅代表它愈覺得那裡是動物。麻煩的是這種熱力圖很偷懶,往往只把最好認的地方點亮,例如頭部或身上鮮明的花紋,其餘部位一片冷冰冰的藍,描出來的輪廓自然殘缺又粗糙。搬到野外相機拍的照片上,難度還會被三件事狠狠推高:稀有動物的照片少得可憐,電腦幾乎沒機會認識牠們;長得極像的近親擠成一團,斑鬣狗、條紋鬣狗和土狼幾乎只差身上的斑紋,藪貓、獵豹、花豹也常被搞混;再加上一大批夜間紅外線照片,畫面昏暗、雜訊滿佈,動物和草叢糊成一片難分難捨。過去的方法把所有類別平鋪在同一層來學,既抓不住大家的共通點,也放大不了彼此的小差異,更完全沒有處理夜拍的問題。這篇論文提出的 HitBack,正是衝著這三個痛點來的。
HitBack 的巧思可以拆成三招。第一招是階層語意交叉注意力,簡稱 HCA,靈感其實很像替動物排家譜:先把長得像的物種歸進同一個父類別,例如斑鬣狗、條紋鬣狗和土狼統統掛在鬣狗底下,原本零散的 47 種動物就被收攏成 20 個大家族。模型也跟著分成兩條線,父線是一張比較深的網路,負責建立“鬣狗這一家大致長什麼樣”的粗略印象;子線比較淺,專門追究“這一隻到底是哪一種鬣狗”。真正關鍵的是中間那道橋樑:子線在動手挑毛病之前,會先回頭參考父線整理好的共通印象,就像學生先聽老師講完整個家族的共同特徵,再回頭比對細微差異,學起來輕鬆又扎實。這一招對稀有動物格外體貼——即使牠自己只有寥寥數十張照片,也能沾光借用同家族其他成員累積下來的豐富知識。最後的熱力圖只交由子線產生,因為只有它同時握有共通與獨特兩種資訊。第二招是背景對比,簡稱 BC,是個相當聰明的迂迴戰術。既然沒有人告訴電腦動物在哪,那就換個方向想:告訴它背景長什麼樣。研究者先用現成的顯著性工具把照片裡疑似動物的區域整片挖掉,再請繪圖 AI 把破洞補起來,憑空生出一張只剩草地、樹叢和天空的乾淨假背景。接著把模型自己認定的背景拿去跟這張假背景比對,愈像愈好。道理很直白:如果模型漏掉了動物的一條腿沒圈進去,那條腿就會殘留在它的背景裡,跟乾淨的假背景一比馬上露餡。為了讓兩者盡量相似,模型只好把動物圈得愈來愈完整。這等於白白撿到一份逐格逐點的提示,卻一筆人工描邊都沒用到。第三招是自適應低光增強,簡稱 LLIE。夜拍照片實在太暗,所以先派一個小小的判斷器看一眼這張是白天還是晚上,只有夜間照片才送去做亮度修復,白天的原封不動放行,因為硬要加強明亮的照片,反而會把原本清楚的細節弄得髒兮兮。修復過後,動物和背景之間的界線變得俐落許多,模型自然更容易把輪廓畫對。
成效相當漂亮。研究者先做了拆解實驗,看每一招各值多少分(這裡的分數叫 mIoU,簡單說就是畫出來的形狀和正確答案重疊得有多好)。從一個和過去方法同款的基礎版本出發,起點是 39.7%;換上家譜式的雙線架構後一口氣跳到 53.0%,加上背景對比再添 8 分,補上夜間增強又多 2 分,最後穩穩落在 58.1%,比起點足足高出十八個百分點以上。跟同期最強的幾個方法擺在一起比,HitBack 的熱力圖分別領先 ToCo、SIPE 和 MCTformer 大約十到十八分;把熱力圖整理成偽標籤、拿去訓練正式的分割網路之後,最終成績也比 ToCo 高出七到九分。最令人印象深刻的是稀有動物那一組:HitBack 拿到 45.9%,而另一個當紅方法 CLIP-ES 只有 19.6%,等於直接證實了靠家族長輩罩這個策略真的管用。其他拆解也很有意思,只用父線畫熱力圖表現最差,父子平均次之,全權交給子線才最理想;父線的資訊要從第六層取出剛剛好,太早共通特徵還沒成形,太晚整張圖又會糊成一團。把整套方法搬到別的資料集同樣站得住腳,代表它不是只會對付某一批照片的偏方。最後還有一個很有趣的發現:在人工標註極度稀缺的情況下,只看圖片標籤的 HitBack 竟然贏過那些需要人工描邊的全監督與半監督方法;但只要可用的描邊資料超過四分之一,對手拿到了足夠精確的提示,就會重新反超回去。
撰文:陳怡亨
原始論文:Xie, P., Zhuo, W., Wang, X., Deng, S., He, W., & Shen, L. (2026). "HitBack: Transformer with Hierarchical-Semantic Cross Attention and Background Contrast for Weakly Supervised Wildlife Semantic Segmentation". IEEE Transactions on Multimedia, vol. 28, pp. 2363–2377.




留言
張貼留言