HitBack:以階層語意交叉注意力與背景對比實現弱監督語意分割

要教電腦把照片裡的動物一筆一畫描出來,最理想的做法是先餵給它幾萬張已經描好輪廓的範本,可是這種標註得靠人一張一張慢慢描,成本高得嚇人。於是研究者退而求其次:只告訴電腦這張照片裡有一隻鬣狗,剩下的位置讓它自己猜。這就是所謂的弱監督語意分割。電腦用來猜的工具叫熱力圖,顏色愈紅代表它愈覺得那裡是動物。麻煩的是這種熱力圖很偷懶,往往只把最好認的地方點亮,例如頭部或身上鮮明的花紋,其餘部位一片冷冰冰的藍,描出來的輪廓自然殘缺又粗糙。搬到野外相機拍的照片上,難度還會被三件事狠狠推高:稀有動物的照片少得可憐,電腦幾乎沒機會認識牠們;長得極像的近親擠成一團,斑鬣狗、條紋鬣狗和土狼幾乎只差身上的斑紋,藪貓、獵豹、花豹也常被搞混;再加上一大批夜間紅外線照片,畫面昏暗、雜訊滿佈,動物和草叢糊成一片難分難捨。過去的方法把所有類別平鋪在同一層來學,既抓不住大家的共通點,也放大不了彼此的小差異,更完全沒有處理夜拍的問題。這篇論文提出的 HitBack,正是衝著這三個痛點來的。

HitBack 的巧思可以拆成三招。第一招是階層語意交叉注意力,簡稱 HCA,靈感其實很像替動物排家譜:先把長得像的物種歸進同一個父類別,例如斑鬣狗、條紋鬣狗和土狼統統掛在鬣狗底下,原本零散的 47 種動物就被收攏成 20 個大家族。模型也跟著分成兩條線,父線是一張比較深的網路,負責建立“鬣狗這一家大致長什麼樣”的粗略印象;子線比較淺,專門追究“這一隻到底是哪一種鬣狗”。真正關鍵的是中間那道橋樑:子線在動手挑毛病之前,會先回頭參考父線整理好的共通印象,就像學生先聽老師講完整個家族的共同特徵,再回頭比對細微差異,學起來輕鬆又扎實。這一招對稀有動物格外體貼——即使牠自己只有寥寥數十張照片,也能沾光借用同家族其他成員累積下來的豐富知識。最後的熱力圖只交由子線產生,因為只有它同時握有共通與獨特兩種資訊。第二招是背景對比,簡稱 BC,是個相當聰明的迂迴戰術。既然沒有人告訴電腦動物在哪,那就換個方向想:告訴它背景長什麼樣。研究者先用現成的顯著性工具把照片裡疑似動物的區域整片挖掉,再請繪圖 AI 把破洞補起來,憑空生出一張只剩草地、樹叢和天空的乾淨假背景。接著把模型自己認定的背景拿去跟這張假背景比對,愈像愈好。道理很直白:如果模型漏掉了動物的一條腿沒圈進去,那條腿就會殘留在它的背景裡,跟乾淨的假背景一比馬上露餡。為了讓兩者盡量相似,模型只好把動物圈得愈來愈完整。這等於白白撿到一份逐格逐點的提示,卻一筆人工描邊都沒用到。第三招是自適應低光增強,簡稱 LLIE。夜拍照片實在太暗,所以先派一個小小的判斷器看一眼這張是白天還是晚上,只有夜間照片才送去做亮度修復,白天的原封不動放行,因為硬要加強明亮的照片,反而會把原本清楚的細節弄得髒兮兮。修復過後,動物和背景之間的界線變得俐落許多,模型自然更容易把輪廓畫對。

成效相當漂亮。研究者先做了拆解實驗,看每一招各值多少分(這裡的分數叫 mIoU,簡單說就是畫出來的形狀和正確答案重疊得有多好)。從一個和過去方法同款的基礎版本出發,起點是 39.7%;換上家譜式的雙線架構後一口氣跳到 53.0%,加上背景對比再添 8 分,補上夜間增強又多 2 分,最後穩穩落在 58.1%,比起點足足高出十八個百分點以上。跟同期最強的幾個方法擺在一起比,HitBack 的熱力圖分別領先 ToCo、SIPE 和 MCTformer 大約十到十八分;把熱力圖整理成偽標籤、拿去訓練正式的分割網路之後,最終成績也比 ToCo 高出七到九分。最令人印象深刻的是稀有動物那一組:HitBack 拿到 45.9%,而另一個當紅方法 CLIP-ES 只有 19.6%,等於直接證實了靠家族長輩罩這個策略真的管用。其他拆解也很有意思,只用父線畫熱力圖表現最差,父子平均次之,全權交給子線才最理想;父線的資訊要從第六層取出剛剛好,太早共通特徵還沒成形,太晚整張圖又會糊成一團。把整套方法搬到別的資料集同樣站得住腳,代表它不是只會對付某一批照片的偏方。最後還有一個很有趣的發現:在人工標註極度稀缺的情況下,只看圖片標籤的 HitBack 竟然贏過那些需要人工描邊的全監督與半監督方法;但只要可用的描邊資料超過四分之一,對手拿到了足夠精確的提示,就會重新反超回去。
圖1:HitBack 的全景圖,從左上角一路看到右下角,剛好就是一張照片在模型裡跑完一圈的順序。最左邊是相機陷阱拍到的原始照片,第一關是虛線框起來的 Adaptive LLIE:裡頭的日/夜判別器會先看一眼這張是白天還是晚上,只有夜拍照片會被推進亮度修復模組,白天的照片直接放行,免得多此一舉反而把清楚的細節弄糊。處理完的照片接著兵分兩路。往右上走的是「父分類」這條線,用的是比較深的網路(12 層),它拿到的是代表 20 個大家族的標籤卡(圖中的 Parent [CLS])以及照片被切成的一格格小方塊,任務是學會「鬣狗這一家大致長什麼樣」,圖上用 hyena 當示範。往右下走的是「子分類」這條線,網路淺得多,因為它是站在父線的肩膀上:中間那個灰色的 HCA 方塊就是兩條線之間的橋樑,子類別的標籤卡在這裡去「查閱」父線半路(第六層)整理好的內容,把家族的共同印象吸收進來之後,才專心去分辨眼前這隻究竟是斑鬣狗還是條紋鬣狗(圖中的 hyenaSpotted)。兩條線各自都會做分類、算自己的分數,但最後的熱力圖只由子線產生,因為只有它同時握有共通與獨特兩種資訊。圖最下方那一整條是「背景對比」模組:左側的顯著性偵測器先把疑似動物的區域標出來(中間那張黑白的顯著圖),交給背景生成器把它挖掉並補畫成一張乾淨的假背景,接著拿去和右側「模型自己認為的背景」互相比對。兩者愈像,就代表模型漏掉的動物身體愈少,熱力圖也就被一步步逼得更完整、更貼合輪廓。

圖2:把三個方法擺在一起做對照,差別一眼就看得出來。最上面那一列是原始照片加上正確答案,也就是人工描好的動物輪廓,用醒目色塊蓋在上面;下面三列依序是 ToCo、MCTformer 和 HitBack 各自畫出來的熱力圖——顏色愈紅代表模型愈確定那裡有動物,愈藍就是它認定的背景。左邊三欄是白天拍的照片,右邊三欄是夜間紅外線影像,其中有幾張因為動物體型實在太小,特地裁切放大才看得清楚。先看 ToCo 那一列,它的紅色常常只擠在一小塊上,例如頭部或背脊,身體其餘部分整片被判成背景。MCTformer 犯的則是另一種毛病:整張圖霧濛濛地泛著中間色,界線模糊,夜拍照片裡連背景草叢都被點亮,主角反而糊掉不見。相較之下,HitBack 那一列的紅色區塊幾乎貼著動物的輪廓走,從肥碩的鬣狗到細瘦的狐狸,從明亮草原到漆黑夜色,表現都相當穩定俐落。這正好呼應了三個模組各自的功勞:家譜式的雙線架構讓模型先認對到底是哪一種動物,背景對比把活化範圍從「最好認的一小塊」推廣到整隻身體,而夜間增強則讓昏暗照片裡的動物邊界重新浮現出來。


撰文:陳怡亨


原始論文:Xie, P., Zhuo, W., Wang, X., Deng, S., He, W., & Shen, L. (2026). "HitBack: Transformer with Hierarchical-Semantic Cross Attention and Background Contrast for Weakly Supervised Wildlife Semantic Segmentation". IEEE Transactions on Multimedia, vol. 28, pp. 2363–2377.

留言