HitBack:以階層語意交叉注意力與背景對比實現弱監督語意分割
要教電腦把照片裡的動物一筆一畫描出來,最理想的做法是先餵給它幾萬張已經描好輪廓的範本,可是這種標註得靠人一張一張慢慢描,成本高得嚇人。於是研究者退而求其次:只告訴電腦這張照片裡有一隻鬣狗,剩下的位置讓它自己猜。這就是所謂的弱監督語意分割。電腦用來猜的工具叫熱力圖,顏色愈紅代表它愈覺得那裡是動物。麻煩的是這種熱力圖很偷懶,往往只把最好認的地方點亮,例如頭部或身上鮮明的花紋,其餘部位一片冷冰冰的藍,描出來的輪廓自然殘缺又粗糙。搬到野外相機拍的照片上,難度還會被三件事狠狠推高:稀有動物的照片少得可憐,電腦幾乎沒機會認識牠們;長得極像的近親擠成一團,斑鬣狗、條紋鬣狗和土狼幾乎只差身上的斑紋,藪貓、獵豹、花豹也常被搞混;再加上一大批夜間紅外線照片,畫面昏暗、雜訊滿佈,動物和草叢糊成一片難分難捨。過去的方法把所有類別平鋪在同一層來學,既抓不住大家的共通點,也放大不了彼此的小差異,更完全沒有處理夜拍的問題。這篇論文提出的 HitBack,正是衝著這三個痛點來的。 HitBack 的巧思可以拆成三招。第一招是階層語意交叉注意力,簡稱 HCA,靈感其實很像替動物排家譜:先把長得像的物種歸進同一個父類別,例如斑鬣狗、條紋鬣狗和土狼統統掛在鬣狗底下,原本零散的 47 種動物就被收攏成 20 個大家族。模型也跟著分成兩條線,父線是一張比較深的網路,負責建立“鬣狗這一家大致長什麼樣”的粗略印象;子線比較淺,專門追究“這一隻到底是哪一種鬣狗”。真正關鍵的是中間那道橋樑:子線在動手挑毛病之前,會先回頭參考父線整理好的共通印象,就像學生先聽老師講完整個家族的共同特徵,再回頭比對細微差異,學起來輕鬆又扎實。這一招對稀有動物格外體貼——即使牠自己只有寥寥數十張照片,也能沾光借用同家族其他成員累積下來的豐富知識。最後的熱力圖只交由子線產生,因為只有它同時握有共通與獨特兩種資訊。第二招是背景對比,簡稱 BC,是個相當聰明的迂迴戰術。既然沒有人告訴電腦動物在哪,那就換個方向想:告訴它背景長什麼樣。研究者先用現成的顯著性工具把照片裡疑似動物的區域整片挖掉,再請繪圖 AI 把破洞補起來,憑空生出一張只剩草地、樹叢和天空的乾淨假背景。接著把模型自己認定的背景拿去跟這張假背景比對,愈像愈好。道理很直白:如果模型漏掉了動物的一條腿沒圈進去,那條腿就會殘留在它的背景裡,跟乾淨的假背景一比馬上露餡。為了讓兩者盡量相似,模...






