跳到主要內容

發表文章

精選

HitBack:以階層語意交叉注意力與背景對比實現弱監督語意分割

要教電腦把照片裡的動物一筆一畫描出來,最理想的做法是先餵給它幾萬張已經描好輪廓的範本,可是這種標註得靠人一張一張慢慢描,成本高得嚇人。於是研究者退而求其次:只告訴電腦這張照片裡有一隻鬣狗,剩下的位置讓它自己猜。這就是所謂的弱監督語意分割。電腦用來猜的工具叫熱力圖,顏色愈紅代表它愈覺得那裡是動物。麻煩的是這種熱力圖很偷懶,往往只把最好認的地方點亮,例如頭部或身上鮮明的花紋,其餘部位一片冷冰冰的藍,描出來的輪廓自然殘缺又粗糙。搬到野外相機拍的照片上,難度還會被三件事狠狠推高:稀有動物的照片少得可憐,電腦幾乎沒機會認識牠們;長得極像的近親擠成一團,斑鬣狗、條紋鬣狗和土狼幾乎只差身上的斑紋,藪貓、獵豹、花豹也常被搞混;再加上一大批夜間紅外線照片,畫面昏暗、雜訊滿佈,動物和草叢糊成一片難分難捨。過去的方法把所有類別平鋪在同一層來學,既抓不住大家的共通點,也放大不了彼此的小差異,更完全沒有處理夜拍的問題。這篇論文提出的 HitBack,正是衝著這三個痛點來的。 HitBack 的巧思可以拆成三招。第一招是階層語意交叉注意力,簡稱 HCA,靈感其實很像替動物排家譜:先把長得像的物種歸進同一個父類別,例如斑鬣狗、條紋鬣狗和土狼統統掛在鬣狗底下,原本零散的 47 種動物就被收攏成 20 個大家族。模型也跟著分成兩條線,父線是一張比較深的網路,負責建立“鬣狗這一家大致長什麼樣”的粗略印象;子線比較淺,專門追究“這一隻到底是哪一種鬣狗”。真正關鍵的是中間那道橋樑:子線在動手挑毛病之前,會先回頭參考父線整理好的共通印象,就像學生先聽老師講完整個家族的共同特徵,再回頭比對細微差異,學起來輕鬆又扎實。這一招對稀有動物格外體貼——即使牠自己只有寥寥數十張照片,也能沾光借用同家族其他成員累積下來的豐富知識。最後的熱力圖只交由子線產生,因為只有它同時握有共通與獨特兩種資訊。第二招是背景對比,簡稱 BC,是個相當聰明的迂迴戰術。既然沒有人告訴電腦動物在哪,那就換個方向想:告訴它背景長什麼樣。研究者先用現成的顯著性工具把照片裡疑似動物的區域整片挖掉,再請繪圖 AI 把破洞補起來,憑空生出一張只剩草地、樹叢和天空的乾淨假背景。接著把模型自己認定的背景拿去跟這張假背景比對,愈像愈好。道理很直白:如果模型漏掉了動物的一條腿沒圈進去,那條腿就會殘留在它的背景裡,跟乾淨的假背景一比馬上露餡。為了讓兩者盡量相似,模...

最新文章

「儲層式運算 - 嘗試打開黑盒子 」類腦運算的解析 - Reservoir Computing 的任務分工與最小計算條件

機器人的「閃避本能」:科學家如何用會放電的神經網路,讓 AI 看懂「有東西正朝我飛來」?

蒼蠅沒有立體視覺,憑什麼能精準躲開你的手?

看似混亂的神經連接,如何支撐穩定的方向感?

神經元如何把一個訊號變成多重時間資訊

飛行中果蠅的躲避行為-掃視網路中扮演樞紐作用的神經元

靠碰撞學會避障:零預訓練的昆蟲腦導航模型

DNp03:果蠅碰撞迴避反應的指揮樞紐

In Defense of Minimal Models

當相機學會像神經元一樣「放電」:事件相機如何讓會飛的機器,在高速與黑暗中依然看清自己怎麼動