閉著眼睛,你怎麼知道自己的手在哪裡?讓 5600 個神經網路參加大逃殺,替大腦的「身體感」選出了標準答案

現在讓我們來嘗試一個簡單的動作:請你閉上眼睛,用右手食指摸自己的鼻尖。
摸到了吧?!而且沒戳到眼球,也沒有把你的…右手食指卡進吊扇之類的。這件事平凡到不值得誇獎,但仔細想想並不合理:你又沒看到自己的手、也沒人報座標給你、手臂還需要在黑暗裡移動了幾十公分、最後停在一個直徑不到一公分的目標上。你到底是怎麼知道手在哪裡的?
這種「知道身體在哪、正在怎麼動」的感覺叫本體感覺(proprioception)。它安靜到我們幾乎不會意識到,卻是所有動作的基礎;一旦沒了本體感覺這個基礎,人連走直線都做不到。而神經科學界一個尷尬的事實是:這套系統到底在計算什麼,我們所知有限。
2024 年三月,瑞士 EPFL 的 Alexander Mathis 團隊聯手美國西北大學的 Lee Miller 實驗室,在 Cell 上丟出一個很有意思的作法:與其去猜大腦在算什麼,不如把所有猜測寫成考卷,讓一堆神經網路們去考試,考完再看誰構築出的腦袋最像真正的猴子(不是在罵它們)。
他們一口氣考了 16 份考卷、訓練了 5600 組神經網路模型。

一、你全身佈滿了從不關機的拉力計
先講硬體。肌肉裡埋著一種叫肌梭(muscle spindle)的感受器,工作單純到有點可愛:量這條肌肉現在有多長、正被拉得多快。你可以想成是貼在每條肌肉上的一支會回報速度的捲尺;全身捲尺同時回報,我們的名偵探大腦就有機會反推「手臂現在擺成什麼姿勢」。
這段回送訊號的旅程有固定站牌:肌梭 → 背根神經節 → 腦幹背柱核(上肢走的是楔狀核,cuneate nucleus,簡稱 CN)→ 視丘 → 初級體感覺皮質 S1(本研究鎖定 area 2)→ 次級體感覺皮質。這條路叫背柱-內側蹄系徑路(dorsal column-medial lemniscus pathway),名字很長,但請記住一個等下會用到的解剖事實:CN 距離肌梭其實只有兩個突觸,而 S1 就再遠兩個,所以這是一條上下游分明的產線。本研究餵給模型的輸入,就是 39 條肌肉 ×(長度+速度)= 78 路訊號。
圖一、本篇研究的實驗設計原理示意圖。A. 訓練流程:合成肌梭訊號 → 神經網路 → 16 個計算任務;B. 驗證流程:用網路內部表徵去預測猴子 CN / S1 神經活動。

二、把整個領域的假說,一次攤在同一張考卷上
這篇研究使用的方法叫 task-driven modeling(任務驅動建模):演化不會告訴你某個腦區在算什麼,但會給它一份工作。所以我們反過來逆向工程:先假設它其實是被優化來做某件事情的,那我們就用那件事來訓練網路;若訓出來的網路內部,還真的長得跟真實神經元網路連結很像,這份工作大概就猜對了。
這招在視覺系統上已經很成功(用物件辨識訓出的網路最能預測腹側視覺流)。但用在本體感、而且真的拿去預測神經活動,這是第一次。
於是現在問題變成了:「該出什麼樣的考卷?」團隊把文獻上關於「本體感到底在算什麼」的幾派主張全部收羅整理、各自寫成考題(見圖一)!下面這份十全大補帖,其實就是這個領域時至今日所有主要假說清單的懶人包:

算出手在哪(EgoHand):回歸手部位置/速度/加速度(自我中心座標),4 份。
算出整條手臂在哪(EgoLimb):比起上面多考慮一個「手肘」,4 份。
改用關節座標算(JointLimb):同樣東西但換了另一種座標系,4 份。
認出在做什麼動作(動作辨識):不管手在空間哪裡,都要認出「這是同一個動作」,1 份。
算出該出多少力(感覺運動假說):最麻煩的一份,先用強化學習訓一個 agent 控制 4 自由度手臂抓目標,再用師徒制(teacher-student)讓網路從肌梭訊號回歸出老師學到的關節力矩,1 份。
把訊號壓乾淨就好(效率編碼假說):兩份無監督考卷,分別為 a. 減少冗餘(改自視覺領域的 Barlow Twins 損失)& b. 自編碼器(逼訊號穿過資訊瓶頸再重建),2 份。
以上總共 16 份考卷,看得人眼花撩亂,考生哭暈在廁所;特別要提的是,在這裡設計上有個講究:16 份考卷的感覺輸入統計與網路架構其實全部固定,差別在只換最後的解碼器,換湯不換藥,藥膳牛肉鍋換成味噌牛肉鍋這樣,如此比出來的差異才是「任務」造成的,而不是比誰的網路比較龐大、誰帶了一百枝鉛筆進考場、誰昨天在巷口麵攤跟出題老師吃麵。
至於網路架構則用了兩大類:時序卷積網路(TCN) 與本科普系列捧在掌心絕不歧視的 LSTM,每份考卷各訓 350 種架構,所以一共是:16 × 350 = 5600 組神經網路模型。
而且有一說一,它們考得相當好:位置預測誤差約 1 公分、動作辨識準確率超過 99%、自編碼器重建肌肉長度的相對誤差只有 0.01%。

三、對答案時間:5 隻猴子,246 個神經元
考卷考完,要對的是真答案:先高薪優聘五隻恆河猴來做 center-out reaching(從中心往外伸手構目標)時,以 Utah 電極陣列錄下的神經活動。5 隻猴子,CN 共 159 個神經元、S1 共 87 個。那麼,五隻猴子在2024年季春之初,能夠譜出什麼樣春芽萌動的故事呢?就像 IU 曾說過:「내손을잡아[1]」

實驗有兩種條件,差別很關鍵:
1. 主動:猴子自己操作握把,主動伸手去搆目標,爭取自己的幸福。
2. 被動:機械握把冷不防往某個方向推牠的手臂一下,持續 130 毫秒——猴子羞紅了雙頰,牠沒有要動,這局是牠被動了。

為了要把猴子的實際動作換算成肌梭訊號,團隊用 DeepLabCut 去定位阿猴的關節,再送進肌骨模型,如圖一。(順帶一提,如果各位沒有聽說過 DeepLabCut 是什麼先進技術,事實上 DeepLabCut 不是什麼厚切洋芋片,正是 Mathis 實驗室自家的姿態追蹤工具,一個自家鏟子挖自家礦、自產自銷、獨家販售的概念,你說你也想要用?請到那邊去排隊)
比對的流程是這樣:神經網路先在合成資料上訓練完後就整組參數凍結下好離手、改餵猴子的真實訊號進去,接著取出每一層的內部表徵、抽取前 75 個主成分,再用 ridge regression 去預測單一神經元、單次試驗的放電率,評分指標則是解釋變異量(explained variance, EV)。
這一段寫給進階讀者:為什麼用 ridge regression 而非普通最小平方法?因為 78 路肌肉訊號彼此高度相關、而神經元數量又少得可憐,硬解會直接overfit到over my dead body;ridge regression 因為有一個懲罰項把權重壓住,山中有老虎、猴子沒有辦法稱大王,蜀中有大將、廖化還是那個廖化,所以是這種「欄位多、樣本少、還共線」情境的標準解。但依照優良傳統,這條我們不打算在這邊推導,畢竟字數限制又不是三萬字,建議各位可以在Uber Eats點餐時,順手在意見欄與外送師討論即可。

四、冠軍出爐,而且答案樸素到有點掃興
5600 個神經網路模型比完,最像大腦的是哪一份考卷?答案揭曉:是「同時算出肢體的位置&速度」的那一組~沒有動作辨識、沒有力矩控制、沒有精巧的資訊壓縮……就是最土法煉鋼的那種:現在手在哪、正在往哪動多快(見圖二)。
雖然故事沒有什麼驚心動魄的反轉,但至少過程中作者們發現有個漂亮的細節:「換座標系並不會影響結果」。不管你要神經網路用自我中心座標(手相對於身體)、還是關節角度座標去表達,只要它算的是「位置+速度」,出來的表徵就都一樣像大腦。這暗示大腦在意的是那個量本身,不是我們人類習慣拿來寫論文的哪套座標。
數字上,任務驅動模型贏過傳統線性編碼模型,主動條件增益最高 40%、被動最高 50%;也贏過「直接拿神經資料端到端強行粗暴硬訓」的資料驅動模型,後者的結果根本慘不忍睹…不過這點頗反直覺,試想:直接對著答案練的人,居然輸給在別的考卷練完才轉來考的傢伙!?
但還沒完!這些考試結果裡面,真正有意思的是輸的那幾組:首先,加上「加速度」就變差。一旦考卷要求連加速度一起回歸,表徵反而變得不像大腦。再來,動作辨識和「減少冗餘」這兩組,比完全沒訓練過的隨機網路還糟。練了、但練歪了,也就是方向錯的努力真的會讓你退步。也就是一個「明天要考歷史,你今天晚上回家卻讀英文,即使你讀的是英文版的歷史,隔天還是考輸旁邊公園涼亭下完棋跑來作答湊熱鬧的阿伯」的概念。另外還有一點,就是TCN 明顯打贏 LSTM 與 GRU,後半篇分析作者乾脆只留 300 個 TCN。在本體感這種訊號上,遞迴結構的歸納偏誤反而是包袱。
圖二、全部 16 個任務的神經網路解釋力比較圖,其中包含未訓練網路與線性模型兩者做為比較基線。

五、最耐人尋味的一筆:它只讀過「被動」,卻更懂「主動」
最後這裡,是個讓人眼睛一亮的推論。請記得:剛剛我們提到研究文章中作者的訓練資料裡,完全沒有「肌肉出力」、也沒有任何主動運動,全是被動產生的動作。照理說,這樣訓出來的網路該比較擅長解釋「被動」條件才對。
結果相反。任務驅動模型在主動條件下顯著贏過未訓練網路,在被動條件下反而常常沒有明顯優勢。(作者還特地控制過:把主動試驗的數量與長度砍到跟被動一樣少、一樣短,結論卻不變。)
作者由此推論:當你是「自己想動」的時候,CN 和 S1 收到的不只是從肌肉往上傳的訊號,應該還有一份由上而下、來自運動指令的副本,也就是運動伴隨放電(efference copy)在調節這兩區的活動。
換句話說:「別人推你一把」和「你自己伸手」,在你的身體感覺皮質裡,從來就不是同一件事。

結語
1. 本體感的計算目標,比想像中樸素,就像真實世界中很多事情的發展,其實我們看了開頭就多少都猜的到結局了,不是嗎?在 16 個候選假說裡勝出的,是「估計肢體的位置與速度」,而且與座標系無關。
2. 任務驅動建模跨得過合成資料與真實大腦之間那道溝。只在模擬肌梭訊號上訓練的網路,凍結後直接預測猴子的單次試驗神經動態,勝過線性模型(增益 40–50%)、端到端硬訓的模型與完全未經訓練的網路。
3. 練錯方向則會退步,而且退得比不練還多。動作辨識與冗餘減少這兩份考卷,表徵比隨機初始化的網路更不像大腦。這對「多任務一定比較好」的直覺是個提醒。
4. 主動與被動不是同一回事。模型只學過被動運動卻更會解釋主動運動,指向一個藏在資料外的東西:由上而下的運動指令副本。
最後,照例留一個開放問題給各位親愛的看官:這篇證明了「網路把任務做得越好,內部就越像大腦」,那麼,反過來呢?如果哪天我們造出一台在本體感任務上遠遠超越人類的機器,那麼它的內部表徵,會繼續往大腦靠攏,還是會在某個點岔開、長成一種我們完全認不得的形狀?如果是後者,那個岔路口在哪裡?又假若我們注意到某個物種,大腦反而更像這個認不得的形狀,但動作行為看起來冒失笨拙,那又代表著什麼呢?

AI 使用聲明:部分內文由 Claude協助編輯


撰文:鄭主佑


原始論文:
Marin Vargas A, Bisi A, Chiappa AS, Versteeg C, Miller LE, & Mathis A. (2024) "Task-driven neural network models predict neural dynamics of proprioception". Cell, 187(7), pp.1745–1761. 

留言