跳到主要內容

發表文章

精選

分居兩側者,涇渭分明的多巴胺;藏於差值中,生生不息的預測誤差

蕈狀體裡的多巴胺神經元(DAN)過去被認為只是傳令兵——獎勵來就發訊號、懲罰來也發訊號。但這篇研究指出,DAN 其實在計算的是**增強預測誤差(RPE)**:實際發生的事,減去原本的預測。 **關鍵機制**:D+ 和 D− 各自都收到兩種輸入——前饋的增強訊號,以及來自輸出神經元(MBON)回傳的預測值。單獨一顆 DAN 只掌握半套資訊,但把兩者的活性相減,完整的 RPE 就浮現出來: $$d_+ − d_− = \hat{r} - \hat{m}$$ 也就是說,RPE 這個訊號不屬於任何單一神經元,而是活在兩顆神經元的**差值**裡——這解釋了為什麼過去單看一顆 DAN 的紀錄,很難直接看出 RPE 的痕跡。 ### 跨隔間的多巴胺回饋——打破「各管各的」規則 蕈狀體天生被切成好幾個獨立隔間,解剖學上的鐵律是:每個隔間裡,DAN 只調控「相反 valence」的輸出神經元(獎勵型 DAN 只管迴避神經元,反之亦然),彼此互不越界。 但這條規則會讓學習卡死——因為突觸權重不能是負值,一旦被增強訊號持續往下壓、壓到 0,就再也學不到東西了。 研究者的解法是提出一條**目前尚未被直接證實的跨隔間連結**:輸出神經元不只回饋給「相反」隔間的 DAN(興奮性),也透過中間神經元回饋給「自己」隔間的 DAN(抑制性)。這條額外連結讓 DAN 同時擁有興奮跟抑制兩種輸入,學習因此**不再有上限**——代價是牴觸了目前「DAN 只管相反 valence」的解剖共識,是這篇論文最大膽、也最容易被未來實驗直接驗證或推翻的預測。 Fig1.c :一顆多巴胺神經元只看得到半個真相——要靠兩顆神經元的活性相減,才能算出完整的預測誤差 Fig3.c : 新增一條尚未證實的連結——多巴胺神經元不再只被『對面』的神經元興奮,也被『自己人』抑制,學習因此不再卡關 Fig2.a : 沒有這條額外連結時,預測值一旦碰到天花板,就再也追不上實際的增強量 聲明:本文由Claude協助撰寫及確認 撰稿人:周峻廷 原始論文:Bennett, J. E., Philippides, A., & Nowotny, T. (2021). "Learning with reinforcement prediction errors in a model of the Drosophila mush...

最新文章

26 克撲翼機器人上的 SNN

危險逼近時,果蠅如何快速轉彎?

Rebound Bursts in Real Dopamine Neurons

記得準,還是記得穩?離散吸引子如何守護工作記憶

尋找脊髓裡的「節拍器」:AI 如何幫我們解開走路的秘密?

KARE:以知識圖譜社群檢索與推理蒸餾提升醫療預測

如何讓神經網路不只是算出答案,而是能穩定地往目標狀態前進?

果蠅不只是追著氣味走:一種基於方向記憶的導航策略

「模型鑽牛角尖時也需要緩緩。越深,越需要學會忘記 」。類腦運算的解析 - Dropout 如何穩定深層回聲狀態網路(Deep ESN)

我們的腦神細胞比較聰明?從樹突與NMDA看神經元的計算複雜度