分居兩側者,涇渭分明的多巴胺;藏於差值中,生生不息的預測誤差
蕈狀體裡的多巴胺神經元(DAN)過去被認為只是傳令兵——獎勵來就發訊號、懲罰來也發訊號。但這篇研究指出,DAN 其實在計算的是**增強預測誤差(RPE)**:實際發生的事,減去原本的預測。 **關鍵機制**:D+ 和 D− 各自都收到兩種輸入——前饋的增強訊號,以及來自輸出神經元(MBON)回傳的預測值。單獨一顆 DAN 只掌握半套資訊,但把兩者的活性相減,完整的 RPE 就浮現出來: $$d_+ − d_− = \hat{r} - \hat{m}$$ 也就是說,RPE 這個訊號不屬於任何單一神經元,而是活在兩顆神經元的**差值**裡——這解釋了為什麼過去單看一顆 DAN 的紀錄,很難直接看出 RPE 的痕跡。 ### 跨隔間的多巴胺回饋——打破「各管各的」規則 蕈狀體天生被切成好幾個獨立隔間,解剖學上的鐵律是:每個隔間裡,DAN 只調控「相反 valence」的輸出神經元(獎勵型 DAN 只管迴避神經元,反之亦然),彼此互不越界。 但這條規則會讓學習卡死——因為突觸權重不能是負值,一旦被增強訊號持續往下壓、壓到 0,就再也學不到東西了。 研究者的解法是提出一條**目前尚未被直接證實的跨隔間連結**:輸出神經元不只回饋給「相反」隔間的 DAN(興奮性),也透過中間神經元回饋給「自己」隔間的 DAN(抑制性)。這條額外連結讓 DAN 同時擁有興奮跟抑制兩種輸入,學習因此**不再有上限**——代價是牴觸了目前「DAN 只管相反 valence」的解剖共識,是這篇論文最大膽、也最容易被未來實驗直接驗證或推翻的預測。 Fig1.c :一顆多巴胺神經元只看得到半個真相——要靠兩顆神經元的活性相減,才能算出完整的預測誤差 Fig3.c : 新增一條尚未證實的連結——多巴胺神經元不再只被『對面』的神經元興奮,也被『自己人』抑制,學習因此不再卡關 Fig2.a : 沒有這條額外連結時,預測值一旦碰到天花板,就再也追不上實際的增強量 聲明:本文由Claude協助撰寫及確認 撰稿人:周峻廷 原始論文:Bennett, J. E., Philippides, A., & Nowotny, T. (2021). "Learning with reinforcement prediction errors in a model of the Drosophila mush...






