「模型鑽牛角尖時也需要緩緩。越深,越需要學會忘記 」。類腦運算的解析 - Dropout 如何穩定深層回聲狀態網路(Deep ESN)
前言: 在進行 ESN 神經網路研究時,我們常常想像一個 ESN 神經網路就是一位專職人員,負責一個單獨的任務。你是否曾想過,如果有很多個 ESN 從不同角度、不同時間演化狀態去擷取這些資訊,那這個任務是不是更加嚴謹了?等等,仔細一點想,如果把神經網路想成一群接力整理訊息的研究員,增加層數似乎應該帶來更完整的分析;但當每個人都用不同方式重述同一份資料,會議紀錄反而可能變得難以判讀。 Deep Echo State Network(Deep ESN)正面臨這種問題。它將多個隨機循環儲存池依序堆疊,用不同層次的動態捕捉快慢不一的時間模式;每一層的狀態又被串接成 ($C_L$),共同送入只需訓練一次的線性讀出層,如圖 1。 圖1|Deep ESN 的基本架構。輸入 (u(t)) 依序通過多層儲存池,各層狀態 ($x_{t}^{(L)}$) 被串接成 ($C_L$),再由最佳線性權重 ($\hat{W}$) 產生預測 (y(t))。 這種架構保留了 reservoir computing 不必反向傳播的效率,卻也讓跨層的相似特徵一併進入矩陣反演。作者 Mario Mallea 等人在《 Understanding the role of dropout in Deep Echo State Networks 》這篇 2026 的論文中把問題重新定位,Deep ESN 不一定缺少表徵能力,反而可能是表徵太多、彼此太像,使讀出的權重對雜訊異常敏感。過去常用 PCA 壓縮維度,或依預測誤差進行監督式剪枝;本文則選擇 dropout,在不直接刪除整個表徵空間的情況下,降低冗餘神經元對讀出的影響,如圖 2。 圖 2|三種儲存池調整策略。降維(PCA)將狀態壓縮成較少的新特徵;dropout 透過保留機率 (p) 降低部分神經元的影響;監督式剪枝(pruning)則根據預測誤差移除較不重要的神經元。 研究動機: 為了解決上述表徵過多且彼此相似,導致讀出權重對雜訊異常敏感的問題,作者將焦點從儲存池本身延伸至同樣關鍵的 dropout 正則化。畢竟在 ESN 中,輸入資料、儲存池與讀出器構成一套彼此牽動的計算系統;即使儲存池產生了豐富的時間表徵,若讀出器面對的是高度共線的特徵,這些額外資訊仍可能轉化為不穩定的估計。傳統 ridge regression 雖能一致地縮小讀出權重,卻無法區分真...








