「模型鑽牛角尖時也需要緩緩。越深,越需要學會忘記 」。類腦運算的解析 - Dropout 如何穩定深層回聲狀態網路(Deep ESN)

前言:
在進行 ESN 神經網路研究時,我們常常想像一個 ESN 神經網路就是一位專職人員,負責一個單獨的任務。你是否曾想過,如果有很多個 ESN 從不同角度、不同時間演化狀態去擷取這些資訊,那這個任務是不是更加嚴謹了?等等,仔細一點想,如果把神經網路想成一群接力整理訊息的研究員,增加層數似乎應該帶來更完整的分析;但當每個人都用不同方式重述同一份資料,會議紀錄反而可能變得難以判讀。 Deep Echo State Network(Deep ESN)正面臨這種問題。它將多個隨機循環儲存池依序堆疊,用不同層次的動態捕捉快慢不一的時間模式;每一層的狀態又被串接成 ($C_L$),共同送入只需訓練一次的線性讀出層,如圖 1。
圖1|Deep ESN 的基本架構。輸入 (u(t)) 依序通過多層儲存池,各層狀態 ($x_{t}^{(L)}$) 被串接成 ($C_L$),再由最佳線性權重 ($\hat{W}$) 產生預測 (y(t))。

這種架構保留了 reservoir computing 不必反向傳播的效率,卻也讓跨層的相似特徵一併進入矩陣反演。作者 Mario Mallea 等人在《 Understanding the role of dropout in Deep Echo State Networks 》這篇 2026 的論文中把問題重新定位,Deep ESN 不一定缺少表徵能力,反而可能是表徵太多、彼此太像,使讀出的權重對雜訊異常敏感。過去常用 PCA 壓縮維度,或依預測誤差進行監督式剪枝;本文則選擇 dropout,在不直接刪除整個表徵空間的情況下,降低冗餘神經元對讀出的影響,如圖 2。
圖 2|三種儲存池調整策略。降維(PCA)將狀態壓縮成較少的新特徵;dropout 透過保留機率 (p) 降低部分神經元的影響;監督式剪枝(pruning)則根據預測誤差移除較不重要的神經元。

研究動機:
為了解決上述表徵過多且彼此相似,導致讀出權重對雜訊異常敏感的問題,作者將焦點從儲存池本身延伸至同樣關鍵的 dropout 正則化。畢竟在 ESN 中,輸入資料、儲存池與讀出器構成一套彼此牽動的計算系統;即使儲存池產生了豐富的時間表徵,若讀出器面對的是高度共線的特徵,這些額外資訊仍可能轉化為不穩定的估計。傳統 ridge regression 雖能一致地縮小讀出權重,卻無法區分真正具有資訊量的維度,以及只是重複既有訊息的特徵。作者因此不再把 dropout 只視為訓練時隨機關閉神經元的經驗技巧,而是將 Bernoulli 遮罩(機器學習與深度學習中常用的一種隨機二元矩陣(由 0 與 1 組成),其元素根據伯努利分布隨機抽樣產生)的隨機效果解析地納入讀出層,推導出可一次求解的封閉形式解。這使 dropout 同時成為特徵的預條件器與變異懲罰機制:前者依保留機率重新調整各項特徵的貢獻,後者則抑制容易放大估計變異的方向。在此基礎上,研究進一步比較固定、深度相依及冗餘感知的保留策略,試圖回答一個比「要不要使用 dropout」更精確的問題:Deep ESN 應該在哪一層、對哪些特徵,以及以多大的幅度學會遺忘?

研究方法:
這篇論文最有意思的地方,是區分了「單層內部的多樣性」與「所有層合併後的冗餘」。作者以 participation ratio(PR)衡量協方差特徵值實際分布在多少個有效方向。隨著深度增加,PR 上升、單層冗餘下降,表示每個深層儲存池內的活動確實更加多樣;然而,累積冗餘卻持續增加,如圖 3。原因在於後層雖然產生新的非線性表示,仍由前層狀態轉換而來,因此跨層之間可能高度共線。當所有狀態串接後,讀出矩陣的條件數只會維持或惡化,微小雜訊便可能造成大幅度的權重變動。標準 ridge regression 對所有方向施加相同的$L_2$收縮,無法辨識哪些維度提供新資訊、哪些只是另一層的回音。作者則解析地消去 Bernoulli dropout 遮罩,得到確定性的封閉形式解:保留機率一方面形成特徵預條件器,另一方面產生依神經元而異的變異懲罰。Dropout 在這裡不只是隨機關閉神經元,而是重新整理讀取問題的幾何結構。
圖 3|Deep ESN 深度、有效維度與冗餘的關係。紫線顯示單層 PR 隨深度上升,綠線顯示單層冗餘下降;藍線則顯示所有層串接後的累積冗餘持續增加。陰影表示不同隨機儲存池實例的變異範圍。

作者進一步讓保留機率不再固定,而是依 Pearson correlation 或近似 mutual information 所量化的冗餘程度調整:特徵越重複,保留機率越低。雙曲型規則 ($p_{j}=1/(1+\lambda_{l}\cdot \widetilde{\rho_{J}})$) 則以 ($\lambda_{l}$) 控制第 l 層對冗餘的敏感度。受控實驗涵蓋 Mackey–Glass、NARMA10 與 MSO,並逐步提高訓練目標的高斯雜訊;八層模型的結果顯示,標準 Deep ESN 的 RMSE 隨雜訊快速惡化,而多數 dropout 變體更為穩定,如圖 4。驗證結果也指出,高雜訊時最適合採用 Inv. 配置:前層維持較高保留率,深層則施加更強的 dropout。圖 5 上半部顯示,最終層保留率越低,驗證 RMSE 通常越小;下半部進一步呈現保留率如何隨冗餘與深度改變,高相關特徵及深層狀態會受到更積極的抑制。非線性冗餘指標偶爾能再降低誤差,但主要效益其實來自「深層應受到更強正則化」這項結構性偏置。
圖 4|八層 Deep ESN 在三項受控預測任務中的 RMSE。橫軸為訓練雜訊強度,柱狀代表不同 dropout 策略;誤差越低越好。標準模型在高雜訊下惡化最明顯,顯示 dropout 能提升抗雜訊的泛化能力。

圖 5|階層式 dropout 的驗證。上半部比較 Inv. 方法在不同最終層保留率下的 RMSE;下半部顯示 Layer Opt. Inv. 的雙曲型保留函數。橫軸為線性冗餘,曲線越低代表保留率越低;實線為高雜訊、虛線為低雜訊。

真實世界的工業能源預測讓結論變得更細緻。十組韓國製造業資料包含金屬、鋼鐵、水泥、鍛造與造紙產業,其非平穩變化並不像人工加入的高斯雜訊那麼規則。臨界差異圖顯示,LSTM、GRU 等梯度式模型排名最佳,但 Deep ESN IP 與數種自適應 dropout 方法形成統計上相近的群組,如圖 6。最佳 dropout 變體 Layer Opt. Prog. MI 將平均 RMSE 由 20.22 降至 18.07,約改善 10.6%;平均 MSE 則改善約 15.7%,表示它尤其能抑制大型預測突波。值得留意的是,真實資料偏好整體保留率較高、僅隨深度略微降低的配置,與高雜訊受控實驗的強 Inv. 並不完全相同。這提醒我們,dropout 並非「刪得越多越好」,而是應配合雜訊結構調整。論文的理論仍依賴動力線性化、隨機矩陣與高斯互資訊近似,未來也需檢驗殘差連接是否在保存訊號的同時增加跨層冗餘。不過,它已清楚指出一件事:當深度讓網路聽見更多時間尺度時,真正需要管理的並非聲音數量,而是那些彼此重疊的回音。
圖 6|工業能源需求預測的臨界差異圖。方法越靠右、平均排名數值越小,整體 RMSE 表現越佳;被同一條水平線連接的方法之間沒有顯著差異。自適應 Deep ESN Dropout 的整體表現優於標準 Deep ESN、固定 dropout 與多種剪枝方法,同時保留一次性封閉解的計算效率。

貢獻與啟發:
這項研究的主要貢獻,不只是證明 dropout 能改善 Deep ESN,而是將深度、表徵維度、跨層冗餘與讀出穩定性串成一套可檢驗的理論脈絡。網路加深確實能提高單層的有效維度,卻也會在所有層串接後累積共線性。據此,他們將 dropout 的隨機效果解析化,推導出同時具有特徵預條件化與變異懲罰作用的封閉形式解,保留了 reservoir computing 一次求解的效率。實驗進一步顯示,真正主導抗雜訊泛化能力的,並非一味採用更複雜的冗餘指標,而是讓正則化強度配合網路深度與資料特性調整,高雜訊環境通常需要更積極抑制深層狀態,真實世界的非平穩資料則傾向保留較多模型容量。這也帶來一項值得延伸的啟發:模型的表示能力不能只用「產生多少特徵」衡量,還要考慮這些特徵能否被下游學習器穩定辨識。對計算神經科學與理論 AI 而言,遺忘未必是記憶系統的缺陷;當大量神經活動只是重複相同訊息時,選擇性降低它們的影響,反而可能是維持穩定計算與有效泛化的必要條件。 
這項結果也讓人聯想到大腦並非單純追求神經元數量或活動維度,而是透過側向抑制、稀疏編碼、突觸修剪與穩態可塑性,持續調整重複訊號的影響。不過,論文中的 dropout 是由數學最佳化推導出的正則化機制,不能直接等同於任何特定神經生理過程;較合理的類比是,兩者都在處理「如何保留多樣表徵,同時避免冗餘活動破壞下游解碼」的問題。未來可將目前依賴全域相關性統計的保留規則,改寫為只需要局部神經活動的線上可塑性法則,並檢驗它是否能自然形成類似感覺皮質的稀疏、去相關與多時間尺度表徵。另一條值得探索的方向,是將模型套用於 EEG、神經群體放電或腦機介面訊號,分析冗餘感知的神經元抑制是否能提高跨受試者、跨時段及雜訊干擾下的穩定性。若再納入殘差連接、興奮—抑制平衡與結構可塑性,Deep ESN 或許能從高效率的時間序列模型,進一步成為研究神經系統如何在「擴展表徵」與「控制冗餘」之間取得平衡的計算模型。

AI使用聲明:本文有透過 AI 翻譯與摘要,但內容與架構皆透過本人審視與編排


撰文:林祥吉


原始論文:
Mallea, M., Nebot, À., & Mugica, F. (2026). "Understanding the role of dropout in Deep Echo State Networks". Knowledge-Based Systems, 116766.

留言