編碼器(光學系統)將物體映射為無雜訊影像,雜訊再將其破壞為測量數據。我們的資訊估計器僅使用這些嘈雜的測量數據和雜訊模型,來量化測量數據區分物體的能力。
許多成像系統產生的測量數據,人類無法直接看見或解讀。你的智慧型手機在生成最終照片前,會透過演算法處理原始感測器數據。MRI 掃描儀收集的是頻率空間測量數據,需要重建後醫生才能檢視。自駕車則直接使用神經網路處理攝影機和光達(LiDAR)數據。
這些系統的關鍵不在於測量數據的外觀,而在於它們包含了多少有用資訊。即使資訊以人類無法解讀的方式編碼,AI 也能將其提取出來。
然而,我們卻很少直接評估資訊內容。傳統指標如解析度(resolution)和訊噪比(signal-to-noise ratio, SNR)各自評估品質的不同面向,使得在這些因素之間權衡的系統難以比較。另一種常見方法是訓練神經網路來重建或分類影像,這卻將成像硬體的品質與演算法的品質混為一談。
我們開發了一個框架,能夠根據成像系統的資訊內容,直接進行評估和優化。在我們 NeurIPS 2025 的論文中,我們展示了這個資訊指標在四個成像領域中都能預測系統效能,並且優化此指標所產生的設計,其表現與最先進的端到端方法相當,同時所需的記憶體更少、運算量更低,且無需專門的解碼器設計。
為何選擇互信息?
互信息(Mutual Information)量化了測量數據在多大程度上減少了對產生該數據的物體的不確定性。即使兩個系統的測量數據看起來完全不同,但若它們具有相同的互信息量,則在區分物體的能力上是等效的。
這個單一數值捕捉了解析度、雜訊、取樣以及所有影響測量品質的其他因素的綜合效應。一張模糊、嘈雜但保留了區分物體所需特徵的影像,可能比一張清晰、乾淨卻遺失了這些特徵的影像包含更多資訊。
資訊統一了傳統上獨立的品質指標。它同時考慮了雜訊、解析度和光譜靈敏度,而非將它們視為獨立因素。
先前將資訊理論應用於成像領域的嘗試面臨兩個問題。第一種方法將成像系統視為不受限制的通訊通道,忽略了鏡頭和感測器的物理限制。這導致了極度不準確的估計。第二種方法則需要對成像物體建立明確的模型,限制了其通用性。
我們的方法透過直接從測量數據中估計資訊,避免了這兩個問題。
從測量數據中估計資訊
估計高維變數之間的互信息是出了名的困難。樣本需求隨維度呈指數增長,且估計值會受到高偏差和高變異的影響。
然而,成像系統的特性使得這個困難的問題可以分解為更簡單的子問題。互信息可以表示為:I(X;Y)=H(Y)−H(Y∣X)
第一項 H(Y) 衡量了來自物體差異和雜訊的測量數據總變異。第二項 H(Y∣X) 則僅衡量來自雜訊的變異。
互信息等於測量數據總變異與僅由雜訊引起的變異之間的差值。
成像系統具有良好特徵化的雜訊。光子散粒雜訊(Photon shot noise)遵循卜瓦松分佈(Poisson distribution)。電子讀出雜訊(Electronic readout noise)是高斯分佈。這種已知的雜訊物理特性意味著我們可以直接計算 H(Y∣X),只剩下 H(Y) 需要從數據中學習。
對於 H(Y),我們將機率模型(例如 transformer 或其他自迴歸模型)擬合到測量數據集。該模型學習所有可能測量數據的分佈。我們測試了三種在效率與準確度之間權衡的模型:靜態高斯過程(最快)、完整高斯模型(中等)和自迴歸 PixelCNN(最準確)。這種方法提供了真實資訊量的上限;任何模型誤差只會高估,絕不會低估。
跨越四個成像領域的驗證
如果資訊估計能捕捉到限制真實系統的因素,那麼它應該能預測解碼器的效能。我們在四個成像應用中測試了這種關係。
資訊估計能預測彩色攝影、射電天文學、無鏡頭成像和顯微鏡等四個成像領域的解碼器效能。更高的資訊量始終能在下游任務中產生更好的結果。
彩色攝影。 數位相機使用濾波器陣列來編碼顏色,每個像素只能偵測特定波長。我們比較了三種濾波器設計:傳統的拜耳(Bayer)模式、隨機排列和學習型排列。資訊估計正確地排出了哪些設計能產生更好的顏色重建,其排名與神經網路去馬賽克(demosaicing)的結果相符,且無需任何重建演算法。
射電天文學。 射電望遠鏡陣列透過結合全球各地站點的訊號來實現高角解析度。選擇最佳望遠鏡位置在計算上是難以處理的,因為每個站點的價值都取決於所有其他站點。資訊估計預測了不同望遠鏡配置下的重建品質,使得無需昂貴的影像重建即可進行站點選擇。
無鏡頭成像。 無鏡頭相機用光調變遮罩取代傳統光學元件。它們的測量數據與場景沒有視覺上的相似性。資訊估計預測了在不同雜訊水平下,鏡頭、微透鏡陣列和漫射器設計的重建準確度。
顯微鏡。 LED 陣列顯微鏡使用可程式化照明來產生不同的對比模式。資訊估計與神經網路從細胞影像預測蛋白質表現的準確度相關,使得無需昂貴的蛋白質標記實驗即可進行評估。
在所有情況下,更高的資訊量意味著更好的下游效能。
使用 IDEAL 設計系統
資訊估計不僅能評估現有系統。我們的「資訊驅動編碼器分析學習」(Information-Driven Encoder Analysis Learning, IDEAL)方法,利用資訊估計的梯度上升來優化成像系統參數。
IDEAL 透過資訊估計的梯度回饋來優化成像系統參數,無需解碼器網路。
計算成像設計的標準方法,端到端優化,會同時訓練成像硬體和神經網路解碼器。這需要透過整個解碼器進行反向傳播,導致記憶體限制和潛在的優化困難。
IDEAL 透過僅優化編碼器來避免這些問題。我們在彩色濾波器設計上測試了它。從隨機濾波器排列開始,IDEAL 逐步改進了設計。最終結果在資訊內容和重建品質方面都與端到端優化相當。
IDEAL 在訓練過程中避免了複雜的解碼器,同時其效能與端到端優化相當。
影響
基於資訊的評估為真實世界條件下的成像系統嚴格評估創造了新的可能性。目前的方法需要主觀視覺評估、部署時無法獲得的真實數據,或是未能捕捉整體能力的孤立指標。我們的方法僅從測量數據中提供了一個客觀、統一的指標。
IDEAL 的計算效率預示著設計過去難以實現的成像系統的可能性。透過避免解碼器反向傳播,該方法降低了記憶體需求和訓練複雜度。我們在後續工作中更廣泛地探索了這些能力。
該框架可能不僅限於成像,還可擴展到其他感測領域。任何可以建模為具有已知雜訊特性的確定性編碼系統,都可能從基於資訊的評估和設計中受益,包括電子、生物和化學感測器。
本文基於我們 NeurIPS 2025 的論文《資訊驅動的成像系統設計》。程式碼可在 GitHub 上取得。專案網站上提供影片摘要。



