了解複雜機器學習系統,特別是大型語言模型(LLM)的行為,是現代人工智慧面臨的關鍵挑戰。可解釋性研究旨在讓模型建構者和受影響的人類更清楚決策過程,這是邁向更安全、更值得信賴的人工智慧的重要一步。為了獲得全面的理解,我們可以透過不同視角分析這些系統:特徵歸因,它能分離出驅動預測的特定輸入特徵;資料歸因,它將模型行為與具影響力的訓練範例連結起來;以及機制可解釋性,它剖析內部組件的功能。
儘管視角不同,但同樣的根本障礙依然存在:_規模化複雜性_。模型行為很少是孤立組件的結果;相反地,它源於複雜的依賴關係和模式。為了達到最先進的效能,模型會綜合複雜的特徵關係,從多樣化的訓練範例中找出共享模式,並透過高度互連的內部組件處理資訊。
因此,基於現實或經過驗證的可解釋性方法也必須能夠捕捉這些具影響力的互動。隨著特徵、訓練資料點和模型組件數量的增長,潛在互動的數量呈指數級增長,使得窮舉分析在計算上不可行。在這篇部落格文章中,我們將介紹 SPEX 和 ProxySPEX 背後的基礎理念,這些演算法能夠大規模識別這些關鍵互動。
### 透過消融進行歸因我們方法的關鍵是消融的概念,透過觀察移除某個組件後發生的變化來衡量其影響。* 特徵歸因:我們遮蔽或移除輸入提示詞的特定片段,並測量預測結果的變化。* 資料歸因:我們在訓練資料集的不同子集上訓練模型,評估在缺少特定訓練資料的情況下,模型在測試點上的輸出如何變化。
* 模型組件歸因(機制可解釋性):我們透過移除特定內部組件的影響來干預模型的正向傳播,以確定哪些內部結構對模型的預測負責。在每種情況下,目標都是相同的:透過系統性擾動系統,隔離決策的驅動因素,以期發現具影響力的互動。由於每次消融都會產生顯著成本,無論是透過昂貴的推論呼叫還是重新訓練,我們的目標是使用_最少的消融次數_來計算歸因。
### SPEX 和 ProxySPEX 框架為了以可處理的消融次數發現具影響力的互動,我們開發了 SPEX(光譜解釋器)。這個框架借鑒了訊號處理和編碼理論,將互動發現的規模推進到比以往方法大幾個數量級。SPEX 透過利用一個關鍵的結構性觀察來規避這個問題:雖然總互動數量大得驚人,但_具影響力的_互動數量實際上相當少。
我們透過兩個觀察來形式化這一點:稀疏性(真正驅動輸出的互動相對較少)和低度性(具影響力的互動通常只涉及一小部分特徵)。這些特性使我們能夠將困難的搜尋問題重新構建為可解決的稀疏恢復問題。SPEX 借鑒了訊號處理和編碼理論的強大工具,利用策略性選擇的消融來組合許多候選互動。
然後,使用高效的解碼演算法,我們將這些組合訊號分離開來,以隔離負責模型行為的特定互動。在隨後的 ProxySPEX 演算法中,我們發現了複雜機器學習模型中另一個常見的結構特性:階層性。這意味著當高階互動很重要時,其低階子集也可能很重要。
這個額外的結構性觀察顯著改善了計算成本:它以大約_少 10 倍的消融次數_達到了 SPEX 的效能。總體而言,這些框架實現了高效的互動發現,為特徵、資料和模型組件歸因解鎖了新的應用。### 特徵歸因特徵歸因技術根據輸入特徵對模型輸出的影響,為其分配重要性分數。
例如,如果一個 LLM 用於進行醫療診斷,這種方法可以精確識別哪些症狀導致模型得出結論。雖然將重要性歸因於單個特徵很有價值,但複雜模型的真正力量在於它們能夠捕捉特徵之間複雜關係的能力。下圖展示了這些具影響力互動的範例:從雙重否定改變情感(左)到 RAG 任務中多個文件必要的綜合(右)。
下圖展示了 SPEX 在情感分析任務上的特徵歸因效能。我們使用_忠實度_來評估效能:這是一種衡量恢復的歸因在未見過的測試消融上預測模型輸出的準確程度。我們發現,SPEX 在短輸入上與現有互動技術(Faith-Shap、Faith-Banzhaf)的高忠實度相匹配,但在上下文擴展到數千個特徵時,它獨特地保持了這種效能。
相比之下,雖然邊際方法(LIME、Banzhaf)也能在這種規模下運作,但它們的忠實度顯著較低,因為它們未能捕捉驅動模型輸出的複雜互動。SPEX 也應用於修改版的電車難題,其中移除了問題的道德模糊性,使「True」成為明確的正確答案。在以下修改下,GPT-4o mini 僅有 8% 的時間回答正確。
當我們應用標準特徵歸因(SHAP)時,它將單獨出現的詞語 _trolley_ 識別為導致錯誤回應的主要因素。然而,將 _trolley_ 替換為 _tram_ 或 _streetcar_ 等同義詞對模型的預測影響甚微。SPEX 揭示了一個更豐富的故事,識別出兩個 _trolley_ 實例以及詞語 _pulling_ 和 _lever_ 之間的主導高階協同作用,這一發現與人類對困境核心組件的直覺相符。
當這四個詞被同義詞替換時,模型的失敗率降至接近零。### 資料歸因資料歸因識別哪些訓練資料點對模型在新測試點上的預測負有最大責任。識別這些資料點之間具影響力的互動是解釋模型意外行為的關鍵。冗餘互動,例如語義重複,通常會強化特定(且可能不正確)的概念,而協同互動對於定義單個樣本無法形成的決策邊界至關重要。
為了證明這一點,我們將 ProxySPEX 應用於在 CIFAR-10 上訓練的 ResNet 模型,識別了各種困難測試點的兩種互動類型中最顯著的範例,如下圖所示。如圖所示,協同互動(左)通常涉及語義上不同的類別共同作用以定義決策邊界。
例如,將協同作用根植於人類感知,_汽車_(左下)與提供的訓練圖像共享視覺特徵,包括跑車的低矮底盤、黃色卡車的方正形狀以及紅色送貨車的水平條紋。另一方面,冗餘互動(右)傾向於捕捉視覺重複,以強化特定概念。例如,_馬_ 的預測(右中)受到一群具有相似輪廓的狗圖像的嚴重影響。
這種細粒度分析有助於開發新的資料選擇技術,在安全移除冗餘的同時保留必要的協同作用。### 注意力頭歸因(機制可解釋性)模型組件歸因的目標是識別模型中哪些內部部分,例如特定層或注意力頭,對特定行為負有最大責任。在這裡,ProxySPEX 也揭示了架構不同部分之間的負責互動。
理解這些結構性依賴關係對於架構干預至關重要,例如針對特定任務的注意力頭剪枝。在 MMLU 資料集(美國高中歷史)上,我們證明了由 ProxySPEX 提供的剪枝策略不僅優於競爭方法,而且實際上可以_提高模型在目標任務上的效能_。在這項任務中,我們還分析了模型深度上的互動結構。
我們觀察到早期層主要在線性機制中運作,其中注意力頭對目標任務的貢獻大多是獨立的。在較晚的層中,注意力頭之間的互動作用變得更加明顯,大部分貢獻來自同一層中注意力頭之間的互動。### 接下來呢?SPEX 框架代表了可解釋性方面的一個重大進步,將互動發現從_數十個擴展到數千個組件_。
我們已經展示了該框架在整個模型生命週期中的多功能性:探索長上下文輸入上的特徵歸因,識別訓練資料點之間的協同作用和冗餘,以及發現內部模型組件之間的互動。展望未來,圍繞_統一_這些不同視角,提供對機器學習系統更全面的理解,仍有許多有趣的科學問題。
系統性地評估互動發現方法與基因組學和材料科學等領域現有科學知識的對比,也具有重要意義,這既可以驗證模型發現,也可以產生新的、可測試的假設。我們邀請研究社群加入這項努力:SPEX 和 ProxySPEX 的程式碼已完全整合並可在流行的 SHAP-IQ 儲存庫中取得。



