現代人日常生活中可能已頻繁使用人工智慧,例如向大型語言模型提問、接受 LinkedIn 的人脈建議、觀看 YouTube 推薦影片,或依據 Google Maps 的路況預測選擇不同路線。然而,您可能不知道這些互動消耗了多少能源,以及原因何在。
AI 運算需要處理海量資料,這通常在大型資料中心進行,其中部署了數千個 GPU,每秒能執行高達數兆次運算。然而,每個 GPU 的功耗高達 1,000 瓦。相較之下,新款智慧型手機的功耗通常不到 1 瓦。這種千瓦級的功耗讓 GPU 與吸塵器、洗碗機和爐灶等家電處於相同水平,但資料中心的處理器卻是全天候不間斷運作,這是最大的不同。
這種低效率的根本原因在於,GPU 試圖透過軟體和數十億個電晶體來模擬人工神經網路的運作,這需要消耗大量能量來移動海量資料。更重要的是,構成這些網路的模擬人工神經元,其複雜的運算行為遠不及我們所知最節能的運算系統,人腦,中的生物神經元。在許多與 AI 相關的任務上,人腦的能源效率大約是 AI 的一百萬倍。
為了接近這種效率,一種稱為「神經形態工程」的全新運算方式,正致力於打造更像大腦神經元及其突觸的電子元件和電路。
大量研究投入於使電子元件更像生物神經元和突觸。一些研究專注於開發新型實驗性裝置,但它們尚未足夠可靠,無法用於大型系統。其他努力則旨在透過互連許多互補式金屬氧化物半導體(CMOS)電晶體(數位邏輯的主力)來實現神經元和突觸,以模擬單一神經元和突觸。
然而,這種方法需要大量的電晶體(以及一些笨重的電容器),這極大地限制了可建構系統的尺寸,使得這種受大腦啟發的硬體如何擴展並與最先進的 GPU 競爭仍不明朗。
然而,一個單一裝置的人工神經元和突觸,一直以來都隱藏在我們眼前。我們去年發現了它們。它們各自都是由一個普通的 CMOS 電晶體實現的,甚至不是一個性能特別好的電晶體。這就是它們意外發現的故事,以及它們在降低 AI 環境足跡方面的巨大潛力。
現代數位電子學是基於金屬氧化物半導體場效電晶體(MOSFET)的運作,來產生和操控二進位碼的「一」和「零」。MOSFET 近年來不斷演進,但其經典形式是由一塊經過摻雜的矽組成,其中含有過量的正(p 型)或負(n 型)電荷載子。(CMOS 邏輯包含這兩種電晶體。)
該裝置有兩個端子,透過與矽其餘部分極性相反的高度摻雜區域連接到矽,分別是源極(source)和汲極(drain)。另一個端子,閘極(gate),位於分隔源極和汲極的矽上方。閘極本身不直接連接到矽,而是位於一層薄薄的絕緣介電層上方。
值得注意的是,還有一個第四端子連接到矽的本體(bulk);可以將這個本體端子想像成連接到晶片的底部。它通常不太受關注,但對我們這個故事來說非常重要。
當閘極施加電壓且本體端子接地時,與源極和汲極極性相同的電荷載子會被吸引到通道區域。對於 n 型源極和汲極,這些是電子;對於 p 型,則是電洞。這些電荷的存在形成一個導電通道,使源極和汲極之間的電阻降低數個數量級,裝置隨之導通。隨著閘極電壓的增加,這種物理現象會產生一個電流訊號,當電流對閘極電壓作圖時,會穩定上升。
這種響應非常適合邏輯閘、轉換器、多工器、記憶體和其他數位電路,但它不適合模仿神經元的行為。
在真實的神經組織中,稱為神經元的大腦細胞由細胞體、稱為軸突的長投射,以及稱為樹突的短分支投射組成。這些組件集合所能實現的行為和運算豐富而廣泛,但人工神經網路希望模仿的部分是:當細胞體的電壓受到足夠擾動達到特定閾值時,一個稱為動作電位(action potential)的自傳播電壓脈衝會沿著軸突傳遞。
軸突終止於突觸(synapse),這是軸突與另一個神經元樹突之間的電化學連接。動作電位會暫時提升下一個神經元的電壓,提升量取決於突觸連接的強度。如果從這個神經元或其他可能也在那裡形成突觸的神經元,在給定時間內有足夠的動作電位到達這些樹突,細胞體的電壓將會超過閾值並觸發其自身的動作電位。
為了更接近真實神經元的行為,人工神經元應該在跨越關鍵電壓閾值時產生電流尖峰,然後自行快速恢復到靜止狀態。這個尖峰需要是突然的,非線性的。它還應該表現出一些遲滯現象(hysteresis);也就是說,啟動和恢復電壓應該彼此不同,以確保電流只在特定時間內流動。
人工突觸(連接兩個人工神經元的裝置)所需的功能較不複雜,但同樣重要。最主要的是它的電導(conductance)可以電子方式調節。該裝置的導電狀態應該以線性模式增加和減少,並隨時間保持穩定。
在標準操作機制下,沒有單一 MOSFET 能重現這些神經特性中的任何一個。相反地,這是透過將它們組合成複雜電路來實現的。迄今為止,每個神經元和每個突觸都是透過互連數十甚至數百個 MOSFET 來實現的,這在面積、性能和成本方面都非常低效。為了限制所需的空間量,晶片可以多工處理其訊號,將它們串行發送到神經元和突觸,但這種循序處理會引入額外的延遲。
儘管在音訊處理、電腦視覺或健康監測等任務上存在這些面積和時間上的限制,最先進的腦啟發微晶片在相同任務上的功耗已比 GPU 或 CPU 降低高達千倍。如果我們能從易於製造的單一裝置來創建神經元和突觸,我們或許可以在保持能源效率的同時,實現更大規模的部署。
2024 年,在我們的實驗室裡,我的一位學生正在測量一個由一個電晶體和一個憶阻器(memristor)組成的記憶體電路,憶阻器是一種在 2008 年首次製造的非揮發性記憶體裝置。這位學生的憶阻器電路是使用二維材料,建構在含有 MOSFET 的矽微晶片之上。
這些 MOSFET 是在商業晶圓廠使用稱為 180 奈米製程的製造技術生產的,該技術在 2000 年時是尖端技術。有一天,這位學生忘記連接電晶體的本體端子。他觀察到的是電流突然大幅增加,具有高度非線性,並且在電壓降低時會自行恢復(這種現象稱為遲滯迴路)。這是一種非常有前景的神經元般行為!
在徒勞地思考了一週這種行為的解釋後,我(Lanza)請當時的博士後研究員 Pazos 嘗試在沒有憶阻器的晶片中觀察和控制這種現象。這次,我們施加的是電壓脈衝,就像神經元會產生的尖峰,而不是我的學生首次看到這種特殊行為時使用的斜坡電壓。
Pazos 的新數據幫助我們理解了發生了什麼。關鍵在於 MOSFET 那個經常被忽略的第四個端子,即本體端子。在正常操作下,許多在通道中快速移動的電荷載子會與矽原子碰撞,產生自由的電子和電洞對,這個過程稱為碰撞電離(impact ionization)。源極和汲極之間的電位差產生的電場,會使這些新的自由電子漂移到正偏壓的汲極,而電洞則移向通常接地的本體端子,從而平穩地移除電荷。
然而,當電晶體的本體端子懸空(就像我學生實驗中那樣未連接)時,碰撞電離產生的電洞無法被導向接地。相反地,它們會累積在矽的本體中,使其電壓升高。接著,事情就變得有趣了。
在這裡,將 MOSFET 想像成兩種不同類型的電晶體佔據相同的物理空間會有所幫助,一個是刻意建構的 MOSFET,另一個是隱藏的雙極性接面電晶體(bipolar junction transistor)。雙極性裝置透過兩個 p-n 接面傳輸電流訊號,在本例中是源極與通道區域之間以及通道與汲極之間的介面。
這個訊號與中間第三個端子(稱為基極,base)的一個較小電流成正比。在我們的實驗中,這個第三個端子就是本體。
要讓電流流過雙極性電晶體,基極與其他端子之一之間需要足夠大的電位差,以便電流能穿過 p-n 接面。假設這個「閾值電壓」是 0.7 伏特,儘管實際數值取決於裝置幾何形狀和矽摻雜。在我們的裝置中,這個電位差來自於那些累積在本體中的電洞,因為它沒有連接到接地。
一旦達到閾值電壓,裝置會突然變得高度導電,產生電流的急劇增加。這種急劇的電流增加最終會在汲極電壓降低後下降,因為電壓降低會減少本體中電洞的產生速率。剩餘的過量電洞會與雜散電子複合或洩漏,最終本體電壓下降。這種電洞累積、電流尖峰和電洞移除的循環產生了遲滯迴路,非常類似於生物神經元整合離子電流、發射尖峰並恢復到靜止電壓時的電氣行為。
最初,我們只在少數電晶體中觀察到這種行為,而且每個電晶體的恢復時間都大不相同。因此,為了更好地控制它,我們使用第二個 MOSFET 來調節本體端子的電阻。簡單地設定該電阻,突然使所有電晶體在相同的電壓下觸發,幾乎沒有任何變異。換句話說,我們發現透過控制本體接觸電阻,可以在單一矽電晶體中創造出完美的電子神經元行為。
設定電阻可以在製造過程中透過摻雜矽來完成,但我們認為雙電晶體單元(其中一個充當本體電阻)提供了更大的多功能性,因為它允許電子控制。
我們必須確保這種現象能夠持久,否則這樣的裝置將毫無用處。令我們高興的是,我們測試的每一個裝置都運作了超過 1,000 萬次循環。在我們的測試中,沒有一個裝置失效。說實話,我們感到非常驚訝。



