微軟研究院的深度學習 DFT 方法 Skala 1.1 持續進化,其訓練數據量是前一版本的 2.5 倍,在熱化學、反應動力學和分子結構預測等關鍵分子模擬挑戰中,展現出顯著更高的準確度。

Skala 現已可在 CP2K 中使用,並正整合至 Psi4、FHI-aims、ORCA 和 VASP 等軟體,讓依賴這些程式碼的社群能更輕易地獲得新一代 DFT 準確度。

微軟研究院也推出一個「即時基準測試」,將追蹤 Skala 後續優化版本的計算效能,以協助社群衡量並加速在準確度和效率方面的進展。這些進展共同標誌著一個重要的里程碑,預示著未來計算化學模擬將同時具備預測性,並能整合到所有相關的科學與工業工作流程中。

將密度泛函理論(DFT)提升至預測性準確度是一段旅程,而非單一突破。自從推出我們的深度學習交換相關泛函 Skala 以來,我們持續在兩個互補的方面取得進展:提升準確度並擴大其在計算化學生態系中的可及性。

圖一顯示 Skala-1.1 在熱化學、動力學和非共價相互作用方面的準確度。以 meta-GGA 泛函的計算成本,Skala 1.1 表現優於最頂尖、最昂貴的全域混合泛函,在廣泛使用的 GMTKN55 基準測試的 55 個類別中,有 32 個類別排名第一。

在準確度方面,Skala-1.1 的發布首次展示了 Skala 持續改進的典範。相較於第一個公開版本,更新後的模型訓練數據增加了 2.5 倍,在分子模擬的關鍵挑戰中,包括主族熱化學、反應動力學和分子結構預測,都帶來了顯著的性能提升。

然而,僅有準確度是不夠的。DFT 是廣泛科學和工業工作流程背後的計算引擎,涵蓋化學、材料科學、催化、能源技術和藥物發現等領域。為了產生實際影響,先進的泛函必須在科學家已經進行計算的地方易於使用。這就是為什麼我們透過與領先的電子結構軟體開發商合作,擴展 Skala 生態系的原因。

今天,我們宣布 Skala 已在 CP2K 中可用,並正整合至 Psi4、FHI-aims、ORCA 和 VASP,讓依賴這些程式碼的社群能更輕易地獲得新一代 DFT 準確度。除了這些整合工作,我們還推出一個即時基準測試,追蹤 Skala 後續優化版本的計算效能。

透過為不同軟體套件和硬體平台上的實作提供透明且持續更新的參考,這項資源將有助於社群衡量並加速在準確度和效率方面的進展。這些進展共同標誌著另一個重要的里程碑,預示著未來計算化學模擬將同時具備預測性,並能在更廣泛的相關科學與工業工作流程中普及應用。

想了解更多關於 Skala 以及 DFT 在「in-silico 發現」(電腦模擬發現)中扮演的重要角色嗎?請閱讀我們的第一篇部落格文章。

Skala 作為一個持續改進的泛函,與傳統「泛函動物園」(新泛函不斷累積卻不取代舊泛函)不同,它遵循著不同的理念:每個版本都旨在取代前一個版本。隨著新數據、模型架構和訓練策略的出現,模型在保持相同實際計算成本的同時不斷改進。

Skala-1.1 是這種方法的最新展示。它在 GMTKN55(一個包含熱化學、反應勢壘和非共價相互作用等 55 個化學類別的廣泛使用基準套件)上,實現了 2.8 kcal/mol 的加權平均誤差。這種準確度水平超越了當今領先的全域(範圍分離)混合泛函,同時保持了半局域泛函的效率。除了能量,Skala-1.1 還能提供高度準確的電子密度、偶極矩和分子幾何結構。

這些進展得益於微軟研究院精確化學資料集(MSR-ACC)的大幅擴展,這是我們使用昂貴波函數方法生成的大規模高準確度量子化學參考數據集。針對 Skala-1.1,我們增加了新的類別,包括電子親和力和非共價簇,不僅增加了訓練數據的規模,更關鍵的是提升了其多樣性。這種數據驅動的方法使 Skala 能夠隨著每一代產品系統性地改進,讓我們更接近一個真正可擴展且具備預測性的 DFT 框架。

為了充分發揮 Skala 持續演進的 DFT 方法潛力,我們需要專用的基礎設施,使新版本能夠快速且無縫地整合到工業界和學術界科學家使用的主要軟體套件中。反過來,這將建立加速 Skala 持續開發所必需的快速回饋循環。

我們最初透過基於 (GPU4)PySCF 並與 ASE 整合的開源社群版本發布 Skala。這使得研究人員能夠以最少的努力評估和應用 Skala,同時受益於高度優化的 CPU 和 GPU 性能。

然而,沒有單一軟體套件能夠滿足所有應用或研究社群的需求。計算化學和材料科學依賴於豐富的電子結構程式碼生態系,每個程式碼都經過數十年發展,旨在解決特定的科學和工業挑戰。因此,將 Skala 引入這個更廣泛的生態系是過去一年的主要重點。

我們很幸運能夠建立在 DFT 社群所創造的卓越基礎之上,並感謝眾多研究人員和開發者,他們協助將 Skala 引入科學家日常使用的軟體平台。

透過與先進系統理解中心(CASUS)的 Thomas D. Kühne 教授團隊合作,Skala 已成功整合到開源軟體套件 CP2K 中。CP2K 經過超過 25 年的開發,是 DFT 模擬的強大工具,特別適用於大規模系統和長時間尺度的分子動力學,同時也提供豐富的高準確度電子結構方法。

Skala 擴展了 CP2K 內部的可能性,在保持大規模模擬所需計算效率的同時,實現了 DFT 準確度的顯著提升。我們很高興看到 CP2K 的規模和多功能性,結合 Skala 持續改進的準確度,將在未來幾年內促成新的科學應用和發現。

未來還有更多進展。我們正與其活躍的開發者社群合作,積極將 Skala 整合到開源軟體套件 Psi4 中,Psi4 是分子電子結構研究的重要平台。結合基於 PySCF 的 Skala 社群版,這將使 Skala 在三個廣泛使用的開源量子化學軟體套件中可用。

除了開源軟體,我們也正與 FHI-aims、ORCA 和 VASP 背後的領先開發者密切合作,目標是讓 Skala 在計算化學和材料科學中使用的主要軟體平台上廣泛普及。

驗證跨實作的準確度:以 CP2K 為案例研究。對於任何新的實作,徹底的測試都是必不可少的。我們希望確保 Skala 在不同的程式碼和計算設定中都能提供一致的準確度。我們與 CP2K 團隊合作,開發了一套全面的整合測試,以驗證 Skala 產生數值正確且可靠的結果。我們特別感謝 CASUS 團隊,他們在計算方法數值驗證方面的深厚專業知識,對於設計和驗證此測試框架至關重要。

圖二顯示了 GMTKN55 代表性子集的簽名誤差,相對於高準確度參考值,比較了 CP2K 和 PySCF 中 Skala-1.1 的實作,並盡可能使用匹配的數值設定。這兩種實作在整個子集中的平均絕對偏差(MAD)一致性在 0.1 kcal/mol 以內,只有一個異常值對應於一個特別具挑戰性的自由基系統。

關於 Skala 在 CP2K 中實作、驗證策略和測試基礎設施的詳細討論,請參閱我們與 CASUS 團隊的聯合論文:「透過 GauXC 在 CP2K 中實現機器學習的 Skala 交換相關泛函的分子實作」。

Skala 的即時性能報告。準確度和廣泛可用性只有在 Skala 也快速的情況下才能轉化為科學影響。如今,Skala 在 CPU(對於超過 20-30 個原子的分子,其額外開銷會消失)和 GPU 上都能提供與半局域 meta-GGA 相當的性能,我們致力於在將其整合到整個電子結構軟體生態系時,保持這種效率。

然而,性能並非固定不變的屬性。新的 Skala 版本、GauXC 等函式庫的改進以及硬體專屬優化,持續提升效率並揭示進一步提升的機會。捕捉這些進展需要的不僅僅是單一的基準測試快照。

為了提供 Skala 性能的透明且最新的視圖,我們正在發布一個基準測試工具,以及一份即時性能報告,該報告將隨著新的優化可用而更新。這份報告追蹤了跨各種任務和硬體平台的性能,而該工具則使套件開發人員能夠基準測試、驗證和改進他們自己的 Skala 實作。

圖三顯示了 Skala 在 GPU 和 CPU 上的計算成本,與流行的 metaGGA 泛函(r2SCAN)和兩種混合泛函(B3LYP 和 M06-2X)進行比較。在 GPU 上,Skala 1.1 的成本與 r2SCAN 相同,而對於超過約 1000 個軌道的系統,混合泛函變得更昂貴。

在 CPU 上,對於較小的系統,Skala 相對於其他泛函存在額外開銷,但對於超過約 300 個軌道的系統,此開銷會消失。

致謝。Skala 是「AI for Science」跨團隊合作的成果,我們感謝工程、專案管理和業務營運團隊使這項工作得以實現。我們也感謝 MSR Accelerator 在推進數據生成工作和加速軟體整合方面的合作,這些努力有助於將 Skala 帶給更廣泛的科學社群。