在 Microsoft Build 2026 大會上,我們宣布推出 Foundry Managed Compute 以及 Foundry 上的 Hugging Face 模型。這是一個精選的 Hugging Face 生態系統開源模型目錄,每週更新,可一鍵部署到 Foundry Managed Compute。
模型權重預先儲存在 Azure 中,執行環境由 Microsoft 建置和掃描,且此集合中的每個模型都享有與 Foundry 上其他模型相同的企業級安全性、治理、可觀察性和計費標準。
Microsoft Foundry 是一個用於建構和操作代理式 AI 應用程式的平台。Foundry 擁有所有雲端中最廣泛的模型選擇,包括來自 Microsoft、OpenAI、Anthropic、Meta、Mistral、DeepSeek、Hugging Face 等的模型,涵蓋前沿模型、開源模型和自訂權重模型,所有這些都可以透過單一端點和一套 Python、C#、JavaScript 和 Java 的 SDK 進行存取。
在這些模型之上是 Foundry Agent Service:它提供多代理協調功能,內建記憶體、透過 Foundry IQ 進行知識基礎建立,以及透過代理協定連接的工具目錄,讓代理能夠處理企業資料。一旦代理開始運行,Foundry 會提供端到端追蹤、即時監控、持續評估,以及一個根據評估結果改進代理行為的提示詞優化器,這些可觀察性和品質循環都是平台的一部分。
除此之外,開發者還可以存取:內容安全篩選器、任務遵循防護機制、用於對抗性測試的 AI 紅隊代理、統一的 RBAC、私有網路,以及直接整合在平台內的 Azure Policy。
除了按使用量計費(最容易入門的方式)和預留吞吐量(用於前沿模型的可預測、高效能生產工作負載)之外,Foundry Managed Compute 是 Foundry 中的第三種部署選項:一個針對開源和自訂模型的託管 GPU 平台即服務。
您可以部署一個由工作負載關鍵因素(例如參數數量、上下文長度,以及您希望優化延遲還是吞吐量)所定義的模型實例。Foundry 會處理底層的 GPU 拓撲,無論實例是部署在單一加速器還是多個加速器上,讓您能夠以模型的角度進行思考和規劃。
Microsoft 負責機器維護:容器更新、執行環境升級和安全修補程式會在支援的執行環境(vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp)上自動進行,無需重新部署您的模型,而模型配置、部署行為和路由則由您掌控。
這種一致性貫穿整個開發者介面,按使用量計費、預留吞吐量和 Managed Compute 共享:單一端點、相同的 SDK、相同的身份驗證、相同的可觀察性,以及單一帳單。
開源模型與 Foundry Agents 的整合方式與前沿模型相同,因此您可以在單一代理中混合使用不同類型的模型,而無需額外的整合路徑。
Managed Compute 提供:全球部署,具備最廣泛的容量和最佳定價;以及資料區域部署,確保資料駐留和主權。
相同的程式碼,相同的工作流程。配額與加速器系列對齊,因此今天基於 H100 系列建立的計畫,在新的硬體世代推出時仍可繼續使用。
Hugging Face 是開放 AI 的公共廣場:擁有 1500 萬開發者、40 萬個組織,並發布了超過 300 萬個開源模型,每週都有新的前沿功能(如代理式編碼、影片分割、語音、嵌入)推出。它是開源模型的 GitHub,社群在此發布模型權重、撰寫模型卡片、比較評估結果,並下載模型進行實驗。
開源模型在各項基準測試中已與專有模型縮小差距,並解鎖了專有端點無法實現的功能:最先進的技術現已開源。領先的開源權重模型在最廣泛使用的基準測試中,與頂級的閉源前沿模型具有競爭力。深度客製化。完整的模型權重使得微調、蒸餾、量化以及使用 LoRA 進行調整成為可能,從而根據您的領域、資料以及延遲和成本目標來客製化模型。
您的模型,您的託管。模型權重在您控制的基礎設施上、在您的租戶中運行,位於您的推論端點之後,並受您的身份和網路邊界保護。成本塑形。按小時支付加速器費用,閒置時縮放至零,並為特定模型選擇合適大小的 GPU,這對於穩定、高流量或對延遲敏感的工作負載非常有用,因為在這些情況下,按 token 計費的價格較難預測。
版本控制。您可以鎖定特定模型版本、進行評估、部署,並按照自己的發布節奏進行推進或回溯。
挑戰始終在於營運層面:模型發現、授權審查、安全篩選、執行環境選擇、GPU 大小調整、映像建置、CVE 修補,以及在企業級端點後方建立模型。Hugging Face 本身並非企業級服務平台。Foundry 上的 Hugging Face 模型正是由 Microsoft 運營的那個營運層面。
Hugging Face Collection 將精選的模型子集直接引入 Foundry 模型目錄:每週更新,Hugging Face 生態系統中的熱門模型會隨著社群發布而持續新增。支援所有模態,包括文字、視覺、音訊和多模態:用於聊天和代理的 LLM 和 VLM、ASR 和語音翻譯、嵌入、分割、圖像生成。
僅限 Safetensors,無不受信任程式碼,此集合中的每個模型都經過安全篩選,並以 SafeTensors 權重格式發布,除非經過嚴格審查,否則不包含 trust_remote_code 執行路徑。為模型選擇正確的執行環境,例如用於 LLM 的 vLLM 和 SGLang,適用時使用 TensorRT-LLM 和 NIM,用於嵌入的 TEI,以及用於 CPU 的 llama.cpp,Foundry 會選擇與模型匹配的引擎。
從您的角度來看,Hugging Face Collection 中的開源權重模型在 Foundry 模型目錄中看起來和行為都與其他模型相同,而且此集合中的每個模型在發布之前都經過了多階段的發布流程。
Hugging Face 和 Microsoft 合作,透過系統化的策展流程,將 Hugging Face 生態系統中最受歡迎的開源權重模型引入 Microsoft Foundry,使其達到企業環境的生產就緒狀態。這個流程包括:根據社群訊號、合作夥伴請求和客戶需求,識別 Hugging Face 生態系統中的熱門模型,並選擇適合企業使用的候選模型。
篩選合規性和安全性,審查模型授權是否符合 Microsoft 的企業分發政策(授權中繼資料會被擷取並保留在目錄模型卡片上),並檢查儲存庫是否存在 trust_remote_code 模式和自訂可執行程式碼;任何需要在載入時執行第三方 Python 的模型都會被修復或排除。
建置、掃描和發布執行環境,Microsoft 會在支援的執行環境(vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp)上建置推論容器映像,掃描 CVE 漏洞,然後簽署並發布到由 Microsoft 管理的容器註冊表。
將權重上傳到安全的 Azure 儲存體,模型權重會從 Hugging Face 拉取一次,根據已發布的模型卡片進行驗證,然後儲存在 Microsoft 管理的 Azure 儲存體中,位於模型提供服務的區域。驗證並發布到目錄,每個模型、執行環境和加速器的組合都會進行 API 一致性(聊天完成、嵌入、重新排名等)和性能(延遲、吞吐量、首個 token 時間、token 間解碼時間)測試,然後將經過驗證的模型(包含其模板、執行環境映像和權重)發布到 Foundry 模型目錄,提供一鍵部署到 Managed Compute 的路徑。
由於模型權重預先儲存在 Azure 儲存體中,且執行環境映像位於 Microsoft 管理的註冊表中,您的部署將不需要對 Hugging Face Hub 進行出站網路存取,您可以在私有網路內部署到生產環境。
Foundry 上的 Hugging Face 模型由一系列多功能的社群建置開源推論執行環境提供支援,每個執行環境都經過選擇和調整以適用於 Foundry Managed Compute,並與其最適合服務的模型架構匹配。在所有執行環境中,系統化的策展流程意味著新版本和修補程式能迅速在 Foundry 上線,並且現有的模型部署會自動升級,無需您重新部署。
vLLM 是開源大型語言模型的預設高吞吐量服務引擎,專為生產級 GPU 工作負載進行調整。由於 Hugging Face 是 vLLM 的直接貢獻者,Transformers 函式庫中的任何模型都可以直接在 vLLM 上運行,因此當新模型在 Hugging Face 上線時,它可以在同一天在 Foundry 上提供服務,無需等待自訂整合。
SGLang 是一個用於語言和多模態模型的服務引擎,強力支援代理式和工具使用工作負載所需的結構化輸出(JSON、正規表達式、語法約束生成)。Hugging Face 和 SGLang 團隊已經為 SGLang 建置了 Transformers 後端整合,因此 Transformers 函式庫中的任何模型都可以直接在 SGLang 上運行,並在 Hugging Face 上線的同一天到達 Foundry。
Text Embeddings Inference (TEI) 是用於嵌入、重新排名和序列分類模型的執行環境。加速器專用映像隨附為 Foundry 支援的每個 GPU 和 CPU 系列編譯的核心,使 RAG 和語義搜尋工作負載的嵌入熱路徑保持精簡。
llama.cpp 是用於 GGUF 量化模型的 CPU 和小型 GPU 路徑。它適用於成本優化部署、較小型模型和僅限 CPU 的區域,並提供與 vLLM 和 SGLang 相同的 OpenAI 相容 API。
TensorRT-LLM 和 NIM 用於 NVIDIA 硬體,在這些硬體上,NVIDIA 優化的核心和基於 Triton 的服務為特定模型系列提供了顯著更好的延遲或吞吐量。
hf-serve 是 Hugging Face 自己的多模型推論伺服器,用於 LLM 和嵌入快速路徑之外的模型架構(視覺、音訊、分割以及其他 Transformers 原生管線),因此此集合可以透過一致的服務層涵蓋所有模態。
Foundry 模型目錄中的 Hugging Face Collection 是您的起點,部署分為五個步驟:瀏覽目錄並選擇一個模型,部署精靈也會顯示您透過 SDK 或 REST 編寫部署腳本時所需的模型 ID、部署模板 ID 和 acceleratorType。
選擇部署模板,例如優化延遲或吞吐量、加速器系列、上下文長度、量化。配置實例數量,透過增加模型實例來擴展吞吐量。部署,可透過入口網站、CLI、SDK 或 REST 進行。透過統一的 Foundry 端點和您已使用的 SDK 進行評分。
部署模板是步驟 2 中的選擇單位:它是一個命名且帶有版本的資產,用於固定執行環境、加速器系列和數量、上下文長度,以及為良好服務模型所需的執行環境特定調整,因此選擇模板是您決定「我希望這個模型如何運行」的唯一控制項。
例如,qwen3-32b 隨附四個部署精靈並排顯示的模板:
每個模板都已針對模型進行預先調整,包括執行環境設定、工具呼叫和推理解析器、評分路徑、健康探測、請求並發性,以及任何模型特定的上下文擴展設定,所有這些都由 Microsoft 設定,任何權衡取捨都會在模板描述中明確指出。當您編寫部署腳本時,您只需引用該模板。



