在 Build 2026 大會上,微軟發表了七款內部開發的全新 AI 模型,其中包括其首個推理模型。該公司還推出了一種新的微調方法和一個自主背景代理。核心產品是 MAI-Thinking-1,這是微軟的首個推理模型。根據微軟 AI 負責人 Mustafa Suleyman 表示,這是一個擁有 1 兆參數、350 億活躍參數和 128,000 token 上下文視窗的模型,專為多步驟指令、長上下文和程式碼生成而設計。

微軟表示,MAI-Thinking-1 在關鍵軟體工程基準測試中與領先模型表現相當,並在內部盲測中優於 Anthropic 的 Sonnet 4.6。Suleyman 指出,該模型是從頭開始使用乾淨資料訓練,沒有從第三方模型中進行知識蒸餾。

這顯然是對其他實驗室做法的暗諷。然而,從已發布的基準測試來看,該模型大致與 Deepseek V3.2 相當。涵蓋六個任務領域的模型家族除了推理模型,MAI 家族還包含另外六個系統。MAI-Code-1-Flash 是一個擁有 50 億參數的代理式程式碼模型,微軟表示其性能可與 Anthropic 的 Haiku 媲美,但運行成本更低。

它已整合到 GitHub Copilot 和 Visual Studio Code 中。MAI-Image-2.5 負責文字轉圖像和圖像編輯,在 Arena-Score 圖像基準測試中排名第二,僅次於 GPT-Image-2,並領先於 Google 的 Nano-Banana 模型。

MAI-Transcribe-1.5 被譽為最快的轉錄模型,支援 43 種語言。MAI-Voice-2 則能以 15 種語言生成語音,並能從短語音樣本中複製聲音。根據微軟表示,所有模型都共享相同的資料基礎、基礎設施和評估流程。它們透過 Azure Foundry 提供,開發人員首次可以自行微調模型的權重。

Frontier Tuning 展現成本效益微軟將這些模型與一種名為 Frontier Tuning 的新方法結合。客戶可以使用強化學習環境,讓模型直接與他們的工作流程對齊。微軟認為,最有價值的訓練資料是代理在組織內部留下的實際工作軌跡。在一項內部測試中,針對 Excel 進行微調的 MAI 模型,其性能與 GPT-5.4 相當,同時運行效率提高了十倍。

在 McKinsey,客製化的 MAI 模型在所有測試系統中取得了最高的勝率,成本同樣約為十分之一。Scout 是微軟首個常駐代理第三個支柱是微軟稱之為「自動駕駛儀」(Autopilots)的新型代理類別。這些是具有獨立身份、在背景自主運行的常駐代理。

第一個是 Microsoft Scout,它已整合到 Teams、Outlook、OneDrive 和 SharePoint 中。Scout 旨在協調跨時區會議、準備簡報資料、在您的行事曆上安排即將到來的交付項目,並在停滯的決策成為阻礙之前發出警示。

透過一個名為 Work IQ 的組件,該代理會建立您工作方式和優先順序的上下文記憶。每個代理都以其獨立的 Entra 身份運行,具有嚴格限定的存取權限,透過 Microsoft Execution Containers 進行沙盒化執行,並對敏感操作強制要求人工批准。

憑證也針對每個任務進行限定,並從日誌中清除。這是否足夠仍有待觀察。先前的代理系統在語言模型與外部資料結合的關鍵點上,一直未能成功。Scout 首先透過 Frontier 計畫作為實驗性版本發布。它需要 Intune 配置和 GitHub Copilot 授權。

硬體、作業系統和臨床模型完善策略這些軟體發布伴隨著更廣泛的 AI 策略中的其他幾個部分。透過 Project Solara,微軟正在預覽一個基於 Android 的作業系統,旨在跨設備運行代理,該系統由 Qualcomm 和 MediaTek 共同開發。

在 Build 大會舞台上,該公司展示了桌面集線器和數位徽章作為可能的產品形式。為了本地 AI 開發,微軟正在推出 Surface RTX Spark Dev Box,配備 Nvidia 的 Arm 架構 Spark RTX 晶片和 128 GB 統一記憶體。

定價和完整規格尚未公布。在醫療保健領域,微軟宣布與 Mayo Clinic 合作,共同開發一個臨床基礎模型。該模型將首先部署在 Mayo Clinic 自己的營運中,隨後透過 Azure Foundry 提供。Mayo Clinic 保留所有權。

微軟將其總體目標定義為「人本超級智慧」(Humanist Superintelligence),意指在人類控制下作為工具的 AI 系統。Suleyman 表示,該公司計畫在未來一年內迅速擴大運算能力和功能,部分將由微軟自家的 Maia 200 晶片提供支援。