去年三月,我們發布了最先進的電腦使用模型 Holo3,並立即獲得廣泛採用。開發者、企業和合作夥伴開始將 Holo3 部署到各種工作流程中,從瀏覽器自動化、商業軟體到內部工具和桌面應用程式。隨著採用率的增長,我們意識到單純的效能已不足夠。使用者希望在桌面和行動環境中運行相同的電腦使用功能,並與不同的代理框架無縫整合。

他們需要部署的靈活性,從雲端推論到終端使用者裝置上的完全本地執行。這就是我們發布 Holo3.1 系列的原因。Holo3.1 提升了在生產環境中最重要的三個維度的穩健性:環境(網頁、桌面、行動)、代理框架和部署目標。我們首次發布了針對本地推論最佳化的量化檢查點,包括 FP8、Q4 GGUF 和 NVFP4。

Holo3.1 是我們邁向通用型電腦使用代理願景的重要一步:這些系統能夠跨環境運作,整合到任何代理堆疊中,並在工作流程所在的任何地方運行。電腦使用跨 GUI 環境與代理框架Holo3.1 基於 Qwen 系列模型開發,旨在提升電腦使用代理模型在實際部署環境中的穩健性,同時保持最先進的效能。

當團隊將 Holo3 從評估階段轉移到生產環境時,我們一再觀察到相同的挑戰:在某種設定下表現優異的效能,不一定能轉移到另一種設定。行動裝置、替代代理框架和不同的執行框架都會引入各自的分布偏移來源。行動自動化Holo3.1 將 Holo3 的能力從瀏覽器和桌面控制擴展到行動環境,在行動環境中取得了重大進展。

在 AndroidWorld 基準測試中,我們的 35B-A3B 模型從 67% 提升到 79.3%,而較小的 4B 和 9B 版本則從 58% 提升到 72%。跨框架效能為了更好地支援團隊在第三方代理堆疊中部署 Holo,Holo3.1 除了 Holo3 中已有的結構化 JSON 輸出外,還引入了對函式呼叫協定的原生支援。

在 OSWorld 和我們涵蓋電子商務、商業軟體和協作工作流程的內部基準測試套件中,函式呼叫和原生執行現在實現了近乎相同的效能。在我們的 Holotab 產品框架中評估時,Holo3.1 也比 Holo3 提升了超過 25%。更小的尺寸以實現成本與效能的權衡為了進一步實現本地和裝置端推論,我們還發布了新的模型尺寸,包括用於成本效益和私密部署的小型模型(0.8B、4B 和 9B),以及用於最先進效能的較大型 35B-A3B 模型。

快速與本地推論這是我們首次發布帶有量化權重的版本。我們從 35B-A3B 檢查點開始,提供 FP8、Q4 GGUF 和 NVFP4 格式。對於 NVFP4,我們在 W4A16 配置中使用了 NVIDIA 的 Model Optimizer。

這些檢查點能讓電腦使用代理模型實現快速本地推論,且模型效能幾乎沒有下降。FP8 和 NVFP4 取得了相同的 OSWorld 分數,僅比全精度 BF16 檢查點低約兩點。速度提升顯著:在 DGX Spark 上,NVFP4 W4A16 的總 token 吞吐量是 FP8 的 1.41 倍,是 BF16 的 1.74 倍。

邁向消費級硬體上的本地代理我們也發布了 Q4 GGUF 檢查點,旨在將電腦使用代理模型本地部署到消費級硬體上。代理本身在 Windows 或 Mac 機器上本地運行,而模型可以在同一台機器上運行(我們提供了 Apple Silicon 的參考數據),也可以在同一網路上的 DGX Spark 上運行。

在這兩種情況下,執行都保持完全私密和本地化,沒有任何資料離開使用者的網路。在 Spark 上,我們與 NVIDIA 共同開發的代理框架最佳化結合上述 NVFP4 量化,相較於 FP8 基線,實現了約 2 倍的端到端複合加速,將平均步驟時間從 6.8 秒縮短到 3.3 秒。

可用性Holo3.1 系列提供四種尺寸:模型 / 部署目標Holo3.1-0.8B / 超輕量級本地代理Holo3.1-4B / 具成本效益的部署Holo3.1-9B / 效能與延遲平衡Holo3.1-35B-A3B / 最先進的效能我們也發布了最佳化的 FP8、NVFP4 和 Q4 GGUF 檢查點,用於本地和邊緣部署。

開始使用Holo 模型 API:https://hcompany.ai/holo-models-apiHugging Face:https://huggingface.co/collections/Hcompany/holo31我們期待看到開發者們利用 Holo3.1 創造出什麼。