Holo4 是我們新推出的代理模型系列,提供兩種尺寸:27B 密集型和 35B-A3B 專家混合模型。這兩款模型皆可透過 H Models API 取得。我們同時也發布了 Holotron 3 的更新版本:Holotron4 Nano。

Holo4 建立在我們前一代模型的基礎上,能透過任何可用的介面與軟體互動,包括圖形使用者介面(GUI)、程式碼、MCP 和 API。儘管它在學術基準測試中表現出色,但我們開發它的主要目的是為了實際的商業工作流程。Holo4 透過監督式學習和強化學習,在大量環境和任務中進行訓練,其中也包含由我們的「代理任務工廠」(Agentic Task Factory)所生成的任務。

Holo4 能夠在螢幕上點擊和輸入,編寫並執行自己的程式碼,以及呼叫 MCP 或 API 工具。它會根據任務需求選擇最適合的介面。大多數代理模型僅針對單一介面進行訓練:專注於 GUI 的模型在沒有螢幕時會束手無策,而偏好工具呼叫的模型則會受限於沒有 API 的應用程式。然而,實際工作並非如此孤立,單一商業任務可能需要結合這些不同的方法。

Holo4 可以在桌上型電腦、網頁、Android、程式碼沙盒以及商業 API 環境中運行。在每種情況下,它都是相同的模型,並且以相同的方式被呼叫。您無需為每個平台選擇不同的模型。

Holo4 模型相較於其基礎模型 Qwen 有顯著的改進。在處理長流程任務時,Holo4 僅次於最強大的閉源模型:在 OSWorld 2.0 基準測試中,Holo4 27B 獲得 61.7% 的分數,而 Opus 5.5 為 81.8%;Holo4 35B-A3B 則達到 30.9%。

然而,Holo4 在參數數量上少了數個數量級,且成本也低得多。我們公開了所有公開基準測試分數背後的運行軌跡:您可以在 trajectories.hcompany.ai 重播每個步驟,或從 Hugging Face 下載它們。

在桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)最困難的學術基準測試中,Holo4 能以遠低於前沿模型的任務成本與之競爭。

Holo4 模型在我們的「代理任務工廠」所生成的環境和任務中進行訓練,因此在專業軟體應用上表現出色。以下範例展示了 Holo4 27B 與其基礎模型 Qwen3.8 27B 的比較,兩者使用相同的提示詞和測試框架。

3D 建模 · 艾菲爾鐵塔

在 FreeCAD 中建立艾菲爾鐵塔的 3D 模型,比例為 1 毫米對應 1 公尺,以原點為中心並對齊 X 軸和 Y 軸。依照此設計進行。

3D 建模 · H 公司標誌

在 FreeCAD 中建立 H 公司標誌的 3D 模型:一個實心圓盤旁邊是一個塊狀的無襯線大寫字母 H,兩者擠出相同的厚度,形狀高度相似且分開不重疊,圓盤中心與 H 的中間對齊。將兩個形狀都塗成黑色。

遊戲設計 · 小精靈(Pac-Man)

在 Godot 中建立一個小精靈(Pac-Man)風格的遊戲並讓它運行。

我們的內部代理管道集,僅從文件(例如真實網站或開源軟體的截圖)就能建立互動式環境和可驗證的任務。迄今為止,它已在網路應用程式、MCP 伺服器和桌面環境中產生了大約 10,000 個任務,其中包括透過 GUI 和 MCP 暴露相同狀態的混合環境。

在訓練的同時,我們也重建了測試框架(harness),這是一個執行模型動作並在數百個步驟中管理其上下文的循環。我們利用 OSWorld 2.0 上代理性能的回饋來改進它。代理會標記每個任務失敗的原因,工程師則會審查並修正。最大的改變是賦予代理可靠的記憶功能,使其能夠追蹤數百個步驟,並在桌面機器本身提供一個 shell。

我們的後訓練堆疊旨在適應新的基礎模型,並產生能夠跨介面和環境泛化的代理。作為 NVIDIA Nemotron 聯盟的成員,我們將最新的堆疊應用於 Nemotron 3 Nano Omni 模型,作為 Holotron 3 的後續產品。同樣的配方將 Nemotron 3 Nano Omni 轉變為 Holotron4 Nano,這是一個通用型代理模型,在 GUI 工作流程以及暴露 MCP、API 或程式碼沙盒的環境中,相較於基礎模型有顯著改進。

這些改進是相對於 Nemotron 3 Nano Omni 的絕對百分點提升。這些成果表明我們的配方具有良好的可轉移性,能將通用模型轉變為代理專家,且與模型尺寸無關。

這兩種尺寸的模型今天都已在 H Models API 上線。模型權重(weights)可在 Hugging Face 上取得,格式包括 BF16、FP8、NVFP4 和 4 位元 GGUF,與我們的小型模型 Holotron4 Nano 並列。我們將在未來幾天內發布優化的 DSpark drafter 檢查點,以進一步加速推論。