Moonshot AI 的 PerceptionBench 基準測試旨在評估多模態 AI 模型實際「看」的能力,並將其與邏輯推理能力區分開來。沒有任何頂尖模型能達到 60% 的準確度,其中 GPT-5.6 Sol 以微弱優勢領先。許多被認為是推理錯誤的問題,實際上早在圖像讀取階段就已發生。

中國 AI 助理 Kimi 背後的團隊 Moonshot AI 推出了 PerceptionBench,這是一個專門隔離並測試多模態語言模型視覺感知能力的基準。與標準測試方法不同,PerceptionBench 將視覺能力分解為十個獨立的子技能,而非將感知、知識和推理混為一談。每個問題僅需透過觀察圖像即可回答,無需任何推理或外部知識。

作者們解釋他們的方法時指出,現有的基準測試各自只捕捉到一小部分的感知錯誤。他們分析的 42 個開源基準測試在錯誤類型上重疊甚少,每個都涵蓋了不同的視覺弱點子集。因此,沒有單一或少數幾個測試足以全面捕捉視覺感知能力。

作者們沒有預先定義類別,而是根據實際的模型錯誤建立其分類法,並將每個錯誤追溯到現有基準測試中最早的失敗步驟。最終形成了十個「技能領域」:視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、光學字元辨識 (OCR) 和幻覺。

Moonshot AI 從內部超過 17,000 個已驗證的問題庫中,發布了 3,000 個任務。其中 60% 源自歸因於模型錯誤的問題,而 40% 則透過增強圖像重新制定。這些任務表面上看似微不足道,例如判斷符號在鐘面上的位置、計算紅色盒子裡的鮮花數量,或是分辨兩個鉛筆杯中,哪個是灰粉組合,哪個是帶卡通圖案的純粉色。

在測試的 16 個頂尖模型中,GPT-5.6 Sol 以 59.7% 的總體準確度位居榜首。Kimi K3 以 58.5% 緊隨其後,Claude Fable 5 為 57.2%,Gemini 3.1 Pro 為 56.2%。GPT-5.5 的得分為 55.8%。而 Qwen3.5-397B-A17B (47.5%) 和 GLM-4.6V (32.5%) 等開源模型則遠遠落後。

沒有任何模型突破 60% 的大關,且前五名系統之間的差距僅不到四個百分點。這顯示了當前頂尖多模態模型在視覺感知能力上的普遍瓶頸。

與總體排名相比,類別層次的結果更具啟發性。總分幾乎相同的模型在個別類別中表現出顯著差異。平均而言,「幻覺」是所有模型中最弱的技能。

儘管 GPT-5.6 Sol 總體排名第一,但在幻覺測試中僅得 26.9%,而表現較弱的 Gemini 3.5 Flash 卻以 50.6% 位居前茅。這項子測試旨在檢查模型是否在正確答案為「零」時,憑空捏造不存在的物體。

作者們認為,許多通常歸因於「推理錯誤」的多模態模型失敗,實際上發生在感知層面。當模型在多步驟任務中出錯時,第一步,正確讀取圖像,往往已經出問題了。

PerceptionBench 將這些問題分解為僅限感知的子問題,從而能夠精確找出是哪種特定的視覺能力出現了故障。該資料集和評估程式碼已在 GitHub 上公開,網址為 MoonshotAI/PerceptionBench。

Moonshot AI 開發了開源的 Kimi K3,該模型在通用基準測試上已將與 Claude Fable 5 和 GPT-5.6 Sol 的差距縮小到幾個百分點之內。然而,K3 在進攻性網路安全和複雜數學等專業領域仍遠遠落後。但在視覺感知方面,K3 現在與其西方競爭對手表現相當。

同一研究團隊此前已發布 WorldVQA,這是一個將物體識別與推理分開的基準測試。其中表現最好的模型 Gemini 3 Pro 僅達到 47.4%,未能突破 50%,且所有模型都系統性地高估了自己的信心。

由中國機構參與、Moonshot AI 協同進行的另一項研究,利用 BabyVision 基準測試表明,頂尖模型在與幼兒發展相關的基本視覺任務上表現不佳,例如描繪線條或數隱藏的積木。Gemini 3 Pro 在這些任務中得分為 49.7%,而人類則達到 94.1%。研究人員將這種差距歸因於「語言化瓶頸」,即視覺資訊在轉化為語言時會損失其精確度。