MindTopo 是一個新的 AI 拓撲推理基準測試,旨在評估多模態模型是否能理解連通性、包圍、順序、分離和打結等概念。

該基準測試同時衡量推理與規劃能力,不僅測試模型能否在靜態圖像中識別拓撲關係,也評估其能否透過一系列動作來保持和操作這些關係。

目前的多模態模型在靜態識別上的表現遠優於互動式任務,這表明它們難以隨著時間推移維持對拓撲的一致理解。

失敗通常發生在規劃階段而非感知階段,模型在場景變化時會失去對結構關係的追蹤,或提出違反物理限制的動作。這些發現突顯了推進機器人與互動式環境中 AI 系統的重要機會,因為在這些應用中,理解哪些物體保持連通、包圍、有序或打結對於可靠的決策至關重要。

AI 能否判斷在新增一道牆後,兩個房間是否仍保持連通?它能否識別動物是否在柵欄內,區分真結與纏繞的環,或在不讓繩索相互穿過的情況下重新排列多條繩索?

這些問題都與 3D 拓撲學有關,這是一種基於結構關係而非精確距離、角度或形狀的空間理解形式,這些關係在物體彎曲、拉伸或變形時仍能保持不變。連通性、包圍、順序和打結是拓撲性質的例子。這些性質是人類認知科學中空間理解的基礎層次,然而在多模態 AI 系統的評估中卻在很大程度上被忽視。

在一項新的研究中,我們推出了 MindTopo,這是一個旨在評估多模態大型語言模型是否具備這種拓撲直覺的基準測試。我們的發現揭示了在靜態圖像中識別拓撲與在規劃和行動時維持對該拓撲的內在理解之間存在巨大差距。目前的模型有時可以在單一場景中識別出連通路徑、包圍區域或打結,但一旦模型必須透過一系列動作來操作場景,這種理解往往就會崩潰。

大多數針對多模態模型的空間評估都聚焦於歐幾里得性質,例如距離、方向、大小和相對位置。受皮亞傑及其他認知文獻對拓撲能力分類的啟發,MindTopo 將其任務分為以下五個類別:

連續性:詢問路徑或物體是否保持完整不間斷。

分離性:詢問相鄰元素是形成一個結構還是獨立的部分。

順序性:追蹤元素沿著路徑或透過變換的排列方式。

包圍性:測試邊界是否創造了內部和外部。

打結性:測試繩索是真正打結或連結,而不僅僅是外觀上纏繞。

每個類別都在兩個認知層次上進行評估。在推理任務中,模型會檢查一個或多個渲染場景,並回答有關其拓撲結構的問題:例如迷宮中的兩點是否連通、羊是否在柵欄內、繩索是否真正打結。

在規劃任務中,模型與模擬環境互動並選擇必須創建、保持或移除特定關係的動作,例如旋轉管道段、繪製分離路徑、重新排列積木、困住移動的代理或解開繩索。環境會強制執行合法動作,因此模型無法透過讓一條繩索穿過另一條來解決繩索謎題。

所有場景都由受控模擬器生成,這提供了精確的真實值和可調整的難度。這種控制使得區分兩種看似相同但本質不同的失敗模式成為可能:一種是模型因場景視覺複雜而失敗,另一種是模型無法在物體移動時維持底層關係而失敗。

針對一系列專有模型和開源模型進行測試後發現,模型在靜態推理上的表現始終強於互動式規劃,且兩者都遠低於人類表現。當成功取決於透過多個動作保持關係時,這種對比尤其明顯。

錯誤模式有助於找出問題所在。靜態錯誤通常始於感知,例如錯過牆壁、開口或交叉點。規劃錯誤則在場景已被理解後出現。模型會遵循局部看似合理的動作,卻沒有追蹤其後續影響,或在多個回合中失去任務目標,或提出違反環境動態的動作。

我們也測試了圖像和影片生成是否能幫助模型維持對拓撲關係的理解。當相關關係在單一幀中可見時,圖像生成有時會有幫助,但在連續的交叉或移動序列中,它仍然不可靠。影片推演經常改變拓撲或違反任務動態。視覺模擬似乎只有在它能隨著時間保持結構約束的情況下才有用。

MindTopo 旨在作為彌補這一差距的受控診斷工具。機器人、輔助工具和互動式助理不僅必須理解物體的位置,還必須理解在動作展開時哪些物體保持連通、包圍、有序或打結。彌補這一差距可能需要模型具備明確的拓撲狀態,或者其世界模型(world models)的預測能透過建構來保持拓撲。