益智遊戲和謎題能揭示模型智慧的不足之處。來試試這七項測驗,看看你是否能智勝 AI。

從一開始,益智遊戲和謎題就是 AI 發展的核心。就像人類喜歡用填字遊戲或邏輯謎題來測試智力一樣,開發者也能透過一系列遊戲來檢視模型的進展程度。IBM 電腦科學家 Arthur Samuel 在 1959 年的一篇文章中,介紹了一種能學習玩西洋棋的演算法,從此「機器學習」一詞廣為人知。西洋棋和中國圍棋也都是著名的 AI 測試平台。

單純從解謎能力來看,AI 正在快速且大幅地進步。哥倫比亞大學的科學家團隊在 2024 年底發現,即使是最好的模型也只能解開 18% 惡名昭彰的《紐約時報》Connections 謎題;然而到了 2025 年初,有些模型幾乎每次都能完美解答。

不過,謎題不僅僅是突顯 AI 能力不可阻擋的進步。觀察模型在哪裡成功、在哪裡失敗,以及人類在哪裡仍能勝過它們,能為我們提供一個了解這項技術優缺點的有用視窗。儘管有所進步,現今的模型仍會出錯:經典謎題中細微的變化常常讓它們卡關,而視覺謎題更是它們的特別弱點。

在這裡,你將有機會挑戰那些曾讓模型卡關的謎題。有些對你來說可能和對 AI 一樣棘手;有些則簡單到讓你懷疑 AI 是否真的有智慧。每個謎題都至少突顯了機器與人類認知能力的不同之處。如果你能順利通過測驗,就證明了你能夠智勝 AI,至少目前是如此。

讓我們從人類擁有巨大優勢的領域開始:空間推理。如果你曾參加過智力測驗,可能做過心智旋轉問題。這些謎題要求你判斷不同的圖像是否代表從不同角度看到的相同物體。儘管現今的語言模型通常具備分析視覺輸入的能力,但它們在這些謎題上仍然表現得非常糟糕。儘管人們談論世界模型如何幫助 AI 理解物理環境,但大型語言模型(LLM)似乎仍無法像建築師和機械工程師等空間思考者那樣操作 3D 物體。

心智旋轉 指示:選擇顯示提示中物體但從不同角度呈現的答案。每個問題都只有一個正確答案!

頂尖的 LLM 擁有非凡的記憶力;它們在訓練期間接觸了海量的資訊,並能忠實地複述其中許多內容。這對於在知識問答中勝過人類是一項優勢,但也可能成為一種負擔。當一個謎題與模型在訓練期間見過的某個謎題非常相似時,模型可能會忽略關鍵差異,並以其記憶中的內容來回應。

Google 和伊利諾大學厄巴納-香檳分校的研究人員在 2024 年的一項研究中證實了這一點,他們針對經典的「騎士與騙子」謎題的微小變體來訓練和測試模型。在這些問題中,有些角色總是說實話,有些則總是說謊,你必須找出誰是誰。同樣的原理也可能適用於名為 SimpleBench 的測試。

這些問題類似於模型在訓練中可能遇到的更複雜問題。人類能識破其中的技巧,但即使是頂級模型也會因此卡關。

騎士與騙子 指示:解決這些謎題唯一需要知道的是,騎士總是說實話,騙子總是說謊。根據每個角色所說的話來判斷他們是騎士還是騙子。

SimpleBench 指示:仔細閱讀這些 SimpleBench 問題,你應該能很快找出答案。

AI 不僅在 3D 視覺問題上表現不佳,2D 問題也同樣會讓它卡關。這是模型在最著名的基於謎題的基準測試 ARC-AGI 中表現如何的一個主要因素。這些問題要求你從一組範例中推斷出抽象的通用規則。當模型接收每個網格不是作為圖像,而是作為編碼每個單元格顏色的數字字串時,它們在 ARC 謎題上的表現會更好。

研究表明,即使模型正確回答了 ARC-AGI 問題,它們也常常是使用複雜且不可推廣的規則來完成,而人類則是依賴簡單的視覺概念。儘管存在這些劣勢,模型在過去一年中在 ARC-AGI 方面取得了相當大的進步,但有些謎題,例如這裡展示的,仍然讓它們束手無策。

ARC-AGI 指示:研究下方顯示的三對網格,找出左側網格如何轉換為右側網格的規則。然後拿出你的麥克筆或色鉛筆,使用該規則填寫第四個網格。(無論網格如何定向,解決方案都是相同的。)

不僅僅是 AI 模型會掉入陷阱。我們人類也有自己的認知弱點,其中許多是 AI 所沒有的。心理學家設計了一系列問題,這些問題顛覆了 SimpleBench 的現象:對於這些問題,人類往往會給出直覺反應的答案,而模型則會深思熟慮地回應。有些問題利用了我們直覺計算時的錯誤;有些則以暗示明顯答案的方式措辭,但如果仔細閱讀問題,這些答案就會站不住腳。

閃電戰 指示:盡可能快地回答以下問題。

在某些情況下,LLM 能否完成謎題取決於規模。Apple 的研究人員發現,LLM 可以輕鬆解決簡單版本的河內塔問題(涉及一次移動一個圓盤,且不能將較大的圓盤放在較小的圓盤之上),以及渡河謎題(一群人必須根據特定規則渡河)。但這只在一定程度上成立:當圓盤或人數達到六個或更多時,模型便開始出錯。

在另一項研究中,華盛頓大學、史丹佛大學和 Allen Institute for AI 的研究人員觀察到,LLM 在邏輯網格謎題上也同樣掙扎,這類謎題需要從一系列線索中推斷出一組個體的屬性。Apple 的論文廣為流傳,但評論員質疑這些結果是否揭示了 LLM 推理的獨特限制,或者僅僅是隨著複雜性增加而犯錯是正常的現象。

渡河 指示:根據提供的場景,規劃將所有人渡過河所需的行程。

邏輯網格 指示:使用線索列表,判斷誰住在每棟房子裡,以及每個人喜歡什麼風格的音樂。只有一個可能的解決方案。你可能會發現填寫下方的網格有助於追蹤你的推論。