當你第一次遇到這種情況時,你可能會覺得自己瘋了。你走進一家咖啡館,看著菜單上各式各樣的貝果三明治,但每張插圖都詭異地完美無瑕、精確對稱且異常光滑,引發一種本能的感覺,覺得有些不對勁。
你可能會認為自己多疑,但你並沒有失去理智。生成式 AI 菜單已經進入餐飲業,這些模型是透過狹隘的「討喜」美學進行訓練,產生一種即使你說不出原因,也感覺不對勁的視覺效果。
有時,這些插圖會離譜地虛假,例如一個墨西哥捲餅上的起司冒著泡、融化著,看起來更像前衛藝術而非午餐。更多時候,它們看起來非常普通,你只有在仔細看第二眼時才會注意到不對勁的地方。
「這幾乎就像一個外星人試圖做披薩,卻不理解其核心原理。」Reality Defender 的技術長 Alex Lisle 告訴 TechCrunch。Reality Defender 本身就是一個不斷成長的新創公司類別,專門銷售 AI 偵測和內容驗證工具,這項業務的存在部分原因就是因為這類問題。
Lisle 表示,這些模型的建構方式有助於解釋為何插圖似乎都採用了如此特定的美學風格,例如每個冰淇淋球都完美圓潤,蝦子看起來像是經過基因改造,會吃自己的尾巴,創造出新的「洛夫克拉夫特式食物恐怖」。
大型語言模型(LLM)和擴散模型(Diffusion models),這些讓 ChatGPT 和 Midjourney 等看似無所不知的聊天機器人和圖像生成器成為可能的 AI 模型,都是透過大量資料進行訓練。然後,模型會識別資料集中的模式,以預測使用者在提出「為我製作一份漢堡餐廳菜單」之類的要求時,正在尋找什麼。
「很多這類東西看起來都像 2015 年 Chili's 的菜單,這是有原因的。」Lisle 說。「那是這些模型從中汲取功能的資料庫。」
新的訓練資料對於建構 AI 模型的公司來說是無價的,甚至發現 Amazon 會採購稀有書籍進行掃描並添加到其訓練資料中,然後在上傳後銷毀這些書籍。不可避免地,一些 AI 生成的內容會滲入這些難以理解的龐大資料集。但當 AI 模型過度訓練自己的 AI 生成內容時,它們就有模型崩潰的風險。
「模型崩潰幾乎就像狂牛症……當你將一個模型的輸出回饋給它自己時,最終近親繁殖會變得過度,整個系統就會崩潰。」Lisle 解釋道。「我們在這裡看到的是收斂(convergence),這不一定是模型崩潰。」
收斂的極端程度較低,它會降低 AI 輸出的品質,但不會使其完全無用。
如果有人要求 AI 模型為一家速食餐廳生成菜單,該模型很可能會參考 Wendy's、Burger King、McDonald's 或其他受歡迎連鎖店的菜單。這些菜單本身就共享相似的風格,這意味著 AI 生成的輸出將模仿相同的風格,如果 AI 生成的菜單最終又回到訓練資料中,則會進一步強化這種風格。
但食物的菜單和廣告總是會比實物看起來更好,就像 McDonald's 廣告中的大麥克,每一層三明治都由道具設計師精心擺放,使其看起來極致開胃。這種效果在 AI 輸出中可能會更加顯著。
「資料集的最佳化是為了討喜,或者說,不冒犯人,因此這會導致同質化。」Elon 大學數位未來想像中心主任 Lee Rainie 告訴 TechCrunch。「AI 在圖像和語言方面眾所周知的作用是磨平稜角。」
在更局部的範圍內,這種圖像的平滑化似乎發生在你使用 AI 圖像生成器創建菜單並對其進行編輯時。在 X 上,一位名為 Labtec 的使用者展示了當你在 ChatGPT 中製作菜單,然後編輯 100 次,觀察食物如何變得越來越不像它應有的樣子。(我們重複了這個實驗,發現了類似的結果。)
Labtec 寫道:「最終結果實際上讓我感到不舒服。」
餐廳很可能也成為這個問題的受害者,他們反覆修改 AI 生成的菜單,以更改價格或商品名稱等小細節。似乎每次編輯,食物圖片都會變得更加圓潤光滑一點。
「人們對於何時看到的是 AI 生成的內容,與最初是真實的內容,有一種幾乎難以解釋的感覺。」Rainie 說。「人們有時很難清楚表達這種感知,但他們看到時就知道了,我認為這就是為什麼一些關於(餐廳使用 AI 菜單)反彈的早期報導如此明顯的原因之一。」
我們對這些 AI 菜單的厭惡背後有科學依據。德國杜伊斯堡-埃森大學的研究人員發現,AI 生成的食物圖片表現出「恐怖谷」效應,其中看起來幾乎真實的食物圖片比明顯是假的圖片引起更多的厭惡和不安。這種不適感在 AI 的文化背景下只會加劇。
如果人們對這些圖片反應如此負面,那麼這可能足以讓餐廳停止嘗試讓 AI 菜單發揮作用。但導致我們看到完美烤焦漢堡麵包的問題,其影響範圍遠不止餐桌。
「眼見為憑、耳聽為憑一直以來都是如此,甚至我們的法院系統也完全依賴於錄音口供和錄影證據作為證據的黃金標準。」Lisle 說。「現在情況已經不再是這樣了。無論好壞,世界已經發生了根本性的轉變。」



