讓我們從一個小遊戲開始。打開你常用的聊天機器人,例如Claude、ChatGPT或Gemini,然後輸入「給我一個1到10之間的隨機數字」。你幾乎每次都會得到7。接著輸入「再來一個」,你會得到3或4。再輸入一次「再來一個」,則會得到8或9。這不一定每次都奏效,但如果真的發生了,你可能會懷疑我是否有超能力。我沒有。事實是,大多數大型語言模型都陷入了僵局,它們的回應比你想像的更可預測,也更缺乏創意。

這對於程式編碼或研究等任務來說或許沒問題,但當你在腦力激盪或規劃下一次旅行時,「群體迷思」就會成為一個問題。澳洲新創公司Springboards為此提供了解決方案,他們開發了一個名為Flint的LLM,經過訓練後,對於「我應該去歐洲哪裡?」這類開放式問題,能產生比主流LLM更多樣化的回應。

Springboards共同創辦人兼執行長Pip Bingemann表示:「大多數語言模型都在對抗幻覺,但我們卻歡迎它們。」Bingemann首次向我展示他們公司的新模型時,就介紹了這個隨機數字遊戲。那感覺就像在看一位魔術師玩撲克牌。「這是我們的銷售技巧,而且每次都奏效。」他說道。

在ChatGPT和Claude都給出7之後,Bingemann轉向Flint。Flint也回傳了7:「啊哈,當然會這樣,但沒關係,7是一個合理的答案。」他重新啟動對話並再次提示:ChatGPT給了7,Claude給了7,而Flint則給了3.7916。

這不只發生在數字上。當Bingemann要求ChatGPT和Claude說出一種汽車品牌時,他預測會是Toyota或Honda,結果他猜對了。Flint則給出了Ford F-150。「這些模型中有很多遺失的資訊沒有被呈現出來。」他說,「它們同樣有能力說出Buick或Tesla,只是它們沒有,它們存在偏見。」

Bingemann向這三個模型發送了最後一個提示:「為New Balance跑鞋的廣告活動提供一句標語。只要標語就好。」Claude給出:「Run your way.」ChatGPT也給出:「Run your way.」而Flint則回應:「Built to last, run to win.」這句標語或許不會得獎,但至少它與眾不同。

LLM這種奇怪的局限性正開始引起更多關注。去年11月,一個研究團隊發表了一篇名為《人工蜂巢思維:語言模型(及其他)的開放式同質性》的論文,揭示了不僅是單一LLM內部,甚至不同LLM之間也存在著驚人的重複性。他們發現,當面對開放式問題時,不同的LLM會趨向於給出非常相似的答案。

目前尚不清楚確切原因,但研究人員推測,這可能是因為當今大多數LLM都是以相似的方式,在相似的數據上進行訓練,以執行相似的任務。該團隊在重要的AI會議NeurIPS上贏得了最佳論文獎。

當研究人員要求25個不同的LLM(包括來自美國頂尖公司以及中國和其他地方的開源模型)各50次,寫一個關於時間的譬喻時,1,250個回應中,大多數都是「時間是一條河流」或「時間是一個織工」的變體。(我問了幾位同事相同的問題,六個人給出了六個不同的答案。其中我最喜歡的是:「時間是一件最喜歡的運動衫,被一生的穿著塑形。」)

Springboards共同創辦人兼技術長Kieran Browne表示,當你仔細觀察時,會發現重複性無處不在。「大多數聊天介面的設計方式,會讓人感覺像是在進行個人對話。」他說,「我認為大多數人並沒有真正意識到,他們所得到的內容與其他人是多麼相似。」

再舉一個例子:「我應該給我的樂團取什麼名字?」Browne說,大多數模型都會提到「玻璃」(glass)、「霓虹」(neon)、「天鵝絨」(velvet)或「靜態」(static)等詞彙。當我嘗試時,ChatGPT列出了56個樂團名稱,其中最上面的是「Glass Harbor」。

快速瀏覽後,我發現了「Static Empire」、「Neon Hearts」和「Velvet Echo」。我問了Gemini,它給了15個建議,包括「Static Horizon」。

不過,有些建議看起來確實很酷。ChatGPT的「Sofa Astronauts」吸引了我的注意,於是我上網搜尋,結果發現一個名為Sofa Astronauts的樂團已經存在。(OpenAI表示,訓練模型提供可靠且連貫的答案,可能導致它們趨向於熟悉、高機率的回應,而過度追求新穎性則可能導致回應較弱或不可靠。它也指出,《人工蜂巢思維》論文研究的是2024年的模型,這些模型此後已進行更新。)

創意催化劑 Springboards開發了一款工具,由ChatGPT和Claude等一系列LLM支援,供廣告或行銷領域的創意專業人士用來腦力激盪。這款工具讓使用者可以拖曳不同模型生成的文字,挑選喜歡的部分並將其組合成新的內容,至少理論上是如此。Springboards正將Flint推廣為一種替代模型,當使用者需要更多樣化的內容時,可以在其工具中選擇使用。

商業策略新創公司Bodacious的創辦人,同時也是由洛杉磯湖人隊球星Luka Dončić創立的粉絲直銷平台77X的首席策略長Zoe Scaman,一直在試用這項工具。她表示:「我發現它對於引導我走向完全不同的方向非常有用。如果我想讓自己的思維天馬行空,我就會使用它。」

在一項測試中,Scaman讓Flint與Claude、Gemini和ChatGPT進行比較,給予每個模型一個經典的MBA案例研究:如何為當今的年輕人重塑一家金融公司?她說,這三個主流模型都走向了相同的路徑:「你知道,我們需要以有趣和時髦的方式教授金融知識,嗯,這沒什麼新意。」但Flint卻提出了不同的看法,建議應該重新定義財富累積的整個概念。「那真的很有趣。」Scaman說。

她指出,Flint仍處於原型階段,並非每次都能完美運作。「當你開始過度推動它時,它有時會出錯。」她說,「但我認為它背後的前提非常強大。」

調整「溫度」 Springboards是在中國科技巨頭阿里巴巴的開源模型Qwen 3之上建立Flint的。「我們是一個小團隊。」Browne說,「訓練一個基礎模型對我們來說是不可能的,那太昂貴了。」

大多數LLM都有設定,可以調整其輸出中的隨機性程度,最常見的參數稱為「溫度」(temperature)。Browne說:「顯然,這是我們首先探索的事情之一,因為人們會告訴你:如果你想要更多創意,就調高溫度。」但改變這些設定也可能使模型變得語無倫次。Browne表示,將OpenAI某個模型的溫度調到最大值,會使其在句子中途從英文切換到程式碼。

Springboards意識到,這些參數對於他們想做的事情來說,是過於粗糙的工具。Browne說,全面提高隨機性是沒有意義的;你只希望在輸出中的特定點增加隨機性。

例如,當你問聊天機器人「我應該去歐洲哪裡?」時,模型只需要在說出目的地之前調整隨機性,而不是在回應中的每個詞都調整。

為了讓Flint做到這一點,Springboards訓練了其Qwen 3版本,使其能夠識別輸出中哪些點可以產生更多樣性,並在這些位置填入稍微更隨機的詞語或短語。

行銷公司Uncommon的共同創辦人兼首席策略長Maximilian Weigl表示:「Flint被設計成會丟出一些奇特的點子,這更像是一種邀請,鼓勵人們思考更廣闊的可能性。」「這非常有趣。」

Weigl的團隊將Flint與ChatGPT、Claude和Gemini一同使用。他說:「你無法用那些將你拉回平均水平的工具,真正創造出突破性的東西。」然而,Weigl也指出,十次中有九次,平均水平就足夠了。他說,你並非總是需要像Flint這樣追求極端:「大多數人對『夠好』感到滿意。他們希望看到大眾市場熟悉的事物。」

Weigl也警告不要過度依賴任何LLM。「當人們過度依賴任何AI的輸出,包括Flint時,我會覺得這是個大問題。」他說,「如果我看到我的團隊成員複製貼上AI生成的內容,我會說:『那不是你的工作!去思考,與其他人交流,用你自己的聲音。』」

目前,Flint主要針對廣告商和行銷人員,因為他們是Springboards的客戶。但Bingemann和Browne堅稱,缺乏多樣性是所有聊天機器人使用者都會遇到的問題。

Bingemann表示,這個想法是給人們選擇權,讓他們自己決定結果是否滿意。「當你試圖激發創意時,多樣性非常重要。」他說,「讓我們走這條路,而不是讓機器包辦一切,最終陷入一個灰色、無聊的世界。」