2021 年 3 月,四位語言學家和電腦科學家發表了他們如今已成經典的論文《關於隨機鸚鵡的危險:語言模型會不會太大?🦜》。這篇論文當時引起了廣泛關注,部分原因是在發表前不久,Google 解雇了其中兩位作者 Timnit Gebru 和 Margaret Mitchell。

論文指出,大型語言模型(LLM)透過統計預測可能的詞彙序列來生成文本,而非真正理解其內容,作者們用「隨機鸚鵡」這個比喻來形容這種缺乏理解、僅重複模式的系統。

在過去五年中,這個比喻已遠遠超出了其學術發源領域,引發了許多辯論,並啟發了諸如名為「隨機鸚鵡」的肩載機器人等專案。然而,這種廣泛使用也導致了對該詞語原始含義的誤解。該論文的主要作者、華盛頓大學計算語言學教授 Emily M. Bender 最近撰寫了一篇部落格文章,以駁斥該論文發表五週年之際的常見誤解。

Bender 與 IEEE Spectrum 討論了這些誤解、計算語言學領域以及當前關於人工智慧的論述。

「人工智慧」一詞有何問題?您會如何描述您作為計算語言學家的工作?Emily M. Bender 表示,語言學廣義來說是研究語言如何運作以及我們如何使用語言的學科。她對此有所貢獻,同時也在計算語言學領域工作,培訓將來會開發語言技術的學生。

語言技術本身就具有價值和趣味性,無論是否有人想將其用於人工智慧專案。語言技術包括自動轉錄、機器翻譯和拼寫檢查等。她個人在建構系統時,許多工作都與建立機器可讀但同時也人類可讀的語法有關,這些語法能模擬不同語言的語言現象。這關乎於利用電腦來協助語言學假設的驗證。

您曾主張「人工智慧」一詞弊大於利,為何如此?Bender 說,原因有很多。她認為,如果我們談論技術的方式無法清楚說明其本質,就難以對技術進行良好討論並做出明智決策。

「人工智慧」這個詞彙既將截然不同的技術歸為一類,又過度宣傳了每項技術的能力。因此,如果我們要決定是否使用某項技術,或如何監管它,擁有更清晰的描述會對我們更有利。

在日常對話中,AI 幾乎已成為「聊天機器人」或「LLM」的同義詞。這會是個問題嗎?Bender 回應,對許多人來說,他們會說「我用它來做某某事」。那麼「它」指的是什麼?他們會說「喔,我指的是 Claude」或 ChatGPT 或 Gemini,所以他們談論的是這些聊天機器人。

但也有其他人會說「你不能說 AI 全是壞的,那 AlphaFold 怎麼辦?」所以,是的,對許多人來說,他們談論的是基於大型語言模型建構的聊天機器人,但他們也不清楚這些東西與 AlphaFold 等是不同的。當新聞報導說「科學家使用 AI 發現新藥」時,他們究竟使用了什麼?

如果他們談論的是更狹窄的技術,也許是蛋白質摺疊,也許是像天氣模型那樣的某種統計建模。那是一種與 ChatGPT 截然不同的技術。

您認為像「人工智慧」這樣的總括性術語有其價值嗎?Bender 說,對於那些試圖推銷這項技術的人來說,它確實有價值,對於試圖提高估值的科技公司也是如此。

此外,目前研究經費的設定方式是,如果你不將自己的工作稱為人工智慧,就很難獲得資助。她認為這是一個負面影響,但對於任何被困在這個系統中的個人來說,它在當下可能具有價值。

「隨機鸚鵡」是如何被誤解的?關於「隨機鸚鵡」這個比喻,最常見的誤解是什麼?Bender 認為,最大的誤解之一是「Bender 說 AI 就是隨機鸚鵡」。那篇論文寫於 2020 年底,當時我們討論的是大型語言模型。

她很確定「AI」這個詞只在論文的最後出現過一次,那是在談論如果你要開發旨在執行人類所做事情的系統,你必須非常小心,不要創造出可能被誤認為是人的東西。這些系統被設計來模仿我們使用語言的方式,這使得人們很容易將它們誤認為是其他人。因此,在論文的最後,我們才將其概括到 AI。但「隨機鸚鵡」這個詞具體指的是大型語言模型,而「人工智慧」這個詞則指代許多不同的事物。

所以我們從未聲稱西洋棋引擎、AlphaFold、圖像標註系統或機器翻譯系統,這些有時被稱為人工智慧的任何東西,都是隨機鸚鵡。我們當時特別討論的是使用大型語言模型來生成合成文本。

另一個誤解是,「隨機鸚鵡」被其他人解讀為貶低或侮辱。它並非這個意思。其他人或許會這樣使用,但這並非她的本意,因為它只是對這些系統實際運作方式的描述。

將其視為侮辱,要嘛是相信大型語言模型是會被冒犯的,但它不是;要嘛是認為這些大型語言模型應該被理解為邁向她不認同的「人工智慧」宏大理想的步驟。她在許多地方所做的,章魚思想實驗、隨機鸚鵡、以及「合成文本擠出機」這個詞,都是為了讓那些不從事語言技術開發的人們,清楚了解這些系統實際做什麼,這與侮辱這些系統或喜歡這些系統的人無關。

對於不了解的讀者,「章魚測試」源自 2020 年的一篇論文,該論文設想一隻章魚識別海底電纜中傳遞訊息的統計模式。您已經多次使用動物比喻,例如章魚測試和隨機鸚鵡,這是故意的嗎?

Bender 回答說,這並非故意的。在章魚思想實驗中,她最初是用海豚來敘述這個故事,因為海豚顯然是聰明的動物。但她的共同作者 Alexander Koller 建議應該用章魚,首先是因為章魚生活的環境與人類居住的環境截然不同,這使得比喻更加生動,章魚只是感受電纜中的脈衝,無法看到人類所看到的東西。此外,章魚本身也更有趣。

我回顧那篇論文時很驚訝,「隨機鸚鵡」這個詞在正文中只出現了兩次。為什麼您會將它放在標題中?Bender 說,因為我們喜歡它!而且一個引人注目的標題對於學術論文來說是很好的自我行銷。

論文中沒有太多提及它的原因在於,我們當時真正關注的是讓語言模型變得越來越大所帶來的各種風險。「大型語言模型」這個詞也沒有出現在論文中,因為當時人們還沒有這樣稱呼它們。因此,關於合成文本的部分,在某些方面感覺我們如履薄冰,因為當時很難想像會有人需要合成文本。

當 OpenAI 將 ChatGPT 推向世界後,論文的這部分變得更加相關,也因此顯得重要。但我們也討論了環境影響,以及這些系統如何吸收其訓練資料中的偏見,還有訓練資料從未被妥善收集的問題。論文中有很多不同的觀點,而關於合成文本的問題只是其中之一。

麻省理工學院媒體實驗室的研究人員創造了一個「隨機鸚鵡」機器人,以回應許多聊天機器人傾向於諂媚或過度順從的觀察。這種趨勢與您論文中提出的危險有關嗎?Bender 說,當我們在 2020 年底撰寫那篇論文時,人們對合成文本和聊天機器人並沒有特別興奮。聊天機器人早已存在。

我們有 1960 年代 Weizenbaum 的 Eliza,然後是那些非常惱人的自動客服系統,它們隨著大型語言模型的出現變得更加流暢,但也同樣惱人。當時的情況就是如此。OpenAI 已經發布了 GPT-2 和 GPT-3 供人們玩,你可以讓它們生成合成文本,但當時還沒有將聊天介面包裝在這些模型上。

我們也還沒有看到導致被解讀為諂媚行為的額外訓練層。聊天機器人會說「喔,這是個好主意」,或者如果你說它錯了,它會說「喔,我很抱歉,你是對的」,這種回應與原始預訓練之後的額外訓練層有關。

您希望更多人了解語言模型的哪些方面?Bender 表示,她每次有機會都會傳達的訊息是,當這些系統輸出的文本看起來有意義時,那是因為我們正在賦予它意義。這點也包含在「隨機鸚鵡」論文中。

每當我們評估這類技術時,都必須考慮我們理解語言的能力,並在決定技術運作方式時將其納入考量。這一點在這些討論中經常被忽略。

如果您現在要重寫或更新「隨機鸚鵡」論文,會有什麼改變嗎?Bender 說,論文中沒有涵蓋到一個非常大的危害形式,那就是剝削性勞動行為。這包括許多資料工作者面臨的可怕條件,以及這些系統背後對人們創意和知識成果的大規模竊取。

這些問題本應納入論文中。並非當時這些問題不為人知,只是它們沒有被納入我們調查的範圍,但它們應該被包含在內。