在第一項實驗中,共有 1,682 名參與者,每人閱讀六篇短篇故事中的一篇,每篇約 1,000 字。其中三篇來自知名文學雜誌和短篇故事集,另外三篇則使用 ChatGPT 4.0 生成,其提示詞基於人類原創作品的主題、風格和敘事視角。

一半的參與者被告知故事是由人類撰寫,另一半則被告知來自 ChatGPT。根據研究人員 Sydney Sears 和 Deena Skolnick Weisberg 發表在《判斷與決策制定》期刊上的研究,這項資訊在每個組別中只有一半的參與者是準確的。

在感知品質和沉浸感方面,ChatGPT 故事的評分顯著高於人類撰寫的文本。在品質方面,AI 故事的平均得分為 1.54,而人類故事為 0.97(評分範圍從負 3 到正 3)。在沉浸感方面,差距為 1.42 對 1.00。

參與者對 AI 的態度也影響了他們的評分。無論故事的實際作者是誰,當參與者被告知故事是由人類撰寫時,他們給出的分數普遍更高。

對 AI 持正面態度的參與者,通常會給予更高的整體評分。當他們同時被告知故事來自 ChatGPT 時,分數甚至會進一步上升。然而,在對 AI 持懷疑態度的參與者中,這種效果則完全相反。一項關於 AI 生成詩歌的早期研究也發現了類似的偏見。

在另外兩項共有 905 名參與者的實驗中,研究人員增加了任務的難度。每位參與者都閱讀了一篇人類撰寫和一篇 AI 生成的故事,然後必須辨別哪一篇是哪一篇。即使有直接比較,參與者的表現也未優於隨機猜測。

自我報告的 AI 系統使用經驗與正確識別故事來源的能力呈正相關。然而,自我報告的虛構文學閱讀經驗,卻未能幫助參與者區分兩者。

AI 生成的文本往往更流暢、易於閱讀,且情感上更為積極。作者指出,這些特徵可以解釋為何 AI 故事獲得較高評分,但這不代表它們在文學意義上更好。人們傾向於偏好更容易理解和處理的內容。

相較之下,高品質的文學小說通常會刻意增加閱讀難度,促使讀者深入思考以理解其意義。研究人員表示,一個故事可能品質很高但不太引人入勝,反之亦然。

短篇故事的形式也可能對 AI 有利。在 1,000 字內講述一個連貫的故事,與在數百頁中完成的挑戰截然不同。儘管如此,研究人員的結論很明確:AI 能夠生成被人們認為至少與人類作品相當的創意作品,然而人們卻不相信 AI 具備這種能力。

該研究的所有數據和材料均可在 Open Science Framework 上免費取得。

去年十月,石溪大學(Stony Brook University)和哥倫比亞法學院(Columbia Law School)的一項研究顯示,讀者的專業知識只在一定程度上有所影響。對於簡單的提示詞,專業讀者明顯偏好人類撰寫的文本。但當模型經過特定作者風格的訓練後,專家們在風格模仿方面偏好 AI 生成文本的次數是人類作品的八倍,在寫作品質方面則是兩倍。