AI公司如 Anthropic 和 OpenAI 定期發布關於人們如何使用 Claude 和 ChatGPT 等產品的報告,但AI研究人員指出,他們只會公布希望我們看到的數據。史丹佛大學可信賴AI研究(STAIR)實驗室的電腦科學博士生 Anka Reuel 表示:「沒有獨立來源可以證實這些數據。」
Reuel 共同領導一項名為「AI觀察站」(AI Observatory)的新研究計畫,旨在彌補這一空白。這是一個公開平台,它彙整並分析了透過用戶同意,從七個現有數據集中收集到的,與 Claude 和 Gemini 等熱門模型進行的真實AI對話。
其目的是提供獨立的資訊來源,幫助研究人員和政策制定者評估人們如何使用生成式AI。Reuel 指出,目前關於AI效益和風險的重大決策,都是基於非常有限的數據所做出的。
AI觀察站發現,AI的使用方式在不同模型之間存在顯著差異,並且隨著時間推移而有所變化。其研究顯示,用戶行為中包含比主要AI公司報告所捕捉到的更多敏感內容,這些公司報告更側重於工作用途而非個人使用。
Anthropic 經濟指數是AI使用數據中最知名且被廣泛引用的來源之一,但它存在盲點。顧名思義,它專注於 Claude AI 在工作和生產力相關方面的應用,過濾掉了與這些用途無關的對話。
當AI觀察站的研究人員將 Anthropic 的方法應用到他們的數據集時,他們發現近一半的對話(48%)會被過濾掉。這些非工作相關的對話更可能涉及健康和人際關係(44.2% 對 Anthropic 分析中的 31.2%)、成人或非法話題(7.9% 對 2.1%)、騷擾和仇恨(27.5% 對 5.66%),以及性內容(16.7% 對 2.4%)。
OpenAI 2025 年關於 ChatGPT 的報告也類似地發現,只有 30% 的消費者使用與工作相關。
Anthropic 曾發布獨立部落格文章,說明人們如何使用 Claude 尋求支援或陪伴,甚至生成兒童性虐待圖像(CSAM)。然而,德州大學奧斯汀分校助理教授 David Widder 表示,擁有「AI觀察站的鳥瞰式分析」,而不是將這些資訊「分開到獨立報告中」,有助於研究人員更一致地理解不同的用途。Widder 專門研究人們如何與AI系統互動,但他並未參與AI觀察站的計畫。
AI觀察站所檢視的數據集包含了 2023 年至 2025 年間發生的對話,它發現了人們使用AI的方式以及不同AI平台回應方式的差異。
WildChat 是AI觀察站研究中最大、最詳細的數據集之一,其中的對話隨著時間推移變得更長、更精細,這從提示詞標記、回應標記和對話輪次的增加可以看出。
隨著時間推移,閒聊的次數也顯著增加。這表明AI陪伴功能正在增加;同時,AI助理的自我揭露(即承認自己是聊天機器人)則有所減少。
此外,研究人員標記為敏感的交流,即可能包含有害或受限制內容(包括性騷擾和仇恨言論)的對話,變得不那麼頻繁。這可能表明平台普遍部署了更有效的防護措施。
AI觀察站還發現,不同模型之間在話題、互動風格、對話結構以及敏感使用案例的可能性和類型上存在差異。
例如,研究人員發現人們更頻繁地使用 Grok 和 Gemini 進行資訊檢索。Grok 尤其在新聞和政治資訊方面特別受歡迎,但也正是錯誤資訊容易集中的地方。這與其他研究顯示錯誤資訊在 Grok 上容易傳播的結果一致。xAI 對此未回應置評請求。
同時,人們更傾向於使用 Anthropic 進行程式編碼,使用 Gemini 進行社交和角色扮演,而 ChatGPT 則常用於作業輔助。
即使是同一模型的不同版本之間也存在差異。研究人員發現,當 ChatGPT 由 GPT-3.5 驅動時,人們的對話較短;而使用 GPT-4o 時,對話則更長且更具迭代性,這也解釋了為何該版本以導致情感依賴而聞名。
然而,公司的報告往往未能捕捉到這些模型之間甚至模型內部的細微差異。與 Reuel 共同領導這項研究的麻省理工學院媒體實驗室博士畢業生 Shayne Longpre 表示:「沒有任何一份公司報告能講述完整的故事。」
為了創建AI觀察站,Reuel 和來自麻省理工學院、史丹佛大學、數據溯源倡議組織及其他機構的研究人員,彙整了來自七個先前研究中收集的真實世界數據集,共計 24,521 次對話中的 85,633 個對話輪次(即用戶提示詞和相應的AI回應)。這些對話來自 5,000 名用戶在 2023 年至 2025 年間與 52 個不同模型(包括 ChatGPT、Gemini、Claude 和 Grok)的互動。
但與大型實驗室本身所擁有的數據相比,這些對話只是滄海一粟。例如,最新的 Anthropic 經濟AI指數是基於對 100 萬次 Claude 對話的分析;OpenAI 關於人們如何使用 ChatGPT 的報告則分析了 150 萬次對話。
Anthropic 的一位代表表示,該公司發布的研究反映了其研究團隊的特定問題和興趣,並且支持外部獨立研究非常重要。OpenAI 則未回應置評請求。
AI觀察站的數據來源於自願提供,這意味著它可能低估了敏感用途,因為人們可能不太願意分享這些內容。因此,研究人員提醒,其發現並不代表所有AI的使用情況。
然而,該計畫的工作擴大了研究社群的數據獲取途徑。Reuel 和 Widder 等獨立研究人員表示,AI公司通常不分享他們的聊天數據供分析,這意味著他們的報告往往只側重於那些能讓他們看起來最好的發現。
Widder 解釋說:「當我們想問,例如:Anthropic 的通用AI系統是主要用於善還是主要用於惡時,我們沒有辦法回答這個問題,因為這些資訊是專有的。」
AI觀察站的數據將開放給研究人員進行分析,團隊也希望隨著時間擴大其數據集。Reuel 表示,理想情況下,AI公司應該以保護用戶隱私的方式,與獨立研究人員分享他們的數據。但她說,就目前情況而言,任何基於AI使用數據做出決策的人,都冒著「完全在未知中運作,並在不了解公司敘事之外實際發生了什麼的情況下,做出這些真正具有影響力的決策」的風險。



