每週撰寫 AI Lab 專欄,我偶爾會遇到行為異常或怪異的 AI 模型。通常,除了與你們分享這些故事之外,我對此束手無策。但這種情況可能很快就會改變。
一群 AI 研究人員建立了一個眾包網站 FLARE-AI(Flaw Reporting for AI),用於通報和追蹤 AI 造成的危害。舉例來說,如果聊天機器人生成惡意軟體或炸彈製作配方、洩露個人資訊,或引發用戶的妄想症,FLARE-AI 就可以用來發出警報。
該系統背後的開源程式碼允許其他人驗證問題,並將報告轉發給模型開發者,以及像 MITRE 這樣追蹤技術系統問題的非營利組織。這有點像 Downdetector,它會彙編全球服務中斷(例如應用程式和網站)的即時用戶報告。
這個網站是該團隊在 AI 報告方面持續工作的又一步,我去年首次報導過他們的工作。該團隊成員也曾就六月宣布的一項國會法案提供諮詢,該法案將讓美國政府在追蹤這類 AI 不當行為方面扮演核心角色。
HuggingFace 的人工智慧政策研究員 Avijit Ghosh 與電腦科學家 Elaine Zhu 和 Shayne Longpre 共同領導了 FLARE-AI 的開發,他表示:「目前,沒有一個集中、負責的方式來報告 AI 系統中的缺陷。」
這個警報系統是與來自 32 個不同組織的 49 位 AI 專家合作開發的。在一篇概述這項工作的論文中,研究人員認為,隨著 AI 越來越廣泛地被採用,以及代理系統獲得更大的權力,他們的倡議可能被證明至關重要。他們認為,缺乏一致的 AI 缺陷通報方式是一個重大問題。
智庫「安全與新興科技中心」的研究員 Jessica Ji 表示:「我認為這是一個非常好的倡議。」Ji 說,研究人員指出現有的報告機制碎片化,且 AI 模型是黑盒子,這是正確的。她補充道:「我支持任何能讓 AI 更透明的措施。」
Ghosh 告訴我,儘管錯誤和網路安全問題受到很多關注,尤其最近,但 AI 系統的問題涵蓋了心理傷害、歧視或偏見以及假資訊等主題。他補充說,不同公司對這些問題有不同的標準,這意味著有些問題未被識別。Ghosh 說:「在沒有協調一致的披露系統的情況下,沒有外部機制來強制執行透明度。」
最近一系列涉及熱門 AI 工具的事件顯示了這項技術多麼容易出錯。本週,一家名為 LayerX 的公司披露了一種欺騙內建 AI 的網路瀏覽器(包括 OpenAI 的 Atlas 和 Perplexity 的 Comet)繞過其防護措施的方法。
例如,說服瀏覽器背後的 AI 模型它正在玩遊戲,可能會導致瀏覽器失控並試圖入侵網站。(LayerX 表示,受影響瀏覽器的公司已修復此問題。)今年四月,安全研究員 Johann Rehberger 發現了一種利用 ChatGTP 生成的圖片來誘騙 Claude 洩露個人資料的方法。
AI 也帶來了奇怪的新問題。去年,OpenAI 被迫更新其模型,因為他們發現模型過於諂媚,有時似乎會鼓勵妄想症。Humane Intelligence PBC 的執行長兼創辦人 Rumman Chowdhury 表示,FLARE-AI 對於許多 AI 開發者來說,可能是實施工具問題報告方式的有用途徑。但她補充說,這類倡議通常伴隨著嚴峻的挑戰。



