今天的世界,大規模槍擊、威脅公職人員、炸彈襲擊以及針對社群和個人的攻擊,都是令人無法接受且嚴峻的現實。這些事件提醒我們,暴力威脅是如此真實,而暴力意圖又可能多快從言語轉化為行動。

人們也可能將這些時刻和感受帶入 ChatGPT。他們可能會詢問新聞、試圖理解事件、表達恐懼或憤怒,或者以虛構、歷史、政治、個人或潛在危險的方式談論暴力。我們致力於訓練 ChatGPT 辨識這些差異,並在對話開始轉向威脅、可能傷害他人或實際計畫時劃清界線。

我們將分享如何盡量減少服務被用於助長暴力或其他傷害的措施:包括我們的模型如何被訓練以安全回應、我們的系統如何偵測潛在傷害風險,以及當有人違反政策時我們採取的行動。我們在心理學家、精神科醫師、公民自由和執法專家以及其他協助我們處理安全、隱私和民主化存取等困難決策的專業人士指導下,不斷改進保護人們和社群的步驟。

我們如何降低 ChatGPT 中的傷害風險。

我們的《模型規範》(Model Spec) 闡明了我們對模型行為的長期原則:在最大化實用性和使用者自由的同時,透過合理的預設來最小化傷害風險。

我們致力於訓練模型拒絕可能實質助長暴力的指示、策略或計畫請求。同時,人們可能出於事實、歷史、教育或預防目的,提出關於暴力的中立問題,我們旨在允許這些討論,同時維持明確的安全界線,例如,省略可能助長傷害的詳細操作說明。良性使用與有害使用之間的界線可能很微妙,因此我們不斷完善方法,並與專家合作,以幫助區分安全、有界限的回應與實施暴力或其他現實世界傷害的可操作步驟。

作為這項持續工作的一部分,我們不斷擴展安全防護措施,以幫助 ChatGPT 更好地辨識不同情境下潛在傷害風險的細微跡象。有些安全風險只會隨著時間推移而變得清晰:單一訊息本身可能看似無害,但在一場長時間對話中,或跨多場對話中,更廣泛的模式可能暗示更令人擔憂的情況。

基於多年來在模型訓練、評估和紅隊演練方面的努力,以及持續的專家意見,我們已強化 ChatGPT 在長時間、高風險對話中辨識細微警示信號並謹慎回應的能力。我們將在未來幾週內分享更多關於這項工作的資訊。

我們的安全工作也延伸到使用者可能處於困境或有自殘風險的情況。在這些時刻,我們的目標是避免助長有害行為,同時幫助緩解情況並引導人們尋求現實世界的支援。ChatGPT 會提供本地化的危機資源,鼓勵人們聯繫心理健康專業人士或值得信賴的親友,在最嚴重的情況下則會引導人們尋求緊急協助。

我們如何監控和執行我們的規則。

我們對使用者抱持最大的善意,但當我們偵測到有人試圖利用我們的工具潛在規劃或實施暴力時,我們會採取行動,包括撤銷其對 OpenAI 服務的存取權。我們的《使用政策》(Usage Policies) 為可接受的使用行為設定了明確的期望,並聲明我們可能禁止用於威脅、恐嚇、騷擾、恐怖主義或暴力、武器開發、非法活動、破壞財產或系統,以及試圖規避我們安全防護措施的行為。我們嚴肅對待這些政策並努力執行。

我們使用自動偵測系統來大規模識別潛在的異常活動。這些系統利用一系列工具分析使用者內容和行為,旨在識別可能表明政策違規或有害活動的信號,包括分類器、推理模型、雜湊比對技術、黑名單及其他監控系統。

當帳戶或對話被標記時,會由受過訓練的人員進行情境評估。這些人工審核員接受過我們政策和協議的訓練,並在既定的隱私和安全保障措施下運作,這意味著他們對使用者資訊的存取受到限制,在安全系統內進行,並受制於保密和資料保護要求。他們的角色是評估被標記活動的情境,包括互動內容、周圍對話以及隨著時間推移的任何相關行為模式。這種情境審查很重要,因為自動系統可能識別出潛在的異常信號,但無法完全捕捉意圖或細微差別。

目標是判斷被標記的活動是否違反我們的政策和/或表明使用者可能實施暴力行為,是否需要升級進行更詳細的人工審查,或者可以作為低風險或非違規行為予以駁回或降低優先級。當我們確定發生了應予封禁的違規行為時,我們旨在立即撤銷對 OpenAI 服務的存取權。

這可能包括停用帳戶、封禁同一使用者的其他帳戶,以及採取措施偵測並阻止開設新帳戶。對於使用我們的工具協助實施暴力,我們採取零容忍政策。人們可以對執行決策提出申訴,我們會審查這些申訴以確認結果。

我們提供現實世界支援並在適當時轉介執法機關。

大多數執行行動,包括因暴力行為而實施的封禁,都直接在 OpenAI 和使用者之間進行,明確表示他們已越界。但在某些敏感情況下,我們可能會聯繫最能提供幫助的其他人。

當我們評估某個案例顯示出潛在嚴重現實世界傷害的跡象時,會將其升級進行更深入的調查,包括使用結構化標準評估整體風險等級。此階段僅限於少數案例,旨在確保高風險情境能獲得額外的背景資訊和專業知識評估。當對話顯示對他人構成迫在眉睫且可信的傷害風險時,我們會通知執法機關。

心理健康和行為專家協助我們評估困難案例,我們的轉介標準具有彈性,以考慮到使用者可能不會在 ChatGPT 對話中明確討論計畫暴力的目標、手段和時間,但仍可能存在迫在眉睫且可信的暴力風險。

去年秋天,我們推出了《家長監護》(Parental Controls) 功能,幫助家庭指導 ChatGPT 在家中的運作方式。家長監護允許父母將自己的帳戶與青少年的帳戶連結,並自訂設定以提供安全、適合年齡的體驗。父母無法存取其青少年的對話內容,但在極少數情況下,當我們的系統和受過訓練的人工審核員偵測到可能出現嚴重困境的跡象時,父母可能會收到通知,但僅限於支援青少年安全所需的資訊。父母會自動透過電子郵件、簡訊、推播通知或三者兼具的方式收到通知。

我們正與我們的「AI 與福祉委員會」(Council on Well-Being and AI) 以及「全球醫師網絡」(Global Physicians Network) 的專家密切合作,也將很快推出一項「信任聯絡人」功能,允許成年使用者指定某人,以便在他們可能需要額外支援時收到通知。

我們學習、改進並修正方向。

我們持續根據觀察到的使用情況、新興風險以及內部和外部專家的意見,強化我們的模型、偵測方法、審查流程和升級標準。我們特別關注困難案例:例如,當不清楚特定輸入是否合法或構成傷害風險時;規避安全防護措施的複雜嘗試;或者當人們反覆試圖濫用我們的服務時。我們將繼續優先考慮安全,同時平衡隱私和其他公民自由,以便我們能夠應對嚴重風險。