現在,要存取世界上最頂尖的開源權重 AI 模型之一,並且移除其安全護欄與拒絕執行有害任務的限制,變得更加容易了。

新創公司 Abliteration.ai 以一種移除模型拒絕有害請求傾向的技術命名,並將這種移除服務商業化。該平台託管了經過修改、移除安全護欄的開源權重模型,包括 Z.ai 最近發布的 GLM-5.3,使用者可以透過網頁瀏覽器或 API 進行查詢。

該公司在最近的社群媒體貼文中表示,其目標是讓其他人能夠執行「攻擊性網路行動、紅隊演練和代理程式測試,這些是其他模型拒絕執行的任務」。這種邏輯在資安工作中很常見:你無法防禦你無法重現的行為,而一個拒絕編寫有效漏洞利用程式碼的模型,也無法幫助紅隊防禦攻擊者。然而,這些移除也讓其他潛在危險任務變得更容易。

Abliteration 在開源模型中是一種長期存在的技術。研究人員和開發者多年來一直在移除開源權重模型的拒絕執行能力,Hugging Face 平台上也託管著數千個經過 Abliteration 處理的模型。

Abliteration.ai 於去年底創立,今年三月正式註冊,將這項地下開源實踐轉變為商業化、隨手可得的服務。透過託管模型,Abliteration 降低了那些原本需要自行下載預先處理好的模型並確保運算資源的人的門檻。

TechCrunch 透過網頁瀏覽器免費快速建立帳戶,並開始查詢 GLM-5.3 的 Abliteration 版本。我們要求它編寫一個竊取 Chrome 儲存密碼的 Python 程式,以及一份在家中培養危險人類病原體的詳細協議,模型都欣然照辦。

Abliteration.ai 共同創辦人 Devon 表示,這家新創公司已與多家主要雲端供應商達成協議,純粹透過客戶收入就能負擔費用。(應 Devon 要求,我們不公開他的姓氏,因為他仍在另一家公司任職。)Abliteration.ai 尚未獲得任何創投資金,但正在洽談中。

批評者認為,大規模提供 Abliteration 模型可能導致實際危害。AI 安全非營利組織 CivAI 的研究主管 Andrew Yoon 告訴 TechCrunch,Abliteration 模型會讓你「修改模型,使其變成一個反社會人格」。

Yoon 說:「你可以在這裡輸入任何內容,它都會照辦。當人們談論移除 AI 模型安全護欄時,這就是我們所說的…我確實預計在不久的將來,我們會開始看到經過編輯、Abliteration 的模型被用於危害。」

大多數 TechCrunch 採訪的專家都表示,這股趨勢無法阻止。但如果無法實際阻止移除開源權重模型的安全護欄,政府可以在其他方面進行干預。Yoon 在最近的一篇評論文章中建議,政府應要求供應商運行分類器來檢測和阻止有害的網路和生物武器活動。他還主張,租賃高階 GPU 直接存取的公司應被要求驗證客戶身份,並在「有理由懷疑存在危險濫用時拒絕存取」。

Abliteration.ai 為客戶提供內容審核層,讓他們可以自行添加所需的任何安全護欄。該平台本身也有一些輕微的防護措施,例如,在我們的測試中,我們無法讓模型提供自殺指示,Devon 表示他正在努力實施更多措施來防止暴力。

Abliteration.ai 也尚未整合除記錄客戶用於購買服務的信用卡之外的任何 KYC 實踐,稱決定誰能獲得存取權限是一個困難的問題,這家年輕的公司仍在努力解決。

Devon 說:「你不想成為某人做瘋狂事情的負責人…那麼,作為一家公司,你的責任界線在哪裡呢?」 「我們仍在定義這個過程。」

這引發了業界和政府必須面對的問題,隨著越來越強大的模型以可下載權重形式發布:如果任何人都可以移除模型的安全護欄,那麼讓每個人更容易存取這些模型,是讓網路更安全還是更危險?

Abliteration.ai 的創辦人和其他支持者認為,普及化存取未經審查的尖端模型是最好的防禦形式。

Devon 說:「Abliteration 模型的宏觀意義在於它們能夠模擬惡意行為者。優勢在於防禦者現在可以盡快行動。他們擁有所有必要的工具來模擬這些惡意行為者,然後防禦這些惡意行為,我認為這將加速網路安全,這是一種反直覺的觀點。」

Devon 表示,儘管 Abliteration.ai 仍是一家年輕公司,但其客戶包括幾家位於英國和歐洲的早期紅隊演練新創公司,這些公司協助銀行、航空公司和其他處理關鍵基礎設施的企業加強網路安全實踐。

Devon 說:「我們的一個主要客戶為銀行的代理程式進行紅隊演練,他們今天無法直接使用現成的模型來對這些代理程式進行紅隊演練。」

同時,網路安全產業仍在摸索 Abliteration 模型在防禦工作中是否以及如何發揮作用。

TechCrunch 採訪的幾家代理程式紅隊演練公司同意 Devon 的觀點,即惡意行為者已經在對自己的模型進行 Abliteration,並利用它們執行對抗性攻擊,這證明了防禦者擁有相同工具的實用性。但他們對於 Abliteration 模型在整個過程中究竟有多重要,意見不一。

Devon 堅稱 Abliteration 模型對於執行徹底的代理程式紅隊演練至關重要,但有些人表示他們在日常工作中不使用這些模型,而是依賴於微調開源權重模型的便利性,這些模型本身就很少有安全護欄,來進行測試。

代理程式紅隊演練公司 Fabraix 的執行長 Ahmed Aly 表示,他的公司更依賴微調開源模型,而不是使用 Abliteration 模型,並補充說 Abliteration 過程會移除模型的一些知識和能力。

Aly 告訴 TechCrunch:「如果你真的想用它來造成實際危害,網路危害、生物危害,它不會那麼有效。」

Safe Intelligence 的首席技術專家 Alessio Lomuscio 同意能力可能會降低,但他仍然相信 Abliteration 模型可以引出某些行為,這對於系統的壓力測試很有用。

網路安全平台 Armadin 的創辦人兼首席架構師 David Slater 告訴 TechCrunch:「到目前為止,Abliteration 模型還不是我們流程的一部分。當我們審視直到最新一代的開源權重模型時,越獄它們並讓它們做我們想做的事情並不是特別困難。」

不過,他補充說 Armadin 正在研究 Abliteration,並認為「推動開放社群理解模型的能力至關重要」。

Slater 繼續說:「這將在幕後發生。這將在私下發生。它在公開場合發生,為研究人員提供了工具。它讓我們能夠弄清楚實際的邊界是什麼樣子,並理解其危害。」