歡迎閱讀 Import AI,一份關於 AI 研究的電子報。Import AI 的內容基於 arXiv 論文和讀者回饋。如果您想支持我們,請訂閱。
糟糕,網路攻擊也出現了規模化競爭!_…系統越智慧,網路攻擊能力越強…_ AI 安全研究組織 Lyptus Research 針對 AI 系統執行各種網路攻擊任務的能力進行了研究,發現一個明確的趨勢:越先進的模型,越能執行更複雜的網路攻擊。
他們寫道:「自 2019 年以來發布的尖端模型,其能力倍增時間為 9.8 個月。若僅限於 2024 年以來發布的模型,則縮短至 5.7 個月。我們研究中最新的尖端模型 GPT-5.3 Codex 和 Opus 4.6,表現均超越這兩條趨勢線,在人類專家需分別花費 3.1 小時和 3.2 小時完成的任務上,達到了 50% 的成功率。」
他們補充:「我們最新的開源模型 GLM-5 落後閉源尖端模型 5.7 個月,這表明尖端網路攻擊能力可能在相對短的時間內擴散到開源形式。」
他們研究了哪些基準測試? CyBashBench、NL2Bash、InterCode CTF、NYUCTF、CyBench、CVEBench 和 CyberGym。
他們還建立了一個新的資料集,包含 291 項任務,附有完成記錄和由 10 名攻擊性網路安全專業人員校準的時間估計。
評估模型: 2019 年: GPT-2。2020 年: GPT-3。2022 年: GPT-3.5。2024 年: Claude 3 Opus、GPT-4o。2025 年: o3、Opus 4、Gemini 2.5 Pro、DeepSeek V3.1、GPT-5.1 Codex Max、GPT-5.2 Codex。
2026 年: Opus 4.6、GPT-5.3 Codex、GLM-5、Sonnet 4.6。
結果: AI 系統在駭客攻擊方面表現出色。他們寫道:「目前最佳的模型在人類專家需花費 3.2 小時(約半個工作日的專業攻擊性安全工作)完成的任務上,達到了 50% 的成功率。」
為何這很重要,所有事物都在進步,包括那些令人不安的: 能夠進行生物學研究的 AI,也能用於生物武器研究。能協助您學習高能物理的 AI,也能用於武器開發的高能物理。特別擅長協助您發現程式碼漏洞以進行防禦的 AI,也能輕易地轉用於攻擊目的。AI 最具挑戰性的一點是它就像一台「萬能機器」,隨著每一代模型的能力在廣泛領域中不斷擴展,相關的政策問題也隨之倍增。
延伸閱讀: 攻擊性網路安全時間範圍 (Lyptus Research)。
獲取資料: 攻擊性網路任務範圍:資料與分析 (Lyptus Research, GitHub)。
***
內部採用 AI 的新創公司比未採用者更成功:_…商學院研究顯示新創公司如何從 AI 採用中受益…_ INSEAD 和哈佛商學院的研究人員指出,學習如何將 AI 整合到其業務中的新創公司,其表現顯著優於未整合者。這項研究規模相當大且具說服力:「我們對 515 家高成長新創公司進行了一項實地實驗,其中實驗組公司獲得了其他公司如何圍繞 AI 重組生產流程的資訊,促使他們在更廣泛的公司職能中尋找使用案例。」
他們寫道:「我們發現實驗組公司發現了更多的 AI 使用案例,增加了 44%,主要集中在產品開發和策略領域。這些變化帶來了具有經濟意義的績效提升。實驗組公司完成了 12% 更多的任務,獲得付費客戶的可能性高出 18%,並產生了 1.9 倍的更高營收。」
他們如何進行測試: 作者們在「AI 創辦人衝刺營」(INSEAD 舉辦的一個為期三個月的全球虛擬新創加速器)的參與者身上進行了這項實驗。參與者獲得了 API 額度、尖端模型的存取權限,以及來自一些技術合作夥伴(包括 OpenAI 和 Manus)的新手入門課程,每家公司總計約 25,000 美元的實物贊助。
他們進行了加速器參與者通常會做的事情,動手實作課程以學習建立業務的技術(包括 AI),以及推銷公司和參加展示日。但這些公司也接觸到一個重要變數:部分學員參加了工作坊,學習了 AI 如何被某些企業成功應用的具體細節。
AI 的應用: 部分企業學習了直接的商業使用案例,例如:
- Gamma: 他們學習了這家新創公司如何利用 AI 直接偵測「使用模式並生成產品變體,使單一產品經理能夠持續推出功能,而這些功能過去需要整個團隊才能完成。」
- Ryz Labs: 創辦人描述了他們如何改變產品開發方式:「創辦人撰寫產品需求文件,並同時將其輸入多個 AI 編碼工具,以多種方式建構相同的想法,而不是只押注單一方法。」
- FazeShift: 展示了如何透過 AI 自動化應收帳款流程,跳過人工步驟。
- Ranger: 說明了如何利用 AI 啟動新創公司、獲得初期動能、提高利潤,然後在業務更成熟時再募資,這讓他們能以更好的條件募得資金。
結果非常顯著: 他們寫道:「實驗組公司發現了 2.7 個額外的 AI 使用案例(增加了 44%),這些案例涵蓋了公司更廣泛的活動,尤其集中在產品開發和策略相關領域。AI 使用的這些變化帶來了可衡量的績效提升:與對照組公司相比,實驗組公司完成了 12% 更多的任務,獲得付費客戶的可能性高出 11 個百分點(18%),最終產生了 1.9 倍的更高營收。」
「將 AI 使用案例與實驗組分配掛鉤,表明每個由實驗組促成的額外 AI 使用案例,能帶來 0.85 個額外完成的任務和約 26% 的更高營收。這些都是巨大的影響,表明當企業能夠將 AI 應用於其生產流程時,AI 正在根本性地重塑企業的擴展方式……實驗組企業在勞動力或資本沒有同比例增加的情況下實現了更快的成長,這與早期技術浪潮中實驗和擴展成本的降低是一致的。」
資本效率: 「實驗組公司報告的資金需求比對照組公司少了約 220,000 美元,減少了 39.5%(p < 0.05),且勞動力需求沒有相應增加。」
內部加速: 實驗組公司傾向於比對照組多完成 2.2 項內部任務,內部任務例如開發產品或製作財務預測。
創辦人的想法:
- 「一位實驗組創辦人反思道:『這種思維轉變從根本上改變了我們在 [REDACTED] 的建構方式。我開始將 AI 工具視為專業知識的倍增器,而非替代品。』」
- 「另一位解釋說:『短短幾個小時內,我就能產出過去需要外包開發團隊花費 1,000 美元才能完成的成果。』」
為何這很重要,AI 企業將超越非 AI 企業: 這裡的主要啟示是,深入且精密的內部 AI 加速應用,能讓早期階段公司比那些未將 AI 嵌入其核心的公司更具競爭力。這在直覺上是合理的,那些圍繞先前技術建立的公司往往能超越未採用者(想想網路時代的 Amazon 對比 Barnes and Noble,或是客戶端個人電腦取代大型主機,Microsoft 對比 IBM)。
同時,這也確實意味著,我們將看到 AI 首先在經濟中展現影響的方式之一,將是出現一類新的競爭性企業,它們在資本效率上更高(部分原因在於僱用更少的人),並取代現有企業。
對於政府而言,要超前這股趨勢,需要投入嚴肅的教育:「我們的研究結果表明,瓶頸不在於技術本身,而在於管理層如何發現技術在企業生產流程中創造價值的挑戰。」他們寫道:「教導經理人和創業家如何解決這個對應問題,可能與確保他們能取得技術本身一樣重要。」
延伸閱讀: 將 AI 應用於生產:一項關於企業績效的實地實驗 (SSRN)。
***
麻省理工學院:到 2029 年,自動化浪潮將使 AI 足以勝任大多數文本型任務:_…如何徹底改變一個經濟體?漸進且持續地…_ 麻省理工學院的研究人員審視了基於 O-NET 職務類別的 3,000 項任務,並結合了 17,000 份由執行這些任務的員工提供的評估,試圖找出 AI 的崛起如何改變工作。
他們的研究結果「意味著,對於現實且具代表性的文本型或部分文本型勞動市場任務,AI 能力已相當可觀並準備廣泛擴展。然而,進展並非以一次性轉變特定任務的『巨浪』形式出現,而是通常類似於『漲潮』,在許多任務中同時實現廣泛的提升。」
他們研究了什麼: 在這項研究中,他們旨在探討 AI 能力的提升是會帶來對勞動力造成破壞性影響的快速、不連續變化(「巨浪」),還是 AI 正以一種廣泛且可預測的方式變得更強大,從而導致更漸進的自動化(「漲潮」)。他們寫道:「我們幾乎沒有發現『巨浪』的證據,但有充分證據表明『漲潮』是 AI 自動化的主要形式。」
與 METR 分析互補: 這項調查也驗證了 METR 著名的基於時間的 AI 能力框架中發現的廣泛趨勢,該框架認為 AI 系統正在迅速擴展其執行某些狹窄任務的時間範圍。
當應用於更廣泛的職務時,麻省理工學院的研究人員發現,「在 2024 年第二季度到 2025 年第三季度之間,尖端模型從在 3 到 4 小時任務上達到 50% 成功率,進步到在 1 週任務上達到 50% 成功率;並從在 1 分鐘任務上達到 70% 成功率,進步到在 1 小時任務上達到 70% 成功率。」
他們寫道:「在大量現實且具代表性的、可由大型語言模型處理的勞動市場任務中,任務成功率與任務持續時間之間的下降斜率,平均而言出乎意料地平坦,也就是說,它更符合『漲潮』而非『巨浪』的模式……特定『職務類別』(例如管理或社區與社會服務)內的自動化,在大多數情況下也遵循相同的『漲潮』模式。」
別被「漸進」所迷惑: 他們寫道:「預計的進步是漸進而非突然的。然而,對於大多數文本型勞動市場任務而言,達到高成功率的改進速度仍然相當可觀;預計到 2029 年,大多數任務將在最低足夠的品質水準下達到 80%–95% 的 AI 成功率(我們調查中的大多數任務為數小時長,對應 2029 年接近 90% 的成功率)。」
換句話說,儘管這種顛覆是漸進且可預測的,我們不應低估「漲潮」現象對經濟造成大規模變革的潛力。
為何這很重要,勞動力將如何因應 AI 而改變? 對於全球經濟而言,價值數十兆美元的問題是 AI 將如何改變勞動力(人類)與資本(運行合成工作者的電腦)之間的分配。這項研究表明,雖然我們可能不會看到突然、劇烈的勞工取代,但我們將會看到



