OpenAI 今天推出了 GPT-6 Astra,這是他們首款 Stargate 和輕度循環的超級模型,在多項指標上完勝 Fable 5.1。它在最困難的 FrontierMath (97.6%) 和 ARC-AGI-3 (99.9%) 版本中達到近乎飽和的表現。許多演示將聚焦於典型的應用,從電腦使用、玩寶可夢、到 Blender,再到科學和網路安全基準測試。
Greg 說 AGI 已經到來,而 Jakub 則表示這終於是他一直想要的自動化 AI 研究實習生。我們沒有資格談論這些,但我們獲得了早期使用權限,並將其應用於我們能想到的一切實際生活任務。在消耗了超過 200 億個 Astra token 後,我們證實了最令人驚訝的發現:GPT-6 Astra 屬於一類新型模型,它們本身就是完全稱職的 AI 工程師。
它們現在能幫助你選擇和訓練模型、標註數據(既能幫助你標註,也能利用你的標註進行主動學習,例如 SAM)、保持管線飽和、監控並讀取日誌、一次性部署和偵錯整個系統、分派、指揮和評估子代理(包括運行其他模型的代理),並在單一代理執行緒中保持數十億個 token 的連貫性。
我們之前曾撰文討論過提高對大型語言模型期望的高回報活動。我們的經驗讓我們比以往任何時候都更加雄心勃勃。在過去一個月裡,我們從發起有趣的「淘汰我的 SaaS」競賽,轉變為構建十幾個內部/個人工具。
這包括 4 個以前需要付費的 SaaS 工具、完全重新設計我的個人網站、製作了一個不完整但功能齊全的 GitHub + Vercel 替代品、為一款合法走法比圍棋多一萬倍的策略桌遊訓練 AI、在個人財務清理上節省了數萬美元、重新出版了我的舊書並同步了有聲書音頻和實體印刷版,以及更多我們即將推出的雄心勃勃的專案。
每小時 6 美元的數字可能聽起來令人驚訝,但這正是我們在測試中看到的結果,在每百萬 token 最高 50 美元的費率下,每秒處理 33 個 token。鑑於 Astra 比 Sol 和 Fable 的 token 效率更高(經 Artificial Analysis 獨立證實),這通常意味著 Astra 同時也是你能買到的最佳快速且聰明的模型(假設我們的預覽版延遲能維持到正式發布),僅次於 Spark 1.3。
當然,如果你只是在 Ultra 上啟動 Astra,你每小時的花費將遠不止 6 美元,因為它非常擅長平行處理。根據實際任務,我們通常會同時啟動 20 到 50 個代理,當然所有這些都由一個主要的 Astra 代理管理。
這基本上就是你支付給初級 AI 工程師的工作,監控運行、審視數據、找出問題、修復、重新運行,週而復始。你可以每天花 200-1000 美元聘請一個人,或者花 100 美元聘請 GPT-6 兩天來完成這項工作。
因為你當然需要所有這些能力來運行你自己的 AI 工程計畫,因為 OpenAI 內部已經使用 GPT-6 來執行這些任務。
或者你可以讓 Astra 輕鬆打造你自己的個人 Arena.ai 克隆,用於微調提示詞、為你的任務選擇模型,或調整你自己的偏好模型!你應該得出的總體結論是,OpenAI 顯然已經訓練出一個能夠自動化大部分自身 AI 工程工作的模型。現在是時候學習如何善用 Astra 和 Fable 等級的模型,並對現在能用代理完成的事情抱持更不切實際的期望了。



