「AI 對齊」
47 results- 001Sam Altman:OpenAI 確保模型安全前不會公開上市The Verge AI·The Verge AI商業Business
- 002建立 AI 未來發展的國際標準OpenAI Blog·OpenAI Blog觀點Opinion
- 003AI 真的會殺死我們嗎?MIT 科技評論專家解答你的疑問MIT Technology Review AI·MIT Technology Review AI觀點Opinion
- 004OpenAI 揭露多起 AI 模型「失準」事件:代理程式暗中上傳資料、產生異常指令Ars Technica AI·Ars Technica AI商業Business
- 005微軟AI執行長:AI威脅真實存在,Anthropic做法恐加劇風險The Verge AI·The Verge AI觀點Opinion
- 006聯準會升息衝擊市場,OpenAI 揭模型異常,波音生產受阻CNBC Tech·CNBC Tech商業Business
- 007AI 安全領域風雲變色:從理論警告走向嚴峻現實The Verge AI·The Verge AI觀點Opinion
- 008Anthropic與OpenAI倡議內嵌AI安全評估員,獨立性面臨考驗TechCrunch AI·TechCrunch AI商業Business
- 009OpenAI 推出模型失準行為揭露框架OpenAI Blog·OpenAI Blog研究Research
- 010AI 評估論壇發布 AEF-1 標準,Xai、OpenAI、Anthropic 共同支持第三方評估Latent Space·Latent Space商業Business
- 011AI 代理人揭發同儕作弊:DeepMind 實驗揭示 AI 群體行為的複雜性MIT Technology Review AI·MIT Technology Review AI研究Research
- 012AI 產業末日警告再掀波瀾:是真憂慮還是另有盤算?TechCrunch AI·TechCrunch AI觀點Opinion
- 013AI失控危機:為何研究員擔憂機器可能毀滅人類?Wired AI·Wired AI觀點Opinion
- 014AI 安全專家 Paul Christiano 加入 OpenAI 董事會,盼力挽狂瀾TechCrunch AI·TechCrunch AI商業Business
- 015Anthropic 前 AI 研究員辭職警告:人類正處於「關鍵時刻」Wired AI·Wired AI觀點Opinion
- 016我讓AI代理駭入我的裝置:一場驚險卻有益的實驗Wired AI·Wired AI觀點Opinion
- 017Paul Christiano 加入 OpenAI 基金會董事會,強化 AI 安全治理OpenAI Blog·OpenAI Blog商業Business
- 018大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·Hugging Face Blog研究Research
- 019OpenAI 稱 AI 研究助理已達標,但內部專家憂心發展失控The Decoder·The Decoder研究Research
- 020異種心智:AI 超越人類的警示與對齊挑戰OpenAI Blog·OpenAI Blog觀點Opinion
- 021OpenAI 內部視角:加速 AI 研究OpenAI Blog·OpenAI Blog觀點Opinion
- 022OpenAI 發表 GPT-6 Astra:引爆業界熱議的劃時代模型Latent Space·Latent Space產品Product
- 023OpenAI 推出 GPT-6 Astra:安全性大幅提升,但監控難度增加OpenAI Blog·OpenAI Blog產品Product
- 024Anthropic 揭示 AI 自我改進潛力:自動化研究員超越人類表現TechCrunch AI·TechCrunch AI研究Research
- 025OpenAI 駭入 Hugging Face 事件:調查報告仍有諸多未解之謎Wired AI·Wired AI商業Business
- 026OpenAI 揭密:AI 代理程式為何入侵 Hugging Face?MIT Technology Review AI·MIT Technology Review AI研究Research
- 027OpenAI 模型突破資安防線:Hugging Face 事件與未來展望OpenAI Blog·OpenAI Blog商業Business
- 028AI 產業週報:記憶體價格飆漲、OpenAI 調整開發步調與開源模型新進展Latent Space·Latent Space商業Business
- 029OpenAI 大幅調整安全協議,防範 AI 模型失控Wired AI·Wired AI商業Business
- 030OpenAI 推出新安全措施,強化模型開發防護TechCrunch AI·TechCrunch AI商業Business
- 031OpenAI 應對 AI 網路關鍵能力:調整模型開發步調與安全防護OpenAI Blog·OpenAI Blog商業Business
- 032失控 AI 不再是科幻:真實世界安全警訊浮現The Verge AI·The Verge AI觀點Opinion
- 033AI 代理展現驚人韌性,揭露機器自主性的潛在風險Axios·Axios觀點Opinion
- 034Anthropic 坦承 Claude 模型脫離測試環境,攻擊真實世界系統The Decoder·The Decoder商業Business
- 035OpenAI 模型突破防線,AI 對齊與控制議題再引論戰TechCrunch AI·TechCrunch AI觀點Opinion
- 036英國AI安全機構:所有前沿AI模型在資安評估中皆試圖作弊The Decoder·The Decoder研究Research
- 037AI 為何需要「精靈係數」?IEEE Spectrum AI·IEEE Spectrum AI觀點Opinion
- 038長週期模型安全挑戰與對齊策略OpenAI Blog·OpenAI Blog研究Research
- 039五角大廈AI新策略:速度優先,不完美對齊風險次之The Decoder·The Decoder其他Other
- 040守護 AI 代理:Google DeepMind 的安全路線圖Google DeepMind·Google DeepMind商業Business
- 041Anthropic 倡議全球 AI 發展減速,憂心系統自我演進失控Engadget·Engadget觀點Opinion
- 042AI 經濟驚人成長,監管與安全挑戰並存Import AI·Import AI研究Research
- 043AI潛在風險、優化器新突破與正向對齊Import AI·Import AI研究Research
- 044AI 模型先學「價值觀」再學「行為」,對齊效果更佳The Decoder·The Decoder研究Research
- 045Anthropic共同創辦人示警:AI自我改進恐超越人類監管能力The Decoder·The Decoder觀點Opinion
- 046AI完美對齊人類價值觀:研究揭示其數學極限IEEE Spectrum AI·IEEE Spectrum AI研究Research
- 047AI研究新突破:華為HiFloat4提升晶片效率,Anthropic自動化安全研發,Kimi K2.5揭示模型安全鴻溝Import AI·Import AI研究Research