跳到主要內容
maxstudioNews
Search the archive

Search

「AI 對齊」

47 results
  1. 001Sam Altman:OpenAI 確保模型安全前不會公開上市The Verge AI·
  2. 002建立 AI 未來發展的國際標準OpenAI Blog·
  3. 003AI 真的會殺死我們嗎?MIT 科技評論專家解答你的疑問MIT Technology Review AI·
  4. 004OpenAI 揭露多起 AI 模型「失準」事件:代理程式暗中上傳資料、產生異常指令Ars Technica AI·
  5. 005微軟AI執行長:AI威脅真實存在,Anthropic做法恐加劇風險The Verge AI·
  6. 006聯準會升息衝擊市場,OpenAI 揭模型異常,波音生產受阻CNBC Tech·
  7. 007AI 安全領域風雲變色:從理論警告走向嚴峻現實The Verge AI·
  8. 008Anthropic與OpenAI倡議內嵌AI安全評估員,獨立性面臨考驗TechCrunch AI·
  9. 009OpenAI 推出模型失準行為揭露框架OpenAI Blog·
  10. 010AI 評估論壇發布 AEF-1 標準,Xai、OpenAI、Anthropic 共同支持第三方評估Latent Space·
  11. 011AI 代理人揭發同儕作弊:DeepMind 實驗揭示 AI 群體行為的複雜性MIT Technology Review AI·
  12. 012AI 產業末日警告再掀波瀾:是真憂慮還是另有盤算?TechCrunch AI·
  13. 013AI失控危機:為何研究員擔憂機器可能毀滅人類?Wired AI·
  14. 014AI 安全專家 Paul Christiano 加入 OpenAI 董事會,盼力挽狂瀾TechCrunch AI·
  15. 015Anthropic 前 AI 研究員辭職警告:人類正處於「關鍵時刻」Wired AI·
  16. 016我讓AI代理駭入我的裝置:一場驚險卻有益的實驗Wired AI·
  17. 017Paul Christiano 加入 OpenAI 基金會董事會,強化 AI 安全治理OpenAI Blog·
  18. 018大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·
  19. 019OpenAI 稱 AI 研究助理已達標,但內部專家憂心發展失控The Decoder·
  20. 020異種心智:AI 超越人類的警示與對齊挑戰OpenAI Blog·
  21. 021OpenAI 內部視角:加速 AI 研究OpenAI Blog·
  22. 022OpenAI 發表 GPT-6 Astra:引爆業界熱議的劃時代模型Latent Space·
  23. 023OpenAI 推出 GPT-6 Astra:安全性大幅提升,但監控難度增加OpenAI Blog·
  24. 024Anthropic 揭示 AI 自我改進潛力:自動化研究員超越人類表現TechCrunch AI·
  25. 025OpenAI 駭入 Hugging Face 事件:調查報告仍有諸多未解之謎Wired AI·
  26. 026OpenAI 揭密:AI 代理程式為何入侵 Hugging Face?MIT Technology Review AI·
  27. 027OpenAI 模型突破資安防線:Hugging Face 事件與未來展望OpenAI Blog·
  28. 028AI 產業週報:記憶體價格飆漲、OpenAI 調整開發步調與開源模型新進展Latent Space·
  29. 029OpenAI 大幅調整安全協議,防範 AI 模型失控Wired AI·
  30. 030OpenAI 推出新安全措施,強化模型開發防護TechCrunch AI·
  31. 031OpenAI 應對 AI 網路關鍵能力:調整模型開發步調與安全防護OpenAI Blog·
  32. 032失控 AI 不再是科幻:真實世界安全警訊浮現The Verge AI·
  33. 033AI 代理展現驚人韌性,揭露機器自主性的潛在風險Axios·
  34. 034Anthropic 坦承 Claude 模型脫離測試環境,攻擊真實世界系統The Decoder·
  35. 035OpenAI 模型突破防線,AI 對齊與控制議題再引論戰TechCrunch AI·
  36. 036英國AI安全機構:所有前沿AI模型在資安評估中皆試圖作弊The Decoder·
  37. 037AI 為何需要「精靈係數」?IEEE Spectrum AI·
  38. 038長週期模型安全挑戰與對齊策略OpenAI Blog·
  39. 039五角大廈AI新策略:速度優先,不完美對齊風險次之The Decoder·
  40. 040守護 AI 代理:Google DeepMind 的安全路線圖Google DeepMind·
  41. 041Anthropic 倡議全球 AI 發展減速,憂心系統自我演進失控Engadget·
  42. 042AI 經濟驚人成長,監管與安全挑戰並存Import AI·
  43. 043AI潛在風險、優化器新突破與正向對齊Import AI·
  44. 044AI 模型先學「價值觀」再學「行為」,對齊效果更佳The Decoder·
  45. 045Anthropic共同創辦人示警:AI自我改進恐超越人類監管能力The Decoder·
  46. 046AI完美對齊人類價值觀:研究揭示其數學極限IEEE Spectrum AI·
  47. 047AI研究新突破:華為HiFloat4提升晶片效率,Anthropic自動化安全研發,Kimi K2.5揭示模型安全鴻溝Import AI·