跳到主要內容
maxstudioNews
Search the archive

Search

「模型安全」

35 results
  1. 001OpenAI研究長:不會因資安事件自毀前程,已加強AI模型安全監控MIT Technology Review AI·
  2. 002Sam Altman:OpenAI 確保模型安全前不會公開上市The Verge AI·
  3. 003大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·
  4. 004AI 模型更新競速引發「模型疲勞」:企業用戶難以跟上腳步CNBC Tech·
  5. 005OpenAI 代理再傳駭入事件,AI 模型安全風險浮現Wired AI·
  6. 006Abliteration.ai 推出服務,移除 AI 模型安全護欄引發爭議TechCrunch AI·
  7. 007OpenAI 與 Anthropic 在 IPO 前夕,力求平衡 AI 安全與商業發展Axios·
  8. 008Hugging Face 遭駭後,OpenAI 延遲新模型 Astra 開發以強化安全The Verge AI·
  9. 009Anthropic Claude Opus 4.6 遭揭露易生成色情內容,安全防護形同虛設TechCrunch AI·
  10. 010OpenAI 網路安全計畫出包:部分研究員存取權遭撤銷TechCrunch AI·
  11. 011新方法揭露AI模型內部思維,恐洩個資並助長模型蒸餾Wired AI·
  12. 012以色列新創Irregular揭露OpenAI、Anthropic與Meta的AI模型安全漏洞CNBC Tech·
  13. 013Anthropic Claude 模型安全測試失誤,意外入侵三家企業Ars Technica AI·
  14. 014前沿 AI 模型越獄測試揭露安全漏洞,監管呼聲再起Wired AI·
  15. 015AI 模型安全護欄成雙面刃:資安研究員憂影響防禦能力TechCrunch AI·
  16. 016「AI 每週回顧」第 252 集:GPT-5.6、Grok 4.5 激戰,Meta 雲端佈局與 AI 政策新動態Last Week in AI·
  17. 017長週期模型安全挑戰與對齊策略OpenAI Blog·
  18. 018OpenAI 打造 LLM 超級駭客 GPT-Red,大幅提升模型安全性MIT Technology Review AI·
  19. 019GPT-Red:透過自動化紅隊演練提升模型安全性與韌性OpenAI Blog·
  20. 020我如何將 AI 導向黑暗面:大型語言模型安全漏洞揭秘IEEE Spectrum AI·
  21. 021川普政府解除Anthropic AI模型出口限制,Mythos與Fable將重返國際市場TechCrunch AI·
  22. 022Anthropic Claude Fable 5 模型獲准恢復上線,解除出口管制The Verge AI·
  23. 023OpenAI 研究揭示:少量「有益特徵」訓練可大幅提升 AI 模型安全性與抗操控性The Decoder·
  24. 024白宮要求 Anthropic 杜絕 AI 越獄,專家稱難以實現Wired AI·
  25. 025Anthropic 與白宮就 Claude Fable 5 越獄疑慮持續角力Wired AI·
  26. 026「他們搞砸了我們」:Anthropic 模型因與政府衝突而下線Axios·
  27. 027川普簽署AI安全測試行政命令,專家憂實效不足Ars Technica AI·
  28. 028佛州控告OpenAI與Sam Altman:ChatGPT涉暴力事件引發安全疑慮TechCrunch AI·
  29. 029AI 模型第三方評估:OpenAI 的信任指南OpenAI Blog·
  30. 030OpenAI 釋出進階版 GPT-5.5 助資安防禦者強化網路安全Axios·
  31. 031穆拉蒂法庭作證:不信任奧特曼言論The Verge AI·
  32. 032川普政府研議AI模型安全審查,強化政府應用資安防線Axios·
  33. 033AI科技週報:GPT-5.5、DeepSeek V4 模型新進展與AI安全挑戰Last Week in AI·
  34. 034AI研究新突破:華為HiFloat4提升晶片效率,Anthropic自動化安全研發,Kimi K2.5揭示模型安全鴻溝Import AI·
  35. 035Meta AI 強化先進模型安全框架與測試機制Meta AI Blog·