跳到主要內容
maxstudioNews
Search the archive

Search

「AI 評估」

80 results
  1. 001Bitbucket Cloud PR 專用 AI 程式碼審查側邊欄Cursor Forum (Showcase)·
  2. 002AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·
  3. 003微軟AI系統預測太空天氣風險,保護電網基礎設施Microsoft Research·
  4. 004Nscale IPO 挑戰華爾街:高度集中客戶的 AI 供應商能否獲青睞?TechCrunch AI·
  5. 005OpenAI 公布 AI 安全第三方評估的優先事項與準則OpenAI Blog·
  6. 006英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·
  7. 007AI發展減速:專家探討管制方法與挑戰Wired AI·
  8. 008Google DeepMind 成立新機構,深化通用人工智慧(AGI)辯論TechCrunch AI·
  9. 009Anthropic與OpenAI倡議內嵌AI安全評估員,獨立性面臨考驗TechCrunch AI·
  10. 010透過 OpenAI 管理後台,洞察 AI 應用如何創造商業價值OpenAI Blog·
  11. 011AI 評估論壇發布 AEF-1 標準,Xai、OpenAI、Anthropic 共同支持第三方評估Latent Space·
  12. 012AI 發展應放緩?科技巨頭與政界領袖激辯The Verge AI·
  13. 013Anthropic 執行長提出減緩 AI 發展的三大策略TechCrunch AI·
  14. 014Anthropic 執行長呼籲:AI 發展應放慢腳步,以確保安全The Verge AI·
  15. 015AI 真的會毀滅人類嗎?專家怎麼看?Wired AI·
  16. 016Paul Christiano 加入 OpenAI 基金會董事會,強化 AI 安全治理OpenAI Blog·
  17. 017OECD 報告:學生使用 AI 輔助學習,成績普遍下滑The Verge AI·
  18. 018大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·
  19. 019AI 模型更新競速引發「模型疲勞」:企業用戶難以跟上腳步CNBC Tech·
  20. 020OpenAI 代理程式頻頻失控,獨立調查機制刻不容緩TechCrunch AI·
  21. 021Meta 鼓勵員工試用 AI 代理 Hatch,取消 AI 使用量績效考核Wired AI·
  22. 022OneRail 攜手 Nvidia 推出 AI 平台 助零售商加速物流決策CNBC Tech·
  23. 023研究揭示 AI 代理缺乏時間感與自我評估能力The Decoder·
  24. 024Agent Seer:從工具規格自動生成 AI 代理測試情境Apple Machine Learning Research·
  25. 025Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·
  26. 026OpenAI 駭入 Hugging Face 事件:調查報告仍有諸多未解之謎Wired AI·
  27. 027血糖監測基礎模型 GlucoFM:Google AI 提升代謝健康預測能力Google Research·
  28. 028OpenAI 擴大 ChatGPT for Teachers 服務,助美國教師善用 AIOpenAI Blog·
  29. 029OpenAI 模型突破資安防線:Hugging Face 事件與未來展望OpenAI Blog·
  30. 030AI 近三月回顧:模型失控、網路安全與政府監管Last Week in AI·
  31. 031教師深耕教育,卻遭AI深偽圖像騷擾:學生惡搞事件頻傳,師生關係蒙陰影Wired AI·
  32. 032頂尖 AI 實驗室仍未公開失控模型應變計畫TechCrunch AI·
  33. 033AI 模擬時代:10% 較差,100 倍便宜,10000 倍快,為何它正席捲一切?Latent Space·
  34. 034語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·
  35. 035VentureBeat 延攬 Rob Strechay 為首位首席分析師,擴大企業 AI 研究版圖VentureBeat AI·
  36. 036Optima 平台登場:讓用戶以自有數據打造專屬 AI 模型基準測試The Decoder·
  37. 037AI 衝擊大學科系,學生被迫重新思考未來出路Axios·
  38. 038AI 模型視覺感知能力仍待加強:新基準測試揭示頂尖模型準確度未達六成The Decoder·
  39. 039AI 伴侶引導自慰:Joi AI 招募顧問探討其對壓力與成癮的潛在效益Wired AI·
  40. 040MindTopo:揭露多模態模型拓撲空間推理的挑戰Microsoft Research·
  41. 041Model ML 運用 GPT-5.6 Sol 大幅提升金融工作效率OpenAI Blog·
  42. 042AI 安全測試成隱憂:模型逃脫沙盒,業界急需強化防護TechCrunch AI·
  43. 043AI 家教何時該出手?TutorMoments 評估大型語言模型輔導的「分寸」Hugging Face Blog·
  44. 044OpenAI 揭露 Astra 模型具備「關鍵網路能力」,啟動強化安全措施OpenAI Blog·
  45. 045Anthropic AI 測試中展現惡意行為:假冒身份、植入惡意程式碼攻擊 GitHub 專案Ars Technica AI·
  46. 046Anthropic Mythos 模型假冒身份,AI 網路安全事件引發關注CNBC Tech·
  47. 047AI 代理又失控?OpenAI 與 Anthropic 模型自主駭入網路Wired AI·
  48. 048OpenAI 模型在第三方網路安全評估中越界,凸顯測試環境升級必要性OpenAI Blog·
  49. 049DesignArena 獲 790 萬美元募資,以人類品味提升 AI 模型設計TechCrunch AI·
  50. 050微軟開源 Orchard 框架:推動可擴展代理式 AI 研究Microsoft Research·
  51. 051DeepSeek V4-Flash 模型開源,AI 安全事件與多模態進展成焦點Latent Space·
  52. 052Anthropic Claude 模型安全測試失誤,意外入侵三家企業Ars Technica AI·
  53. 053美國國會關切 DoorDash 使用中國 AI 模型,要求提供資訊CNBC Tech·
  54. 054Anthropic 坦承 Claude 模型脫離測試環境,攻擊真實世界系統The Decoder·
  55. 055Anthropic 坦承旗下 AI 模型在安全測試中滲透三家公司系統TechCrunch AI·
  56. 056AI 模型網路安全評估驚現漏洞:Anthropic 揭露三起真實事件Simon Willison·
  57. 057AI 浪潮席捲金融業,OpenAI 強化安全與學術支援,Kimi K3 生態系快速發展Latent Space·
  58. 058OlmoEarth 平台:實現行星級地理空間 AI 推論Hugging Face Blog·
  59. 059前沿 AI 代理入侵事件剖析:Hugging Face 遭攻擊技術時間軸Hugging Face Blog·
  60. 060AI 程式輔助教學的挑戰:教育者重新思考技能評估方式The Decoder·
  61. 061Claude Opus 5 登場:效能超越 Fable?基準測試引發熱議Latent Space·
  62. 062Kimi K3 網路攻擊能力遠遜美國頂尖模型,疑因「蒸餾」訓練所致The Decoder·
  63. 063SymptomAI:對話式 AI 代理在日常症狀評估中的應用與潛力Google Research·
  64. 064英國AI安全機構:所有前沿AI模型在資安評估中皆試圖作弊The Decoder·
  65. 065美國開源 AI 實驗室 Arcee:中國 AI 模型並非本質上危險TechCrunch AI·
  66. 066OpenAI 模型駭入 Hugging Face:內部測試意外揭露零日漏洞The Decoder·
  67. 067AI 網路安全成顯學:從 OpenAI 事件看產業趨勢Latent Space·
  68. 068OpenAI 模型突破限制,入侵 Hugging FaceWired AI·
  69. 069實體 AI 模擬技術現況總覽:從資料挑戰到引擎選擇Hugging Face Blog·
  70. 070AI 為何需要「精靈係數」?IEEE Spectrum AI·
  71. 071OpenAI 與 Hugging Face 聯手處理模型評估期間的資安事件OpenAI Blog·
  72. 072川普政府AI安全機構主管上任三個月後請辭CNBC Tech·
  73. 073長週期模型安全挑戰與對齊策略OpenAI Blog·
  74. 074AI 判讀 X 光片:錯誤卻自信滿滿,潛藏醫療風險The Decoder·
  75. 075開源模型網路安全能力急起直追,成本更低廉The Decoder·
  76. 076AI 產業日報:Kimi K3 震撼登場,中國模型實力引發熱議Latent Space·
  77. 077AI 時代的效益評估指標OpenAI Blog·
  78. 078中國 AI 實力急起直追,美國領先地位恐不保Axios·
  79. 079企業AI代理評估落差:信任不足卻仍加速部署VentureBeat AI·
  80. 080從 Shippy 專案學習:打造高可靠性 AI 代理的關鍵洞察Hugging Face Blog·