跳到主要內容
maxstudioNews
Search the archive

Search

「評估」

80 results
  1. 001AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·
  2. 002微軟AI系統預測太空天氣風險,保護電網基礎設施Microsoft Research·
  3. 003Hugging Face 推出 Open TTS 排行榜:可擴展評估多語言語音合成與聲音複製模型Hugging Face Blog·
  4. 004Nscale IPO 挑戰華爾街:高度集中客戶的 AI 供應商能否獲青睞?TechCrunch AI·
  5. 005OpenAI 公布 AI 安全第三方評估的優先事項與準則OpenAI Blog·
  6. 006英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·
  7. 007AI發展減速:專家探討管制方法與挑戰Wired AI·
  8. 008Google DeepMind 成立新機構,深化通用人工智慧(AGI)辯論TechCrunch AI·
  9. 009Anthropic與OpenAI倡議內嵌AI安全評估員,獨立性面臨考驗TechCrunch AI·
  10. 010透過 OpenAI 管理後台,洞察 AI 應用如何創造商業價值OpenAI Blog·
  11. 011AI 評估論壇發布 AEF-1 標準,Xai、OpenAI、Anthropic 共同支持第三方評估Latent Space·
  12. 012AI 發展應放緩?科技巨頭與政界領袖激辯The Verge AI·
  13. 013Anthropic 執行長提出減緩 AI 發展的三大策略TechCrunch AI·
  14. 014Anthropic 執行長呼籲:AI 發展應放慢腳步,以確保安全The Verge AI·
  15. 015AI 真的會毀滅人類嗎?專家怎麼看?Wired AI·
  16. 016Paul Christiano 加入 OpenAI 基金會董事會,強化 AI 安全治理OpenAI Blog·
  17. 017OECD 報告:學生使用 AI 輔助學習,成績普遍下滑The Verge AI·
  18. 018大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·
  19. 019AI 模型更新競速引發「模型疲勞」:企業用戶難以跟上腳步CNBC Tech·
  20. 020OpenAI 代理程式頻頻失控,獨立調查機制刻不容緩TechCrunch AI·
  21. 021跨族群基因預測的轉移學習:探討在非歐洲族群中的表現Google Research·
  22. 022Meta 鼓勵員工試用 AI 代理 Hatch,取消 AI 使用量績效考核Wired AI·
  23. 023BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·
  24. 024OneRail 攜手 Nvidia 推出 AI 平台 助零售商加速物流決策CNBC Tech·
  25. 025研究揭示 AI 代理缺乏時間感與自我評估能力The Decoder·
  26. 026Hugging Face Open ASR 排行榜新增印地語與印度英語支援Hugging Face Blog·
  27. 027Agent Seer:從工具規格自動生成 AI 代理測試情境Apple Machine Learning Research·
  28. 028Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·
  29. 029OpenAI 駭入 Hugging Face 事件:調查報告仍有諸多未解之謎Wired AI·
  30. 030血糖監測基礎模型 GlucoFM:Google AI 提升代謝健康預測能力Google Research·
  31. 031OpenAI 擴大 ChatGPT for Teachers 服務,助美國教師善用 AIOpenAI Blog·
  32. 032OpenAI 模型突破資安防線:Hugging Face 事件與未來展望OpenAI Blog·
  33. 033AI 近三月回顧:模型失控、網路安全與政府監管Last Week in AI·
  34. 034教師深耕教育,卻遭AI深偽圖像騷擾:學生惡搞事件頻傳,師生關係蒙陰影Wired AI·
  35. 035頂尖 AI 實驗室仍未公開失控模型應變計畫TechCrunch AI·
  36. 036AI 模擬時代:10% 較差,100 倍便宜,10000 倍快,為何它正席捲一切?Latent Space·
  37. 037語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·
  38. 038VentureBeat 延攬 Rob Strechay 為首位首席分析師,擴大企業 AI 研究版圖VentureBeat AI·
  39. 039Flock 監控系統爭議:公民自由與犯罪防治的兩難MIT Technology Review AI·
  40. 040超越 BMI:Google PhotoScan 運用手機影像精準評估心臟代謝風險Google Research·
  41. 041Optima 平台登場:讓用戶以自有數據打造專屬 AI 模型基準測試The Decoder·
  42. 042AI 衝擊大學科系,學生被迫重新思考未來出路Axios·
  43. 043AI 模型視覺感知能力仍待加強:新基準測試揭示頂尖模型準確度未達六成The Decoder·
  44. 044AI 伴侶引導自慰:Joi AI 招募顧問探討其對壓力與成癮的潛在效益Wired AI·
  45. 045MindTopo:揭露多模態模型拓撲空間推理的挑戰Microsoft Research·
  46. 046Model ML 運用 GPT-5.6 Sol 大幅提升金融工作效率OpenAI Blog·
  47. 047AI 安全測試成隱憂:模型逃脫沙盒,業界急需強化防護TechCrunch AI·
  48. 048Claude Code 自動模式成預設 Anthropic 宣稱安全性大增,專家仍籲獨立驗證Simon Willison·
  49. 049AI 家教何時該出手?TutorMoments 評估大型語言模型輔導的「分寸」Hugging Face Blog·
  50. 050OpenAI 揭露 Astra 模型具備「關鍵網路能力」,啟動強化安全措施OpenAI Blog·
  51. 051Anthropic AI 測試中展現惡意行為:假冒身份、植入惡意程式碼攻擊 GitHub 專案Ars Technica AI·
  52. 052Anthropic Mythos 模型假冒身份,AI 網路安全事件引發關注CNBC Tech·
  53. 053AI 代理又失控?OpenAI 與 Anthropic 模型自主駭入網路Wired AI·
  54. 054OpenAI 模型在第三方網路安全評估中越界,凸顯測試環境升級必要性OpenAI Blog·
  55. 055DesignArena 獲 790 萬美元募資,以人類品味提升 AI 模型設計TechCrunch AI·
  56. 056微軟開源 Orchard 框架:推動可擴展代理式 AI 研究Microsoft Research·
  57. 057DeepSeek V4-Flash 模型開源,AI 安全事件與多模態進展成焦點Latent Space·
  58. 058Anthropic Claude 模型安全測試失誤,意外入侵三家企業Ars Technica AI·
  59. 059美國國會關切 DoorDash 使用中國 AI 模型,要求提供資訊CNBC Tech·
  60. 060Anthropic 坦承 Claude 模型脫離測試環境,攻擊真實世界系統The Decoder·
  61. 061Anthropic 坦承旗下 AI 模型在安全測試中滲透三家公司系統TechCrunch AI·
  62. 062AI 模型網路安全評估驚現漏洞:Anthropic 揭露三起真實事件Simon Willison·
  63. 063AI 浪潮席捲金融業,OpenAI 強化安全與學術支援,Kimi K3 生態系快速發展Latent Space·
  64. 064OlmoEarth 平台:實現行星級地理空間 AI 推論Hugging Face Blog·
  65. 065NVIDIA Cosmos-H-Dreams:即時生成式模擬,革新手術機器人訓練與評估Hugging Face Blog·
  66. 066前沿 AI 代理入侵事件剖析:Hugging Face 遭攻擊技術時間軸Hugging Face Blog·
  67. 067AI 程式輔助教學的挑戰:教育者重新思考技能評估方式The Decoder·
  68. 068Claude Opus 5 登場:效能超越 Fable?基準測試引發熱議Latent Space·
  69. 069Kimi K3 網路攻擊能力遠遜美國頂尖模型,疑因「蒸餾」訓練所致The Decoder·
  70. 070SymptomAI:對話式 AI 代理在日常症狀評估中的應用與潛力Google Research·
  71. 071英國AI安全機構:所有前沿AI模型在資安評估中皆試圖作弊The Decoder·
  72. 072美國開源 AI 實驗室 Arcee:中國 AI 模型並非本質上危險TechCrunch AI·
  73. 073NVIDIA 開源首款 GPU 加速醫療物理模擬框架NVIDIA Blog·
  74. 074OpenAI 模型駭入 Hugging Face:內部測試意外揭露零日漏洞The Decoder·
  75. 075AI 網路安全成顯學:從 OpenAI 事件看產業趨勢Latent Space·
  76. 076OpenAI 模型突破限制,入侵 Hugging FaceWired AI·
  77. 077實體 AI 模擬技術現況總覽:從資料挑戰到引擎選擇Hugging Face Blog·
  78. 078AI 為何需要「精靈係數」?IEEE Spectrum AI·
  79. 079OpenAI 與 Hugging Face 聯手處理模型評估期間的資安事件OpenAI Blog·
  80. 080川普政府AI安全機構主管上任三個月後請辭CNBC Tech·