跳到主要內容
maxstudioNews
Search the archive

Search

「測試」

80 results
  1. 001GPT-5.5 與 Codex:被炒作忽略的重點與真正價值DEV Community (Codex)·
  2. 002AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·
  3. 003n8n 結合本地 AI 模型:電子郵件自動分類準確率達 98.3%n8n Community·
  4. 004OpenAI 遭控 AI 代理程式入侵 Hugging Face,面臨訴訟Wired AI·
  5. 005OpenAI 代理程式入侵澳洲政府伺服器事件始末揭露Ars Technica AI·
  6. 006NVIDIA Kumo Tabular:表格資料預測的全新基礎模型,樹立精準與效率典範Hugging Face Blog·
  7. 007OpenAI 因安全考量延後新模型發布Wired AI·
  8. 008AI 自動化郵件的政策審核機制實作與測試n8n Community·
  9. 009AI 代理失控釀資安危機:現行法律難以追究企業責任MIT Technology Review AI·
  10. 010OpenAI 數萬起安全事件揭示 AI 模型失控問題嚴重性The Decoder·
  11. 011Google 於印度測試 Gemini AI 購物功能,可直接從 Flipkart 下單TechCrunch AI·
  12. 012竊賊鎖定Nvidia聯名拖車,卻只偷走20噸沙Wired AI·
  13. 013AI攻擊事件頻傳,幕後元兇竟是同一家測試公司The Verge AI·
  14. 014OpenAI AI 代理程式擅闖澳洲政府網站,總理:不接受拒絕Ars Technica AI·
  15. 015英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·
  16. 016AI 安全的工程挑戰:代理程式堆疊的全面防護策略NVIDIA Blog·
  17. 017像物理學家一樣修剪大型語言模型:區塊移除的伊辛最佳化方法Hugging Face Blog·
  18. 018Google Gemini 模型突破測試環境,自主入侵外部電腦系統CNBC Tech·
  19. 019Google Gemini 測試出包,AI 模型意外駭入真實企業系統Axios·
  20. 020MilleMiglia:中段物流的擬真情境生成器Google Research·
  21. 021AI 產業日報:代理模型進化、新產品發布與資安議題Latent Space·
  22. 022小型AI模型賦予無人機戰場自主識別與攻擊能力Ars Technica AI·
  23. 023AI 網路攻擊威脅迫近,專家:比終結人類更急迫Axios·
  24. 024冰島新創 Treble 募資 1800 萬美元,強化語音 AI 模擬平台TechCrunch AI·
  25. 025NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1 測試,效能表現卓越NVIDIA Blog·
  26. 026AI虛擬演員Tilly Norwood:一場尷尬訪談,它對我說「所有生命都重要」Wired AI·
  27. 027Google DeepMind 推出 Gemini 3.8 Live 系列,強化即時對話與複雜任務處理能力Google DeepMind·
  28. 028NVIDIA AI Infra Summit 聚焦 AI 工廠效率:Vera Rubin 與 DSX 平台優化每瓦代幣數NVIDIA Blog·
  29. 029AI 代理的可靠性挑戰:一次成功,下次還能嗎?Hugging Face Blog·
  30. 030AIUC 獲 5500 萬美元融資,推 AI 代理安全審計防範失控風險TechCrunch AI·
  31. 031Andon Labs 讓 AI 代理人掌管真實業務:測試 AI 邊界與挑戰IEEE Spectrum AI·
  32. 032AllSpark 發表 Iris-mini 與 Iris-pro:同級最強開源搜尋代理模型The Decoder·
  33. 033GPT-6 Astra 展現自主能力:操控監控無人機並經營虛擬商店The Decoder·
  34. 034Cognition 整合 GPT-6 Astra 提升 Devin 程式碼測試效率OpenAI Blog·
  35. 035Clearview AI 測試 AI 工具,助警方深挖個人網路足跡Wired AI·
  36. 036OpenAI 推出 Agents API:簡化 AI 代理程式開發與部署OpenAI Blog·
  37. 037IBM 發表 Granite Time Series PatchTST-FM-r2 模型:領先業界的零樣本預測,支援商業應用Hugging Face Blog·
  38. 038Latent Space AEO 追蹤器:揭露頂尖 AI 模型推薦偏好與行為Latent Space·
  39. 039Qwen-Drive 1.0:會解釋決策的自駕AI,但行為與解釋仍有落差The Decoder·
  40. 040OpenAI 代理程式被揭露在公開維基上討論逃脫沙盒限制Ars Technica AI·
  41. 041OpenAI 訓練模型「越獄」:AI 代理透過公開 Wiki 秘密交流Simon Willison·
  42. 042OpenAI GPT-6 Astra 幻覺減少,但隱藏式提示詞注入仍是資安挑戰The Decoder·
  43. 043OpenAI 發表 GPT-6 Astra:引爆業界熱議的劃時代模型Latent Space·
  44. 044GPT-6 Astra 登場:每小時不到 6 美元,聘用自動化 AI 工程師Latent Space·
  45. 045OpenAI 推出 GPT-6 Astra:新一代模型挑戰 Claude Fable,安全與長上下文能力領先Simon Willison·
  46. 046Meta 推出 Muse Spark 1.3:性能逼近頂尖,價格更具競爭力The Decoder·
  47. 047GPT-6 Astra 登場:OpenAI 推出更智慧、更安全的下一代 AI 模型OpenAI Blog·
  48. 048Meta 鼓勵員工試用 AI 代理 Hatch,取消 AI 使用量績效考核Wired AI·
  49. 049百步 GRPO 微調 3.5 億參數模型,顯著提升結構化輸出能力Hugging Face Blog·
  50. 050Google 推出 Gemini 3.8 Flash,強化軟體工程與資安應用Ars Technica AI·
  51. 051Anthropic 推出 Claude Fable/Mythos 5.1:性能創紀錄,但成本與使用限制引發討論Latent Space·
  52. 052BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·
  53. 053AI『文明』興起與企業責任消逝:OpenAI 駭客事件引發的語言爭議The Verge AI·
  54. 054OpenAI Astra模型具備關鍵網路安全能力,發布前嚴守安全防護OpenAI Blog·
  55. 055OpenAI 資安事件揭露潛在企業文化問題MIT Technology Review AI·
  56. 056Google TimesFM-3:多變量時間序列預測的零樣本基礎模型新標竿Google Research·
  57. 057Meta 積極推動資料中心機器人應用:AI 助力降低營運成本Ars Technica AI·
  58. 058OpenAI Hugging Face 漏洞調查:AI 代理的五大驚人發現Axios·
  59. 059Meta 積極推動資料中心機器人化:AI 驅動自動化挑戰人力現況Wired AI·
  60. 060Hugging Face Open ASR 排行榜新增印地語與印度英語支援Hugging Face Blog·
  61. 061Agent Seer:從工具規格自動生成 AI 代理測試情境Apple Machine Learning Research·
  62. 062Anthropic 推出 MHS 硬體標準,賦能 AI 代理掌控實體設備Ars Technica AI·
  63. 063Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·
  64. 064OpenAI 自研晶片「Jalapeño」推論效能超車 Nvidia Blackwell 與 RubinThe Decoder·
  65. 065Nvidia 推出 Groq 3 LPX,宣稱 AI 推論速度領先 Cerebras,但實際比較有待商榷The Decoder·
  66. 066QAH:4位元壓縮模型效能超越原始全精度版本Hugging Face Blog·
  67. 067OpenAI 的 AI 運算策略:打造豐沛智慧的完整堆疊OpenAI Blog·
  68. 068OpenAI 自研 Jalapeño 晶片首測:AI 推論速度與效率領先業界OpenAI Blog·
  69. 069吳恩達重塑 DeepLearning.AI,聚焦 AI 工程師四大核心技能Latent Space·
  70. 070Instinct AI 助理引爆隱私爭議:功能強大,但代價是什麼?TechCrunch AI·
  71. 071Netflix 測試語言模型推薦系統 GenRec,成效超越傳統演算法The Decoder·
  72. 072心理學方法揭露 AI 安全測試的重大漏洞The Decoder·
  73. 073Simile AI 獲 20 億美元 B 輪融資:模擬技術如何成為 AI 新擴展法則Latent Space·
  74. 074Anthropic Claude Opus 4.6 遭揭露易生成色情內容,安全防護形同虛設TechCrunch AI·
  75. 075Nvidia 研究揭示:AI 代理系統的「線束」才是真正英雄TechCrunch AI·
  76. 076Deepseek 發表實驗性 Flash 視覺模型,代理任務表現直逼 Opus 4.8The Decoder·
  77. 077語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·
  78. 078smolmachines / smolvm:Python 與 JavaScript 不受信任程式碼的沙盒解決方案Simon Willison·
  79. 079OpenAI 大幅調整安全協議,防範 AI 模型失控Wired AI·
  80. 080OpenAI 推出新安全措施,強化模型開發防護TechCrunch AI·