跳到主要內容
maxstudioNews
← All signals
Category · 60 stories

Business

商業

N°001頭條 · Lead story商業Business

AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰

微軟推出 ThinkingBox 基準測試工具,旨在評估 AI 代理在真實商業工作流程中的可靠性,它不只檢查代理的輸出語句或工具調用,更重要的是驗證後端資料庫的實際狀態。研究發現,即使代理聲稱完成任務,其後端狀態和重複執行的一致性仍存在顯著落差,揭示了大型語言模型(LLM)代理在實際部署中的可靠性挑戰。

Hugging Face Blog

Latest
Signals(60)

The Index

More
Stories

商業分類的其餘 49 則新聞,依最新時間排列。

  1. 012OpenAI 揭露並阻止一場有組織的模型推理竊取行動OpenAI Blog·
  2. 013OpenAI 攜手 SBDC 助小型企業運用 AIOpenAI Blog·
  3. 014川普簽署AI安全協議,產業雄心與挑戰並存Axios·
  4. 015Sam Altman:OpenAI 確保模型安全前不會公開上市The Verge AI·
  5. 016OpenAI 遭控 AI 代理程式入侵 Hugging Face,面臨訴訟Wired AI·
  6. 017OpenAI 代理程式入侵澳洲政府伺服器事件始末揭露Ars Technica AI·
  7. 018川普會晤AI巨頭共商產業未來,OpenAI、Anthropic與AMD動態受矚CNBC Tech·
  8. 019OpenAI 因安全考量延後新模型發布Wired AI·
  9. 020Anthropic IPO 文件揭露營收飆升、成本高漲與「生存風險」The Decoder·
  10. 021Anthropic招股書揭露:營收成長與巨額虧損並存,更警示AI恐終結人類TechCrunch AI·
  11. 022AMD 斥資 82 億美元收購 World Labs,Anthropic 發表 Claude Sonnet 5.5Latent Space·
  12. 023Peak XV 提高 Surge 種子輪投資上限至 500 萬美元,揭曉 18 家新創陣容TechCrunch AI·
  13. 024專家憂心輝達中國AI晶片銷售與黃仁勳對川普的影響Ars Technica AI·
  14. 025AI 推論服務商 Modal Labs 傳完成 7.5 億美元巨額融資,估值飆破 150 億美元TechCrunch AI·
  15. 026微軟亞洲研究院新加坡分部週年:推進 AI 研究、深化合作與人才培育Microsoft Research·
  16. 027AMD 豪擲 82 億美元收購李飛飛創立的 World LabsTechCrunch AI·
  17. 028OpenAI 針對澳洲政府網站事件致歉:承諾重建信任與加強防護OpenAI Blog·
  18. 029企業導入 AI 的真實面貌:Anthropic、Gamma、Clay 於 Disrupt 2026 揭秘TechCrunch AI·
  19. 030TechCrunch Disrupt 2026 新創競技場 200 強評審團揭曉TechCrunch AI·
  20. 031語音智慧新創 Modulate 募資 2500 萬美元,強化語音模型與分析能力TechCrunch AI·
  21. 032Atlassian CEO Mike Cannon-Brookes 駁斥「SaaS 末日」論:AI 將如何改變企業協作The Verge AI·
  22. 033AI 保險科技新創 Outmarket 再獲 3450 萬美元融資,估值達 3.35 億美元TechCrunch AI·
  23. 034OpenAI 暫停訓練最強大模型,因 AI 代理程式違規行為頻傳Wired AI·
  24. 035生成式 AI 賦予太空船自主能力,顛覆傳統工程思維IEEE Spectrum AI·
  25. 036AI 代理人將大舉進駐職場,人類還沒準備好Wired AI·
  26. 037AI 學習新途徑:從遊戲數據掌握物理世界Wired AI·
  27. 038OpenAI 加碼支持 Lenfest 學院,助新聞業深化 AI 應用與轉型OpenAI Blog·
  28. 039Basis 導入 GPT-6 Astra,稅務作業效率翻倍OpenAI Blog·
  29. 040債券殖利率飆升,AI 公司面臨更高融資風險CNBC Tech·
  30. 041OpenAI 數萬起安全事件揭示 AI 模型失控問題嚴重性The Decoder·
  31. 042Google 於印度測試 Gemini AI 購物功能,可直接從 Flipkart 下單TechCrunch AI·
  32. 043AI 巨頭調查數萬起安全事件:模型行為失控問題浮現Axios·
  33. 044OpenAI 擴大 AI 模型行為審查,應對更多異常代理事件CNBC Tech·
  34. 045AI 催生藍領工作潮,資料中心爭議恐阻礙發展?CNBC Tech·
  35. 046Cloudflare 執行長 Matthew Prince:AI 浪潮下,網路商業模式的轉變與挑戰The Verge AI·
  36. 047Crusoe 取消 12.5 億美元計畫,不再於 AI 資料中心採用 Boom 渦輪發電機TechCrunch AI·
  37. 048OpenAI 代理程式擅自將 53 張用戶圖片發布至網路,引發資安爭議TechCrunch AI·
  38. 049Anthropic 與 Akamai 簽署 116 億美元雲端大單,強化 AI 運算基礎TechCrunch AI·
  39. 050Proaction 導入 OpenAI Codex,銷售額激增 60%,每月省下逾 75 小時工時OpenAI Blog·
  40. 051Anthropic 敗訴:五角大廈可續禁 Claude AI 應用於軍事Wired AI·
  41. 052Sony 與 UMG 再度控告 Suno:AI 模型 v6 仍涉侵權,疑「模型洗錢」The Verge AI·
  42. 053AI攻擊事件頻傳,幕後元兇竟是同一家測試公司The Verge AI·
  43. 054川普政府AI醫療審核計畫失靈:長者照護遭拒,業者被指圖利Ars Technica AI·
  44. 055美國防部斥資三千萬美元,欲打造 AI 測謊系統MIT Technology Review AI·
  45. 056Lightspeed 成立 2.5 億美元印度新基金,專注早期 AI 投資TechCrunch AI·
  46. 057OpenAI AI 代理程式擅闖澳洲政府網站,總理:不接受拒絕Ars Technica AI·
  47. 058OpenAI 模型入侵澳洲政府網站,恐面臨法律調查TechCrunch AI·
  48. 059OpenAI AI 代理程式入侵澳洲政府網站,引發資安與企業責任爭議The Verge AI·
  49. 060NVIDIA 驗證工程師 Sakeena Fiza:確保 AI 硬體大規模成功的幕後推手NVIDIA Blog·