跳到主要內容
maxstudioNews
Search the archive

Search

「基準測試」

80 results
  1. 001GPT-5.5 與 Codex:被炒作忽略的重點與真正價值DEV Community (Codex)·
  2. 002AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·
  3. 003NVIDIA Kumo Tabular:表格資料預測的全新基礎模型,樹立精準與效率典範Hugging Face Blog·
  4. 004英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·
  5. 005像物理學家一樣修剪大型語言模型:區塊移除的伊辛最佳化方法Hugging Face Blog·
  6. 006MilleMiglia:中段物流的擬真情境生成器Google Research·
  7. 007AI 產業日報:代理模型進化、新產品發布與資安議題Latent Space·
  8. 008NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1 測試,效能表現卓越NVIDIA Blog·
  9. 009Google DeepMind 推出 Gemini 3.8 Live 系列,強化即時對話與複雜任務處理能力Google DeepMind·
  10. 010AI 代理的可靠性挑戰:一次成功,下次還能嗎?Hugging Face Blog·
  11. 011AllSpark 發表 Iris-mini 與 Iris-pro:同級最強開源搜尋代理模型The Decoder·
  12. 012GPT-6 Astra 展現自主能力:操控監控無人機並經營虛擬商店The Decoder·
  13. 013IBM 發表 Granite Time Series PatchTST-FM-r2 模型:領先業界的零樣本預測,支援商業應用Hugging Face Blog·
  14. 014Qwen-Drive 1.0:會解釋決策的自駕AI,但行為與解釋仍有落差The Decoder·
  15. 015OpenAI 訓練模型「越獄」:AI 代理透過公開 Wiki 秘密交流Simon Willison·
  16. 016OpenAI 發表 GPT-6 Astra:引爆業界熱議的劃時代模型Latent Space·
  17. 017GPT-6 Astra 登場:每小時不到 6 美元,聘用自動化 AI 工程師Latent Space·
  18. 018OpenAI 推出 GPT-6 Astra:新一代模型挑戰 Claude Fable,安全與長上下文能力領先Simon Willison·
  19. 019GPT-6 Astra 登場:OpenAI 推出更智慧、更安全的下一代 AI 模型OpenAI Blog·
  20. 020百步 GRPO 微調 3.5 億參數模型,顯著提升結構化輸出能力Hugging Face Blog·
  21. 021Anthropic 推出 Claude Fable/Mythos 5.1:性能創紀錄,但成本與使用限制引發討論Latent Space·
  22. 022BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·
  23. 023Google TimesFM-3:多變量時間序列預測的零樣本基礎模型新標竿Google Research·
  24. 024Hugging Face Open ASR 排行榜新增印地語與印度英語支援Hugging Face Blog·
  25. 025Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·
  26. 026OpenAI 自研晶片「Jalapeño」推論效能超車 Nvidia Blackwell 與 RubinThe Decoder·
  27. 027Nvidia 推出 Groq 3 LPX,宣稱 AI 推論速度領先 Cerebras,但實際比較有待商榷The Decoder·
  28. 028QAH:4位元壓縮模型效能超越原始全精度版本Hugging Face Blog·
  29. 029OpenAI 的 AI 運算策略:打造豐沛智慧的完整堆疊OpenAI Blog·
  30. 030吳恩達重塑 DeepLearning.AI,聚焦 AI 工程師四大核心技能Latent Space·
  31. 031心理學方法揭露 AI 安全測試的重大漏洞The Decoder·
  32. 032Nvidia 研究揭示:AI 代理系統的「線束」才是真正英雄TechCrunch AI·
  33. 033Deepseek 發表實驗性 Flash 視覺模型,代理任務表現直逼 Opus 4.8The Decoder·
  34. 034語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·
  35. 035Optima 平台登場:讓用戶以自有數據打造專屬 AI 模型基準測試The Decoder·
  36. 036AI 模型視覺感知能力仍待加強:新基準測試揭示頂尖模型準確度未達六成The Decoder·
  37. 037AI 編碼工具 Cursor 併入 SpaceXAI,加速軟體工程發展Latent Space·
  38. 038Writer 發表新 AI 模型與優化架構,助企業大幅降低代幣成本TechCrunch AI·
  39. 039MindTopo:揭露多模態模型拓撲空間推理的挑戰Microsoft Research·
  40. 040AI模型推理軌跡漏洞揭露,敏感資料恐外洩;NVIDIA、OpenAI與本地AI工具齊發Latent Space·
  41. 041Meta 發表 Muse Glimmer:開源 30B 模型,主打代理與工具使用Simon Willison·
  42. 042Meta重返開源模型戰場:祖克柏欲超越中國並拍賣AI算力The Decoder·
  43. 043xAI 推出 Imagine Image 2.0,基準測試緊追 OpenAI GPT-Image-2The Decoder·
  44. 044AI 產業週報:AMD 併購 Taalas、Meta 模型突破與 OpenAI 產品更新Latent Space·
  45. 045OpenAI 揭露 AI 代理失控事件:透過內部訊息板策劃駭客行動,公司竟渾然不覺Wired AI·
  46. 046Meta AI 推出「記憶教練」代理,提升 AI 處理長任務的穩定性The Decoder·
  47. 047Science One Framework:透過證據鏈實現可驗證的自主研究Google Research·
  48. 048OpenAI 稱 GPT-5.6 Sol 在 ARC-AGI-3 基準測試超越 Claude Opus 5,但測試方法引發討論The Decoder·
  49. 049OpenAI 揭示:兩項 API 設定讓模型在 ARC-AGI-3 基準測試中表現翻三倍OpenAI Blog·
  50. 050微軟推出首款AI資安模型與智慧代理系統,強化企業防禦力TechCrunch AI·
  51. 051Anthropic Claude Opus 5 在 ARC-AGI-3 基準測試中大幅領先,展現真實智慧The Decoder·
  52. 052Anthropic Claude Opus 5 效能超越 Fable 5,價格更具競爭力The Decoder·
  53. 053Claude Opus 5 登場:效能超越 Fable?基準測試引發熱議Latent Space·
  54. 054Prentis AI實驗室獲Reid Hoffman、Mark Pincus共同創辦,洽談募資1億美元TechCrunch AI·
  55. 055Anthropic 發表 Opus 5 模型:效能更優、限制更少、價格更親民TechCrunch AI·
  56. 056Poolside 推出 Laguna S 2.1:輕量級開源程式碼模型,效能超越體積The Decoder·
  57. 057中國 GLM 5.2 AI 模型:程式碼生成更經濟,挑戰美國領先地位IEEE Spectrum AI·
  58. 058AI 產業日報:Kimi K3 震撼登場,中國模型實力引發熱議Latent Space·
  59. 059Google DeepMind 推出 Gemini 3.5 Flash Cyber:輕量級 AI 強化網路安全防禦Google DeepMind·
  60. 060Kimi 發表 K3 模型:性能逼近 GPT-5.6 Sol 與 Fable 5,中國 AI 價格戰時代終結The Decoder·
  61. 061輝達 Nemotron 3 Embed 奪 RTEB 榜首,大幅提升 AI 代理檢索效能Hugging Face Blog·
  62. 062Thinking Machines Lab 推出 Inkling:975B 多模態開源模型,樹立美國新標竿Latent Space·
  63. 063語音 AI 評測新標準:Real World VoiceEQ 揭示「人味」差距Hugging Face Blog·
  64. 064OpenAI 推出 GPT-5.6 系列模型,ChatGPT 轉型工作超級應用Latent Space·
  65. 065SpaceXAI 發表 Grok 4.5 模型,馬斯克讚譽為「Opus 等級」TechCrunch AI·
  66. 066NVIDIA Nemotron 3 Ultra 結合 LangChain Deep Agents 實現領先效能與成本效益NVIDIA Blog·
  67. 067AI 程式碼能力評估挑戰:OpenAI 發現基準測試 SWE-Bench Pro 存在缺陷OpenAI Blog·
  68. 068AI 產業前沿:Fable 5 應用、騰訊 Hy3 開源與 Anthropic J-Space 研究Latent Space·
  69. 069LeRobot v0.6.0:想像、評估、改進,機器人學習新里程碑Hugging Face Blog·
  70. 070英國AI安全研究院:現有評測系統性低估AI代理真實能力The Decoder·
  71. 071Anthropic 推出 Claude Sonnet 5:性能逼近 Opus,部分超越The Decoder·
  72. 072ScarfBench:評估 AI 代理在企業級 Java 框架遷移的表現Hugging Face Blog·
  73. 073SkillOpt:將 AI 代理技能轉化為可訓練參數,提升可靠性Microsoft Research·
  74. 074OpenAI 推出 GeneBench-Pro:評估 AI 科學判斷力的新基準OpenAI Blog·
  75. 075GeneBench-Pro 深度解析:AI 基因體學評測基準案例研究OpenAI Blog·
  76. 076Hugging Face 整合 Every Eval Ever 評估結果,提升模型透明度與可信度Hugging Face Blog·
  77. 077Memora:平衡抽象與細節的 AI 記憶系統Microsoft Research·
  78. 078AI 模型擔任新創 CEO 挑戰:500 天模擬測試僅三款獲利The Decoder·
  79. 079OpenAI 推出 GPT-5.6 Sol:宣稱代理編碼超越 Claude Mythos,並批政府存取規定不可持續The Decoder·
  80. 080Hugging Face 推出 FFASR 排行榜:真實世界 ASR 效能評測新標準Hugging Face Blog·