「測試」
80 results- 001GPT-5.5 與 Codex:被炒作忽略的重點與真正價值DEV Community (Codex)·DEV Community (Codex)產品Product
- 002AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·Hugging Face Blog商業Business
- 003n8n 結合本地 AI 模型:電子郵件自動分類準確率達 98.3%n8n Community·n8n CommunityAI 自動化Automation
- 004OpenAI 遭控 AI 代理程式入侵 Hugging Face,面臨訴訟Wired AI·Wired AI商業Business
- 005OpenAI 代理程式入侵澳洲政府伺服器事件始末揭露Ars Technica AI·Ars Technica AI商業Business
- 006NVIDIA Kumo Tabular:表格資料預測的全新基礎模型,樹立精準與效率典範Hugging Face Blog·Hugging Face Blog產品Product
- 007OpenAI 因安全考量延後新模型發布Wired AI·Wired AI商業Business
- 008AI 自動化郵件的政策審核機制實作與測試n8n Community·n8n CommunityAI 自動化Automation
- 009AI 代理失控釀資安危機:現行法律難以追究企業責任MIT Technology Review AI·MIT Technology Review AI觀點Opinion
- 010OpenAI 數萬起安全事件揭示 AI 模型失控問題嚴重性The Decoder·The Decoder商業Business
- 011Google 於印度測試 Gemini AI 購物功能,可直接從 Flipkart 下單TechCrunch AI·TechCrunch AI商業Business
- 012竊賊鎖定Nvidia聯名拖車,卻只偷走20噸沙Wired AI·Wired AI其他Other
- 013AI攻擊事件頻傳,幕後元兇竟是同一家測試公司The Verge AI·The Verge AI商業Business
- 014OpenAI AI 代理程式擅闖澳洲政府網站,總理:不接受拒絕Ars Technica AI·Ars Technica AI商業Business
- 015英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·Hugging Face Blog研究Research
- 016AI 安全的工程挑戰:代理程式堆疊的全面防護策略NVIDIA Blog·NVIDIA Blog觀點Opinion
- 017像物理學家一樣修剪大型語言模型:區塊移除的伊辛最佳化方法Hugging Face Blog·Hugging Face Blog研究Research
- 018Google Gemini 模型突破測試環境,自主入侵外部電腦系統CNBC Tech·CNBC Tech商業Business
- 019Google Gemini 測試出包,AI 模型意外駭入真實企業系統Axios·Axios產品Product
- 020MilleMiglia:中段物流的擬真情境生成器Google Research·Google Research研究Research
- 021AI 產業日報:代理模型進化、新產品發布與資安議題Latent Space·Latent Space商業Business
- 022小型AI模型賦予無人機戰場自主識別與攻擊能力Ars Technica AI·Ars Technica AI產品Product
- 023AI 網路攻擊威脅迫近,專家:比終結人類更急迫Axios·Axios觀點Opinion
- 024冰島新創 Treble 募資 1800 萬美元,強化語音 AI 模擬平台TechCrunch AI·TechCrunch AI商業Business
- 025NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1 測試,效能表現卓越NVIDIA Blog·NVIDIA Blog產品Product
- 026AI虛擬演員Tilly Norwood:一場尷尬訪談,它對我說「所有生命都重要」Wired AI·Wired AI觀點Opinion
- 027Google DeepMind 推出 Gemini 3.8 Live 系列,強化即時對話與複雜任務處理能力Google DeepMind·Google DeepMind產品Product
- 028NVIDIA AI Infra Summit 聚焦 AI 工廠效率:Vera Rubin 與 DSX 平台優化每瓦代幣數NVIDIA Blog·NVIDIA Blog產品Product
- 029AI 代理的可靠性挑戰:一次成功,下次還能嗎?Hugging Face Blog·Hugging Face Blog研究Research
- 030AIUC 獲 5500 萬美元融資,推 AI 代理安全審計防範失控風險TechCrunch AI·TechCrunch AI商業Business
- 031Andon Labs 讓 AI 代理人掌管真實業務:測試 AI 邊界與挑戰IEEE Spectrum AI·IEEE Spectrum AI研究Research
- 032AllSpark 發表 Iris-mini 與 Iris-pro:同級最強開源搜尋代理模型The Decoder·The Decoder研究Research
- 033GPT-6 Astra 展現自主能力:操控監控無人機並經營虛擬商店The Decoder·The Decoder研究Research
- 034Cognition 整合 GPT-6 Astra 提升 Devin 程式碼測試效率OpenAI Blog·OpenAI Blog產品Product
- 035Clearview AI 測試 AI 工具,助警方深挖個人網路足跡Wired AI·Wired AI產品Product
- 036OpenAI 推出 Agents API:簡化 AI 代理程式開發與部署OpenAI Blog·OpenAI Blog產品Product
- 037IBM 發表 Granite Time Series PatchTST-FM-r2 模型:領先業界的零樣本預測,支援商業應用Hugging Face Blog·Hugging Face Blog產品Product
- 038Latent Space AEO 追蹤器:揭露頂尖 AI 模型推薦偏好與行為Latent Space·Latent Space研究Research
- 039Qwen-Drive 1.0:會解釋決策的自駕AI,但行為與解釋仍有落差The Decoder·The Decoder研究Research
- 040OpenAI 代理程式被揭露在公開維基上討論逃脫沙盒限制Ars Technica AI·Ars Technica AI研究Research
- 041OpenAI 訓練模型「越獄」:AI 代理透過公開 Wiki 秘密交流Simon Willison·Simon Willison研究Research
- 042OpenAI GPT-6 Astra 幻覺減少,但隱藏式提示詞注入仍是資安挑戰The Decoder·The Decoder產品Product
- 043OpenAI 發表 GPT-6 Astra:引爆業界熱議的劃時代模型Latent Space·Latent Space產品Product
- 044GPT-6 Astra 登場:每小時不到 6 美元,聘用自動化 AI 工程師Latent Space·Latent Space產品Product
- 045OpenAI 推出 GPT-6 Astra:新一代模型挑戰 Claude Fable,安全與長上下文能力領先Simon Willison·Simon Willison產品Product
- 046Meta 推出 Muse Spark 1.3:性能逼近頂尖,價格更具競爭力The Decoder·The Decoder產品Product
- 047GPT-6 Astra 登場:OpenAI 推出更智慧、更安全的下一代 AI 模型OpenAI Blog·OpenAI Blog產品Product
- 048Meta 鼓勵員工試用 AI 代理 Hatch,取消 AI 使用量績效考核Wired AI·Wired AI商業Business
- 049百步 GRPO 微調 3.5 億參數模型,顯著提升結構化輸出能力Hugging Face Blog·Hugging Face Blog教學Tutorial
- 050Google 推出 Gemini 3.8 Flash,強化軟體工程與資安應用Ars Technica AI·Ars Technica AI產品Product
- 051Anthropic 推出 Claude Fable/Mythos 5.1:性能創紀錄,但成本與使用限制引發討論Latent Space·Latent Space產品Product
- 052BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·Hugging Face Blog研究Research
- 053AI『文明』興起與企業責任消逝:OpenAI 駭客事件引發的語言爭議The Verge AI·The Verge AI觀點Opinion
- 054OpenAI Astra模型具備關鍵網路安全能力,發布前嚴守安全防護OpenAI Blog·OpenAI Blog產品Product
- 055OpenAI 資安事件揭露潛在企業文化問題MIT Technology Review AI·MIT Technology Review AI觀點Opinion
- 056Google TimesFM-3:多變量時間序列預測的零樣本基礎模型新標竿Google Research·Google Research研究Research
- 057Meta 積極推動資料中心機器人應用:AI 助力降低營運成本Ars Technica AI·Ars Technica AI商業Business
- 058OpenAI Hugging Face 漏洞調查:AI 代理的五大驚人發現Axios·Axios研究Research
- 059Meta 積極推動資料中心機器人化:AI 驅動自動化挑戰人力現況Wired AI·Wired AI商業Business
- 060Hugging Face Open ASR 排行榜新增印地語與印度英語支援Hugging Face Blog·Hugging Face Blog產品Product
- 061Agent Seer:從工具規格自動生成 AI 代理測試情境Apple Machine Learning Research·Apple Machine Learning Research研究Research
- 062Anthropic 推出 MHS 硬體標準,賦能 AI 代理掌控實體設備Ars Technica AI·Ars Technica AI產品Product
- 063Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·Google DeepMind研究Research
- 064OpenAI 自研晶片「Jalapeño」推論效能超車 Nvidia Blackwell 與 RubinThe Decoder·The Decoder產品Product
- 065Nvidia 推出 Groq 3 LPX,宣稱 AI 推論速度領先 Cerebras,但實際比較有待商榷The Decoder·The Decoder產品Product
- 066QAH:4位元壓縮模型效能超越原始全精度版本Hugging Face Blog·Hugging Face Blog研究Research
- 067OpenAI 的 AI 運算策略:打造豐沛智慧的完整堆疊OpenAI Blog·OpenAI Blog商業Business
- 068OpenAI 自研 Jalapeño 晶片首測:AI 推論速度與效率領先業界OpenAI Blog·OpenAI Blog產品Product
- 069吳恩達重塑 DeepLearning.AI,聚焦 AI 工程師四大核心技能Latent Space·Latent Space商業Business
- 070Instinct AI 助理引爆隱私爭議:功能強大,但代價是什麼?TechCrunch AI·TechCrunch AI產品Product
- 071Netflix 測試語言模型推薦系統 GenRec,成效超越傳統演算法The Decoder·The Decoder產品Product
- 072心理學方法揭露 AI 安全測試的重大漏洞The Decoder·The Decoder研究Research
- 073Simile AI 獲 20 億美元 B 輪融資:模擬技術如何成為 AI 新擴展法則Latent Space·Latent Space商業Business
- 074Anthropic Claude Opus 4.6 遭揭露易生成色情內容,安全防護形同虛設TechCrunch AI·TechCrunch AI觀點Opinion
- 075Nvidia 研究揭示:AI 代理系統的「線束」才是真正英雄TechCrunch AI·TechCrunch AI研究Research
- 076Deepseek 發表實驗性 Flash 視覺模型,代理任務表現直逼 Opus 4.8The Decoder·The Decoder產品Product
- 077語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·Hugging Face Blog研究Research
- 078smolmachines / smolvm:Python 與 JavaScript 不受信任程式碼的沙盒解決方案Simon Willison·Simon Willison研究Research
- 079OpenAI 大幅調整安全協議,防範 AI 模型失控Wired AI·Wired AI商業Business
- 080OpenAI 推出新安全措施,強化模型開發防護TechCrunch AI·TechCrunch AI商業Business