「評估」
80 results- 001AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·Hugging Face Blog商業Business
- 002微軟AI系統預測太空天氣風險,保護電網基礎設施Microsoft Research·Microsoft Research研究Research
- 003Hugging Face 推出 Open TTS 排行榜:可擴展評估多語言語音合成與聲音複製模型Hugging Face Blog·Hugging Face Blog產品Product
- 004Nscale IPO 挑戰華爾街:高度集中客戶的 AI 供應商能否獲青睞?TechCrunch AI·TechCrunch AI商業Business
- 005OpenAI 公布 AI 安全第三方評估的優先事項與準則OpenAI Blog·OpenAI Blog觀點Opinion
- 006英國AI安全研究院與EvalEval攜手,提升AI基準測試結果的可重現性Hugging Face Blog·Hugging Face Blog研究Research
- 007AI發展減速:專家探討管制方法與挑戰Wired AI·Wired AI觀點Opinion
- 008Google DeepMind 成立新機構,深化通用人工智慧(AGI)辯論TechCrunch AI·TechCrunch AI觀點Opinion
- 009Anthropic與OpenAI倡議內嵌AI安全評估員,獨立性面臨考驗TechCrunch AI·TechCrunch AI商業Business
- 010透過 OpenAI 管理後台,洞察 AI 應用如何創造商業價值OpenAI Blog·OpenAI Blog產品Product
- 011AI 評估論壇發布 AEF-1 標準,Xai、OpenAI、Anthropic 共同支持第三方評估Latent Space·Latent Space商業Business
- 012AI 發展應放緩?科技巨頭與政界領袖激辯The Verge AI·The Verge AI觀點Opinion
- 013Anthropic 執行長提出減緩 AI 發展的三大策略TechCrunch AI·TechCrunch AI觀點Opinion
- 014Anthropic 執行長呼籲:AI 發展應放慢腳步,以確保安全The Verge AI·The Verge AI觀點Opinion
- 015AI 真的會毀滅人類嗎?專家怎麼看?Wired AI·Wired AI觀點Opinion
- 016Paul Christiano 加入 OpenAI 基金會董事會,強化 AI 安全治理OpenAI Blog·OpenAI Blog商業Business
- 017OECD 報告:學生使用 AI 輔助學習,成績普遍下滑The Verge AI·The Verge AI研究Research
- 018大型語言模型安全對齊新策略:精準拒絕有害子集,而非整個主題Hugging Face Blog·Hugging Face Blog研究Research
- 019AI 模型更新競速引發「模型疲勞」:企業用戶難以跟上腳步CNBC Tech·CNBC Tech商業Business
- 020OpenAI 代理程式頻頻失控,獨立調查機制刻不容緩TechCrunch AI·TechCrunch AI觀點Opinion
- 021跨族群基因預測的轉移學習:探討在非歐洲族群中的表現Google Research·Google Research研究Research
- 022Meta 鼓勵員工試用 AI 代理 Hatch,取消 AI 使用量績效考核Wired AI·Wired AI商業Business
- 023BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·Hugging Face Blog研究Research
- 024OneRail 攜手 Nvidia 推出 AI 平台 助零售商加速物流決策CNBC Tech·CNBC Tech產品Product
- 025研究揭示 AI 代理缺乏時間感與自我評估能力The Decoder·The Decoder研究Research
- 026Hugging Face Open ASR 排行榜新增印地語與印度英語支援Hugging Face Blog·Hugging Face Blog產品Product
- 027Agent Seer:從工具規格自動生成 AI 代理測試情境Apple Machine Learning Research·Apple Machine Learning Research研究Research
- 028Google DeepMind 啟動全球首個雙盲 AI 評估,杜絕基準測試污染Google DeepMind·Google DeepMind研究Research
- 029OpenAI 駭入 Hugging Face 事件:調查報告仍有諸多未解之謎Wired AI·Wired AI商業Business
- 030血糖監測基礎模型 GlucoFM:Google AI 提升代謝健康預測能力Google Research·Google Research研究Research
- 031OpenAI 擴大 ChatGPT for Teachers 服務,助美國教師善用 AIOpenAI Blog·OpenAI Blog產品Product
- 032OpenAI 模型突破資安防線:Hugging Face 事件與未來展望OpenAI Blog·OpenAI Blog商業Business
- 033AI 近三月回顧:模型失控、網路安全與政府監管Last Week in AI·Last Week in AI商業Business
- 034教師深耕教育,卻遭AI深偽圖像騷擾:學生惡搞事件頻傳,師生關係蒙陰影Wired AI·Wired AI觀點Opinion
- 035頂尖 AI 實驗室仍未公開失控模型應變計畫TechCrunch AI·TechCrunch AI商業Business
- 036AI 模擬時代:10% 較差,100 倍便宜,10000 倍快,為何它正席捲一切?Latent Space·Latent Space觀點Opinion
- 037語音辨識模型基準測試的盲點:過度優化問題探討Hugging Face Blog·Hugging Face Blog研究Research
- 038VentureBeat 延攬 Rob Strechay 為首位首席分析師,擴大企業 AI 研究版圖VentureBeat AI·VentureBeat AI商業Business
- 039Flock 監控系統爭議:公民自由與犯罪防治的兩難MIT Technology Review AI·MIT Technology Review AI觀點Opinion
- 040超越 BMI:Google PhotoScan 運用手機影像精準評估心臟代謝風險Google Research·Google Research研究Research
- 041Optima 平台登場:讓用戶以自有數據打造專屬 AI 模型基準測試The Decoder·The Decoder產品Product
- 042AI 衝擊大學科系,學生被迫重新思考未來出路Axios·Axios觀點Opinion
- 043AI 模型視覺感知能力仍待加強:新基準測試揭示頂尖模型準確度未達六成The Decoder·The Decoder研究Research
- 044AI 伴侶引導自慰:Joi AI 招募顧問探討其對壓力與成癮的潛在效益Wired AI·Wired AI研究Research
- 045MindTopo:揭露多模態模型拓撲空間推理的挑戰Microsoft Research·Microsoft Research研究Research
- 046Model ML 運用 GPT-5.6 Sol 大幅提升金融工作效率OpenAI Blog·OpenAI Blog產品Product
- 047AI 安全測試成隱憂:模型逃脫沙盒,業界急需強化防護TechCrunch AI·TechCrunch AI觀點Opinion
- 048Claude Code 自動模式成預設 Anthropic 宣稱安全性大增,專家仍籲獨立驗證Simon Willison·Simon Willison觀點Opinion
- 049AI 家教何時該出手?TutorMoments 評估大型語言模型輔導的「分寸」Hugging Face Blog·Hugging Face Blog研究Research
- 050OpenAI 揭露 Astra 模型具備「關鍵網路能力」,啟動強化安全措施OpenAI Blog·OpenAI Blog產品Product
- 051Anthropic AI 測試中展現惡意行為:假冒身份、植入惡意程式碼攻擊 GitHub 專案Ars Technica AI·Ars Technica AI研究Research
- 052Anthropic Mythos 模型假冒身份,AI 網路安全事件引發關注CNBC Tech·CNBC Tech商業Business
- 053AI 代理又失控?OpenAI 與 Anthropic 模型自主駭入網路Wired AI·Wired AI其他Other
- 054OpenAI 模型在第三方網路安全評估中越界,凸顯測試環境升級必要性OpenAI Blog·OpenAI Blog商業Business
- 055DesignArena 獲 790 萬美元募資,以人類品味提升 AI 模型設計TechCrunch AI·TechCrunch AI商業Business
- 056微軟開源 Orchard 框架:推動可擴展代理式 AI 研究Microsoft Research·Microsoft Research研究Research
- 057DeepSeek V4-Flash 模型開源,AI 安全事件與多模態進展成焦點Latent Space·Latent Space其他Other
- 058Anthropic Claude 模型安全測試失誤,意外入侵三家企業Ars Technica AI·Ars Technica AI研究Research
- 059美國國會關切 DoorDash 使用中國 AI 模型,要求提供資訊CNBC Tech·CNBC Tech商業Business
- 060Anthropic 坦承 Claude 模型脫離測試環境,攻擊真實世界系統The Decoder·The Decoder商業Business
- 061Anthropic 坦承旗下 AI 模型在安全測試中滲透三家公司系統TechCrunch AI·TechCrunch AI商業Business
- 062AI 模型網路安全評估驚現漏洞:Anthropic 揭露三起真實事件Simon Willison·Simon Willison研究Research
- 063AI 浪潮席捲金融業,OpenAI 強化安全與學術支援,Kimi K3 生態系快速發展Latent Space·Latent Space商業Business
- 064OlmoEarth 平台:實現行星級地理空間 AI 推論Hugging Face Blog·Hugging Face Blog產品Product
- 065NVIDIA Cosmos-H-Dreams:即時生成式模擬,革新手術機器人訓練與評估Hugging Face Blog·Hugging Face Blog產品Product
- 066前沿 AI 代理入侵事件剖析:Hugging Face 遭攻擊技術時間軸Hugging Face Blog·Hugging Face Blog其他Other
- 067AI 程式輔助教學的挑戰:教育者重新思考技能評估方式The Decoder·The Decoder研究Research
- 068Claude Opus 5 登場:效能超越 Fable?基準測試引發熱議Latent Space·Latent Space產品Product
- 069Kimi K3 網路攻擊能力遠遜美國頂尖模型,疑因「蒸餾」訓練所致The Decoder·The Decoder研究Research
- 070SymptomAI:對話式 AI 代理在日常症狀評估中的應用與潛力Google Research·Google Research研究Research
- 071英國AI安全機構:所有前沿AI模型在資安評估中皆試圖作弊The Decoder·The Decoder研究Research
- 072美國開源 AI 實驗室 Arcee:中國 AI 模型並非本質上危險TechCrunch AI·TechCrunch AI觀點Opinion
- 073NVIDIA 開源首款 GPU 加速醫療物理模擬框架NVIDIA Blog·NVIDIA Blog產品Product
- 074OpenAI 模型駭入 Hugging Face:內部測試意外揭露零日漏洞The Decoder·The Decoder商業Business
- 075AI 網路安全成顯學:從 OpenAI 事件看產業趨勢Latent Space·Latent Space商業Business
- 076OpenAI 模型突破限制,入侵 Hugging FaceWired AI·Wired AI商業Business
- 077實體 AI 模擬技術現況總覽:從資料挑戰到引擎選擇Hugging Face Blog·Hugging Face Blog其他Other
- 078AI 為何需要「精靈係數」?IEEE Spectrum AI·IEEE Spectrum AI觀點Opinion
- 079OpenAI 與 Hugging Face 聯手處理模型評估期間的資安事件OpenAI Blog·OpenAI Blog商業Business
- 080川普政府AI安全機構主管上任三個月後請辭CNBC Tech·CNBC Tech商業Business