跳到主要內容
maxstudioNews
Search the archive

Search

「LLM 評估」

12 results
  1. 001AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·
  2. 002BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·
  3. 003AI 家教何時該出手?TutorMoments 評估大型語言模型輔導的「分寸」Hugging Face Blog·
  4. 004AI 代理進化:從問答機器人到自主工作夥伴The Decoder·
  5. 005Hugging Face Jobs:一鍵部署 vLLM 伺服器Hugging Face Blog·
  6. 006新創公司Subquadratic聲稱突破大型語言模型瓶頸MIT Technology Review AI·
  7. 007olmo-eval:大型語言模型開發的整合式評估工作台Hugging Face Blog·
  8. 008微軟研究:AI 長期委派任務的可靠性挑戰與展望Microsoft Research·
  9. 009強化代理:推論時回饋機制優化工具呼叫代理Apple Machine Learning Research·
  10. 010LLM 智慧思考:Apple 提出動態調整推理預算新方法Apple Machine Learning Research·
  11. 011大型語言模型產品評估:三步驟加速開發與迭代Eugene Yan·
  12. 012多代理系統故障診斷新突破:自動化歸因方法與基準測試Synced Review·