「LLM 評估」
12 results- 001AI 代理聲稱完成任務,資料庫卻不同意:微軟 ThinkingBox 揭露 LLM 代理的可靠性挑戰Hugging Face Blog·Hugging Face Blog商業Business
- 002BenchMIRT:剖析大型語言模型基準測試的潛在能力Hugging Face Blog·Hugging Face Blog研究Research
- 003AI 家教何時該出手?TutorMoments 評估大型語言模型輔導的「分寸」Hugging Face Blog·Hugging Face Blog研究Research
- 004AI 代理進化:從問答機器人到自主工作夥伴The Decoder·The Decoder觀點Opinion
- 005Hugging Face Jobs:一鍵部署 vLLM 伺服器Hugging Face Blog·Hugging Face Blog教學Tutorial
- 006新創公司Subquadratic聲稱突破大型語言模型瓶頸MIT Technology Review AI·MIT Technology Review AI產品Product
- 007olmo-eval:大型語言模型開發的整合式評估工作台Hugging Face Blog·Hugging Face Blog產品Product
- 008微軟研究:AI 長期委派任務的可靠性挑戰與展望Microsoft Research·Microsoft Research研究Research
- 009強化代理:推論時回饋機制優化工具呼叫代理Apple Machine Learning Research·Apple Machine Learning Research研究Research
- 010LLM 智慧思考:Apple 提出動態調整推理預算新方法Apple Machine Learning Research·Apple Machine Learning Research研究Research
- 011大型語言模型產品評估:三步驟加速開發與迭代Eugene Yan·Eugene Yan產品Product
- 012多代理系統故障診斷新突破:自動化歸因方法與基準測試Synced Review·Synced Review研究Research