一项发表在arXiv上的新研究介绍了一种名为“相同输入重跑”的方法,用于评估临床大型语言模型(LLM)代理的动作级可靠性。该方法多次重放相同的输入,以检查代理是否始终如一地产生相同的动作,例如开具检查单或处方药物。研究发现,即使基准测试报告了相同的成功判决,动作也存在显著差异,这凸显了当前临床LLM代理评估实践中的不足。 AI
影响 强调了临床LLM代理潜在的不可靠性,促使制定新的评估标准以实现更安全的部署。
排序理由 研究论文,详细介绍了一种LLM代理的新评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- MedAgentBench
- Rohith Reddy Bellibatlu
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →