一项对2023年至2026年医疗大型语言模型进行的最新研究显示,模型发布日期与评估研究发表日期之间的差距日益扩大。研究发现,尽管与医疗LLM相关的出版物数量激增,但绝大多数并未采用随机对照试验等严谨的研究设计。此外,从模型发布到其在已发表研究中进行评估的时间滞后显著增加,许多研究评估的是已停产的模型系列。 AI
影响 凸显了AI研究评估中的一个关键问题,表明需要对医疗LLM进行更快、更严谨的评估。
排序理由 该条目是一篇发表在arXiv上的研究论文,详细介绍了关于医疗LLM评估的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- PubMed
- Raad Bin Tareaf
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →