一项名为RheumBench的新基准测试揭示了十种不同的大型语言模型在应用于风湿病学任务时存在显著的性能问题和严重错误。该评估使用由医学专家验证的评分卡,还发现这些模型在其不正确的回答中表现出过度自信。这凸显了在风湿病学等专业医疗领域使用大型语言模型存在关键的安全隐患。 AI
影响 凸显了大型语言模型在专业医疗应用中的关键安全隐患和性能差距,可能减缓其在医疗保健领域的应用。
排序理由 该集群描述了一个新的学术基准及其在特定领域关于大型语言模型性能的发现。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →