研究人员开发了两个新的基准测试 HealthLoopQA 和 WearableQA,旨在评估大型语言模型 (LLM) 在解读来自可穿戴设备的复杂、纵向健康数据方面的能力。HealthLoopQA 专注于糖尿病护理,包含一个包含十一种推理能力的分类法以及一个用于设备故障和网络物理攻击的模拟测试平台。WearableQA 则使用了来自 200 名用户、为期 500 天的真实世界数据,包含 16 种类型的 4,084 个多项选择题,以评估数据与健康推理以及单信号与跨信号解释。这两个基准测试都揭示了当前大型语言模型在长期医学推理方面存在显著局限性,并突出了“上下文内懒惰”等问题。 AI
影响 这些基准测试将推动能够从可穿戴数据中进行更准确、更可靠的长期健康推理的大型语言模型的发展。
排序理由 两篇介绍在特定领域用于大型语言模型评估的新颖基准测试的研究论文。
在 Hugging Face Daily Papers 阅读 →
- anomaly detection
- cyber-physical attack
- diabetes
- HealthLoopQA
- Hugging Face
- In-context Laziness
- large language models
- prediction
- wearable monitoring data
- WearableQA
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →