研究人员推出DementiaCare-Bench,一个旨在评估视觉-语言模型(VLMs)在理解和响应失智症行为和心理症状(BPSD)方面能力的新视频基准。该基准包含56个训练视频,划分为94个片段,并通过多代理管道生成了2023个问题。初步评估显示,当前VLMs在需要有序帧或判断照护者适当性的问题上表现不佳,准确率显著下降。经过微调的模型DemCare-VLM在视频依赖性方面有所改进。 AI
影响 该基准有望推动更精细的AI系统在老年护理领域的发展,从而改善照护者支持和患者理解。
排序理由 该项目描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
- Afrouz Sheikholeslami
- arXiv
- DemCare-VLM
- DementiaCare-Bench
- Hugging Face
- University of Washington Biological Physics, Structure & Design Program
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →