研究人员开发了mmMind,这是一种新颖的雷达-语言模型,旨在使大型语言模型能够理解物理空间中的人类行为。该模型在训练期间利用同步的3D姿态数据作为监督,使其在推理时仅凭毫米波雷达信号就能捕捉身体配置和运动动态。为了评估其有效性,研究团队还推出了mmMind-Bench,这是一个包含17.9小时真实世界录音的基准数据集。实验表明,在行为字幕和问答等任务中,mmMind的性能显著优于现有的雷达-语言基线,并且消融研究证实了姿态引导预训练的关键作用。 AI
影响 使大型语言模型能够从隐私保护的毫米波雷达数据中解读人类行为,有望推动机器人技术和人机交互等领域的应用。
排序理由 详细介绍新模型和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Hugging Face
- Large language model
- mmMind
- mmMind-Bench
- mmWave sensing
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →