研究人员开发了一种新的系统,用于检测手术增强现实(AR)应用中的视觉遮挡。该系统采用级联视觉语言模型(VLM)架构,结合了对象识别和基于分割的推理,以识别虚拟内容何时遮挡了重要的手术器械。这种方法旨在通过使用较小的VLM处理简单情况,并使用带有修剪过的视觉标记的较大VLM处理更复杂的情况来减少推理延迟。一个新构建的基准测试,基于叠加了虚拟内容的手术工具图像,证明了该系统的有效性,准确率达到87.43%,平均延迟为479毫秒,与基于云的基线相比有了显著降低。 AI
影响 提高了增强现实系统在手术等关键环境中的安全性和可用性。
排序理由 学术论文,详细介绍了特定应用的新颖系统和基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- cloud large-model baseline
- Hugging Face
- Instruments
- pseudo-AR surgical obstruction detection benchmark
- Real-Time Visual Obstruction Detection in Surgical Augmented Reality
- Surgical augmented reality
- surgical-tool images
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →