PulseAugur
实时 10:58:41

SurgNarrator 框架通过生成式检索增强手术视频理解能力

研究人员推出 SurgNarrator,一个新颖的生成式检索框架,旨在增强手术视频的理解能力。该框架通过平衡全面推理和低延迟来解决现有方法的局限性,这对于时间敏感的临床应用至关重要。SurgNarrator 使用精选的手术特定词汇,并采用时间感知对比目标来调整 Qwen3-VL-Embedding-8B 模型,以学习具有区分性的临床表征。其分层检索策略在零样本设置下显著降低了延迟,同时在十二个基准测试中取得了强劲的性能。 AI

影响 该框架通过实现更快、更准确的视频分析,有望改善手术过程中的实时决策和支持。

排序理由 该条目描述了一篇详细介绍用于手术视频理解的新颖框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SurgNarrator 框架通过生成式检索增强手术视频理解能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang ·

    SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

    arXiv:2608.04676v1 Announce Type: new Abstract: Surgical procedures unfold as structured and recurring clinical events, whose real-time understanding via intraoperative surgical videos is critical for intraoperative decision-making and support. However, existing video understandi…