研究人员开发了新的数据集和管道,以提高视觉语言模型(VLM)对手术视频的理解能力。SurgAtlas是一个大规模数据集,包含超过2391小时的手术视频,涵盖开放和微创手术,并提供多样化的注释用于训练基础模型。此外,SurgSTU-Pipeline生成手术视频的细粒度时空问答样本,解决了手动创建此类数据集的挑战。当应用于现有的手术视频数据时,该管道创建了SurgSTU数据集,该数据集已被证明可以增强VLM在手术情境下的时空理解能力。 AI
影响 这些进展可能带来更先进的计算机辅助手术和医学培训AI工具。
排序理由 该集群描述了介绍用于手术视频理解的数据集和管道的新研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- computer-assisted surgery
- Hugging Face
- large-language models
- Lennart Maack
- SurgSTU
- SurgSTU-Pipeline
- vision-language model
- Qwen3-VL-8B
- SurgAtlas
- YouTube
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →