最近发表在arXiv上的一篇研究论文揭示了计算病理学中用于全切片图像(WSI)分析的多模态基准中存在严重的数据泄露问题。研究发现,患者级别和机构级别的数据污染普遍存在,在源自TCGA的基准中,重叠率高达92.3%至100%。这种泄露损害了视觉语言模型(VLM)的评估,使得区分真正的多模态推理和对伪影的记忆变得困难。研究人员提出了创建无污染评估的具体建议,以确保该领域取得可验证的进展。 AI
影响 强调了AI评估方法中的关键缺陷,为医学AI的可靠进展需要更严格的数据处理和基准构建。
排序理由 该集群包含一篇详细介绍AI基准方法论缺陷的研究论文。
- arXiv
- Computational Pathology
- Multimodal Benchmarks
- The Cancer Genome Atlas
- Tissue Source Site
- Vision-Language Models
- Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →