研究人员推出了ARGenSeg,一个将图像分割与自回归图像生成模型相结合的新框架。该方法使多模态大语言模型(MLLMs)能够通过直接从视觉标记生成密集掩码来实现像素级感知。与依赖离散表示或单独分割头的先前方法不同,ARGenSeg利用MLLM的理解来生成掩码,显著提高了细粒度视觉细节的捕捉能力。该系统还采用了一种下一尺度预测策略来并行化视觉标记生成,减少了推理延迟,并在各种分割数据集上以速度和准确性超越了现有的最先进方法。 AI
影响 这项研究可能使多模态人工智能系统具备更复杂的视觉理解能力,从而可能改进图像分析和内容生成领域的应用。
排序理由 该集群描述了一篇关于图像分割新框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- ARGenSeg
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MLLMs
- ScienceCast
- VQ-VAE
- Xiaolong Wang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →