PulseAugur
实时 13:08:35
English(EN) Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

新方法增强用于图像生成的视觉自回归模型

研究人员开发了新方法来提高视觉自回归模型的效率和性能。一种方法,Shift-and-Sum Quantization(移位求和量化),解决了图像生成任务中注意力值乘积的重建误差和校准数据差异。另一个框架UniAR,使用单一视觉分词器统一多模态理解和生成,通过多级特征融合和比特量化在图像生成和编辑方面取得了最先进的成果。 AI

影响 这些在量化和统一多模态建模方面的进展可能带来更高效、更强大的图像生成和理解人工智能系统。

排序理由 该集群包含两篇研究论文,详细介绍了视觉自回归模型的新方法和框架。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →

新方法增强用于图像生成的视觉自回归模型

报道来源 [4]

  1. arXiv cs.LG TIER_1 English(EN) · Jaehyeon Moon, Bumsub Ham ·

    面向视觉自回归模型的移位求和量化

    arXiv:2606.16131v1 Announce Type: cross Abstract: Post-training quantization (PTQ) enables efficient deployment of deep networks using a small set of data. Its application to visual autoregressive models (VAR), however, remains relatively unexplored. We identify two key challenge…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    统一的自回归多模态建模与共享的上下文-视觉标记器是实现统一的关键

    UniAR presents a unified autoregressive framework that uses a single discrete visual tokenizer to bridge visual understanding and generation, achieving state-of-the-art results in image generation and editing through multi-level feature fusion, bitwise quantization, and parallel …

  3. arXiv cs.CV TIER_1 English(EN) · Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai ·

    共享上下文视觉标记器的统一多模态自回归建模是实现统一的关键

    arXiv:2606.18249v1 Announce Type: new Abstract: Unified Multimodal Modeling aims to integrate visual understanding and generation within a single system. However, existing approaches typically rely on two disparate visual tokenizers, which splits the representation space and hind…

  4. arXiv cs.CV TIER_1 English(EN) · Shuai Bai ·

    共享上下文视觉标记器的统一多模态自回归建模是实现统一的关键

    Unified Multimodal Modeling aims to integrate visual understanding and generation within a single system. However, existing approaches typically rely on two disparate visual tokenizers, which splits the representation space and hinders truly unified modeling. We propose UniAR, a …