PulseAugur
实时 13:27:18
实体 Autoregressive visual models

Autoregressive visual models

PulseAugur coverage of Autoregressive visual models — every cluster mentioning Autoregressive visual models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_106747 ·

    新的Gazer框架使用LLM纠正视觉模型错误

    研究人员开发了Gazer,一个新颖的框架,旨在通过整合多模态大型语言模型的反馈来改进自回归视觉模型(AVMs)。这种无需训练的方法解决了AVMs在生成过程中经常累积的语义错误。Gazer分两个阶段进行:首先,它诊断中间生成状态的语义错误,然后纠正生成轨迹以更好地与目标提示对齐。实验表明,Gazer在无需额外训练的情况下提高了图像和视频合成中的语义对齐和组合准确性。

  2. RESEARCH · CL_100239 ·

    新的AI框架解决了视觉模型错误和事件相机数据处理问题 · 跟踪3个来源

    研究人员推出了一种名为Gazer的新型框架,该框架通过整合来自多模态大型语言模型的反馈来改进自回归视觉模型(AVMs)。Gazer分两个阶段进行:诊断中间生成状态的语义错误,然后纠正生成轨迹。这种方法在无需额外训练的情况下提高了图像和视频合成的语义对齐和组合准确性。此外,还开发了一个名为CapRiCorn-1K的新基准来评估视频字幕和主体指代一致性,结果显示当前模型在这些任务上存在困难,尤其是在视频时长增加时。另外,还提出了一个名为N…

  3. TOOL · CL_66229 ·

    新型适配器提升自回归模型文本渲染精度

    研究人员开发了一种残差解码器适配器(RDA),可在不重新训练整个系统的情况下提高自回归视觉模型的文本渲染能力。RDA 通过使用配对码本和学习残差差异的并行分支来优化现有视觉分词器的输出。这种方法显著提高了文本渲染精度,在 TextVisionBlend 和 StyledTextSynth 等基准测试中 OCR 精度大幅提升得到了证明。