PulseAugur
中
实时 06:53:11
实体 autoregressive model

autoregressive model

PulseAugur coverage of autoregressive model — every cluster mentioning autoregressive model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
21
90 天内 21
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_275140 ·

    新框架GeoSim分析用于图像恢复的VLM表示

    研究人员开发了一个名为GeoSim的新框架,用于分析视觉语言模型(VLM)在低层图像恢复任务中的内部表示。该研究调查了不同的VLM架构,如自回归模型和扩散Transformer,如何组织其像素级感知的表示。GeoSim采用四级分析来揭示潜在的组织原则,并识别跨任务和跨模型可迁移性方面的局限性。

  2. TOOL · CL_273244 ·

    AI视频生成更好地与人眼视觉皮层对齐

    研究人员开发了一种新方法,通过将视频生成模型的内部表征与人眼视觉皮层活动进行比较来评估模型。他们发现,自回归(AR)视频扩散模型在生成未来视频帧时,比处理观察视频的模型更能与人眼视觉皮层对齐。与用于观察视频重建的低阶区域相比,这种对齐在未来生成中更高阶的视觉皮层区域更为明显。一项人类行为实验进一步支持了这些发现,显示出人们更偏好通过放大与视觉皮层活动更匹配的层来生成的视频。

  3. TOOL · CL_269389 ·

    新的SPRINT模型单步生成推荐,提高效率和准确性

    研究人员推出SPRINT,一种新颖的单步生成式推荐系统,它绕过了现有自回归和非自回归模型中常见的逐个token生成。通过将物品推荐视为token生成概率的流动,并以平均概率速度来表征,SPRINT可以在一次前向传播中生成推荐。这种方法带来了显著的效率提升,与同类方法相比速度提升了8.39-10.04倍,同时推荐准确率平均提高了7.77%。该系统利用双向Transformer和双层流对比目标来保持生成token之间的一致性。

  4. TOOL · CL_243711 ·

    扩散语言模型速度超过1000 token/秒

    扩散语言模型正成为一种新范式,能够以超过每秒1000 token的速度生成文本。这标志着与传统的自回归模型(逐个token生成文本)相比有了重大转变。这一进步可能带来更快、更高效的AI应用。

  5. RESEARCH · CL_217749 ·

    AI初创公司VIDRAFT推出AX-RAY以检测模型中隐藏的因果泄露

    AI安全初创公司VIDRAFT开发了一个名为AX-RAY的新审计框架,用于检测混合序列模型中的因果泄露。这种泄露发生在未来令牌信息不当地影响早期位置时,这种缺陷会人为地夸大性能指标。该框架在arXiv论文中进行了详细介绍,在注入合成故障后,成功地在两个已公开的模型Nemotron-H-8B和Zamba2-1.2B中识别出了这个问题。AX-RAY旨在为AI模型提供一种精确、无需训练且与架构无关的验证技术。

  6. RESEARCH · CL_205661 ·

    MegaParts 使用令牌高效自回归建模将3D对象生成扩展到300个部件

    研究人员开发了MegaParts,一个新颖的3D对象生成框架,显著扩展了部件感知建模。通过采用令牌高效的矢量量化部件令牌和具有长上下文训练的结构化自回归序列建模,MegaParts可以处理多达300个部件的对象。与现有的自回归和扩散模型相比,这种方法实现了更高的网格质量,为大规模3D生成任务提供了一个引人注目的替代方案。

  7. TOOL · CL_193984 ·

    新的LHSDet方法使用VQA检测高分辨率AI生成图像

    研究人员开发了LHSDet,一种检测高分辨率AI生成图像的新方法。该方法将检测任务重新构建为视觉问答问题,利用了视觉-语言框架。LHSDet采用独特的三分支架构,结合了图像块的低级视觉特征、高级全局感知特征以及文本标题的语义特征,以有效识别来自各种模型(包括扩散和自回归类型)的AI生成图像中的伪影。

  8. RESEARCH · CL_195819 ·

    Continuous Interaction Diffusion (CID) 架构增强了 LLM 的工具使用能力

    研究人员推出了一种新颖的扩散语言模型 (dLLMs) 架构——Continuous Interaction Diffusion (CID),它增强了 dLLMs 使用外部工具的能力。与需要暂停生成以等待工具结果的自回归模型不同,CID 将工具交互直接集成到迭代去噪过程中。这使得信息的使用更有效、更及时,因为工具调用可以在推理周期的早期启动并整合结果,从而可能提高准确性并减少冗余计算。

  9. RESEARCH · CL_183118 ·

    新研究探索使用Transformer对动力学系统进行建模 · 跟踪2个来源

    两篇新的arXiv论文探讨了Transformer模型在理解和预测动力学系统中的应用。第一篇论文分析了单层Transformer的机械特性,将因果自注意力解释为历史依赖的递归,并识别了线性和非线性系统的运行模式。第二篇论文介绍了一种用于ODEFormer(一个将ODE轨迹映射到方程的预训练Transformer)的验证器引导工作流程,以提高这些模型向高维物理数据的可靠迁移能力,并实现可解释、物理可审计的预测。

  10. TOOL · CL_178318 ·

    新的HERO训练方法提高了神经算子长时域的准确性

    研究人员引入了HERO(History-Enriched Rollout Training,历史增强回滚训练),一种旨在提高自回归神经算子长时域准确性的新方法。该技术解决了模型递归使用自身预测时误差累积的问题,这是模拟时间相关偏微分方程时的一个常见问题。HERO通过整合源自模型优化历史的相对监督来增强标准训练,使用一组排序的候选回滚来建立更具信息量的比较基线。在九个PDE基准上的实验表明,HERO在不增加推理时间的情况下,始终提高了长…

  11. TOOL · CL_169806 ·

    调查论文详述文本驱动的图像编辑进展

    本调查论文全面回顾了基于指令的图像编辑(IIE)领域,该领域利用文本提示来修改图像。它将IIE研究按数据构建、模型架构(从GANs到扩散和自回归模型)以及评估方法进行了分类。该论文还引入了一个新的基准CDD-IIE Bench,以严格评估模型性能,并讨论了未来的研究方向。

  12. RESEARCH · CL_180897 ·

    LeapTalk框架实现200 FPS的实时说话人头像生成

    研究人员开发了LeapTalk,一个旨在克服说话人头像生成中延迟-质量权衡的新型框架。这种新方法能够通过单次前向传播实现稳定、实时的视频生成,并能处理任意长度的视频。LeapTalk利用基于布朗桥的数据到数据传输公式和异构蒸馏框架来确保时间稳定性和平滑的知识转移。该系统实现了高保真唇形同步,视频生成速度最高可达200 FPS,显著提高了效率和稳定性,优于现有方法。

  13. TOOL · CL_158489 ·

    新方法估计自回归模型中的分布差异

    研究人员开发了新的方法来估计自回归模型生成的分布之间的全变分(TV)距离。这些方法解决了这样一个挑战:即使服务于相同模型权重的不同推理引擎,由于实现选择和优化,也可能产生不同的输出分布。所提出的算法在各种访问模型(包括样本访问、logit访问和噪声logit访问)下提供了改进的查询复杂度,实证评估证明了它们的实用性和鲁棒性。

  14. TOOL · CL_131678 ·

    新的生成式精炼网络推动视觉合成基准发展

    研究人员推出了一种新颖的视觉合成范式——生成式精炼网络(GRN),旨在克服扩散模型在计算上的低效率以及自回归模型的局限性。GRN利用分层二元量化(HBQ)实现近乎无损的离散标记化,并引入全局精炼机制进行渐进式图像校正,类似于人类艺术家。一种熵引导的采样策略允许在不牺牲视觉质量的情况下进行面向复杂度的生成。GRN在ImageNet的图像重建和类别条件生成方面设定了新的基准,并在文本到图像和文本到视频合成方面展现出潜力。

  15. TOOL · CL_131510 ·

    新框架提高了自回归图像生成的质量

    研究人员开发了一个名为信息锚定(IGG)的新框架,以提高自回归(AR)模型生成图像的质量。该方法解决了AR模型在渐进式分辨率缩放过程中出现的_信息不一致_问题,这可能导致特征不准确或模糊。IGG使用动态加权机制将引导信号锚定到语义上重要的token,确保引导与图像内容之间更好的对齐。该框架在类别条件生成和文本到图像生成任务中都证明了其在生成更清晰、更连贯、语义更强的图像方面的有效性。

  16. RESEARCH · CL_115152 ·

    苹果研究人员通过新的解码技术推进扩散语言模型

    苹果的机器学习研究部门发表了几篇论文,详细介绍了扩散语言模型(dLLMs)的进展。与自回归模型相比,这些模型通过并行解码多个 token,有可能实现更快的推理。研究包括探索用于口语模型的连续扩散、通过残差上下文扩散(RCD)提高 dLLM 的效率,以及使用强化学习训练解遮蔽策略。其他工作则侧重于通过专家产品(PoE)等技术弥合扩散模型和自回归模型之间的差距,并开发统一不同解码策略的混合模型。

  17. RESEARCH · CL_91397 ·

    全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展

    研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…

  18. TOOL · CL_106579 ·

    新的反思性掩码技术使扩散模型能够进行多轮推理

    研究人员引入了反思性掩码(RM),这是一种后训练技术,使掩码扩散模型(MDMs)能够通过迭代自我修正来进行多轮推理。与顺序生成的自回归模型不同,MDMs可以自然地在本地优化输出。RM允许这些模型根据不断变化的上下文重新审视和修改先前的输出,而无需进行架构更改。该方法包含一种称为历史参考的无参数机制,以帮助模型在修改过程中避免重复错误,并在文本生成、数独和图像编辑等任务中表现出改进的性能。

  19. RESEARCH · CL_72628 ·

    新的并行Jacobi解码加速图像生成模型

    研究人员开发了一种名为并行Jacobi解码(PJD)的新方法,以加速自回归图像生成模型。该技术在二维空间域中扩展草稿令牌,允许并行细化并减轻错误累积。PJD可以在保持高质量的同时,将各种模型的图像生成速度提高4.8倍至6.4倍。

  20. TOOL · CL_56408 ·

    新方法增强了自回归模型的组合泛化能力

    研究人员开发了一种新的自回归模型组合方法,其灵感来源于扩散模型中使用的组合策略。该方法基于因子化条件假设,确保每个组件模型都能控制其指定的输出子空间,从而防止干扰。研究表明,在特定条件下,这种组合方法可以保持长度泛化行为,为理解自回归系统中稳定的模型组合和合并提供了原则性的认识。