autoregressive model
PulseAugur coverage of autoregressive model — every cluster mentioning autoregressive model across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
MegaParts 使用令牌高效自回归建模将3D对象生成扩展到300个部件
研究人员开发了MegaParts,一个新颖的3D对象生成框架,显著扩展了部件感知建模。通过采用令牌高效的矢量量化部件令牌和具有长上下文训练的结构化自回归序列建模,MegaParts可以处理多达300个部件的对象。与现有的自回归和扩散模型相比,这种方法实现了更高的网格质量,为大规模3D生成任务提供了一个引人注目的替代方案。
-
新的LHSDet方法使用VQA检测高分辨率AI生成图像
研究人员开发了LHSDet,一种检测高分辨率AI生成图像的新方法。该方法将检测任务重新构建为视觉问答问题,利用了视觉-语言框架。LHSDet采用独特的三分支架构,结合了图像块的低级视觉特征、高级全局感知特征以及文本标题的语义特征,以有效识别来自各种模型(包括扩散和自回归类型)的AI生成图像中的伪影。
-
Continuous Interaction Diffusion (CID) 架构增强了 LLM 的工具使用能力
研究人员推出了一种新颖的扩散语言模型 (dLLMs) 架构——Continuous Interaction Diffusion (CID),它增强了 dLLMs 使用外部工具的能力。与需要暂停生成以等待工具结果的自回归模型不同,CID 将工具交互直接集成到迭代去噪过程中。这使得信息的使用更有效、更及时,因为工具调用可以在推理周期的早期启动并整合结果,从而可能提高准确性并减少冗余计算。
-
新研究探索使用Transformer对动力学系统进行建模 · 跟踪2个来源
两篇新的arXiv论文探讨了Transformer模型在理解和预测动力学系统中的应用。第一篇论文分析了单层Transformer的机械特性,将因果自注意力解释为历史依赖的递归,并识别了线性和非线性系统的运行模式。第二篇论文介绍了一种用于ODEFormer(一个将ODE轨迹映射到方程的预训练Transformer)的验证器引导工作流程,以提高这些模型向高维物理数据的可靠迁移能力,并实现可解释、物理可审计的预测。
-
新的HERO训练方法提高了神经算子长时域的准确性
研究人员引入了HERO(History-Enriched Rollout Training,历史增强回滚训练),一种旨在提高自回归神经算子长时域准确性的新方法。该技术解决了模型递归使用自身预测时误差累积的问题,这是模拟时间相关偏微分方程时的一个常见问题。HERO通过整合源自模型优化历史的相对监督来增强标准训练,使用一组排序的候选回滚来建立更具信息量的比较基线。在九个PDE基准上的实验表明,HERO在不增加推理时间的情况下,始终提高了长…
-
调查论文详述文本驱动的图像编辑进展
本调查论文全面回顾了基于指令的图像编辑(IIE)领域,该领域利用文本提示来修改图像。它将IIE研究按数据构建、模型架构(从GANs到扩散和自回归模型)以及评估方法进行了分类。该论文还引入了一个新的基准CDD-IIE Bench,以严格评估模型性能,并讨论了未来的研究方向。
-
LeapTalk框架实现200 FPS的实时说话人头像生成
研究人员开发了LeapTalk,一个旨在克服说话人头像生成中延迟-质量权衡的新型框架。这种新方法能够通过单次前向传播实现稳定、实时的视频生成,并能处理任意长度的视频。LeapTalk利用基于布朗桥的数据到数据传输公式和异构蒸馏框架来确保时间稳定性和平滑的知识转移。该系统实现了高保真唇形同步,视频生成速度最高可达200 FPS,显著提高了效率和稳定性,优于现有方法。
-
新方法估计自回归模型中的分布差异
研究人员开发了新的方法来估计自回归模型生成的分布之间的全变分(TV)距离。这些方法解决了这样一个挑战:即使服务于相同模型权重的不同推理引擎,由于实现选择和优化,也可能产生不同的输出分布。所提出的算法在各种访问模型(包括样本访问、logit访问和噪声logit访问)下提供了改进的查询复杂度,实证评估证明了它们的实用性和鲁棒性。
-
新的生成式精炼网络推动视觉合成基准发展
研究人员推出了一种新颖的视觉合成范式——生成式精炼网络(GRN),旨在克服扩散模型在计算上的低效率以及自回归模型的局限性。GRN利用分层二元量化(HBQ)实现近乎无损的离散标记化,并引入全局精炼机制进行渐进式图像校正,类似于人类艺术家。一种熵引导的采样策略允许在不牺牲视觉质量的情况下进行面向复杂度的生成。GRN在ImageNet的图像重建和类别条件生成方面设定了新的基准,并在文本到图像和文本到视频合成方面展现出潜力。
-
新框架提高了自回归图像生成的质量
研究人员开发了一个名为信息锚定(IGG)的新框架,以提高自回归(AR)模型生成图像的质量。该方法解决了AR模型在渐进式分辨率缩放过程中出现的_信息不一致_问题,这可能导致特征不准确或模糊。IGG使用动态加权机制将引导信号锚定到语义上重要的token,确保引导与图像内容之间更好的对齐。该框架在类别条件生成和文本到图像生成任务中都证明了其在生成更清晰、更连贯、语义更强的图像方面的有效性。
-
苹果研究人员通过新的解码技术推进扩散语言模型
苹果的机器学习研究部门发表了几篇论文,详细介绍了扩散语言模型(dLLMs)的进展。与自回归模型相比,这些模型通过并行解码多个 token,有可能实现更快的推理。研究包括探索用于口语模型的连续扩散、通过残差上下文扩散(RCD)提高 dLLM 的效率,以及使用强化学习训练解遮蔽策略。其他工作则侧重于通过专家产品(PoE)等技术弥合扩散模型和自回归模型之间的差距,并开发统一不同解码策略的混合模型。
-
全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展
研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…
-
新的反思性掩码技术使扩散模型能够进行多轮推理
研究人员引入了反思性掩码(RM),这是一种后训练技术,使掩码扩散模型(MDMs)能够通过迭代自我修正来进行多轮推理。与顺序生成的自回归模型不同,MDMs可以自然地在本地优化输出。RM允许这些模型根据不断变化的上下文重新审视和修改先前的输出,而无需进行架构更改。该方法包含一种称为历史参考的无参数机制,以帮助模型在修改过程中避免重复错误,并在文本生成、数独和图像编辑等任务中表现出改进的性能。
-
新的并行Jacobi解码加速图像生成模型
研究人员开发了一种名为并行Jacobi解码(PJD)的新方法,以加速自回归图像生成模型。该技术在二维空间域中扩展草稿令牌,允许并行细化并减轻错误累积。PJD可以在保持高质量的同时,将各种模型的图像生成速度提高4.8倍至6.4倍。
-
新方法增强了自回归模型的组合泛化能力
研究人员开发了一种新的自回归模型组合方法,其灵感来源于扩散模型中使用的组合策略。该方法基于因子化条件假设,确保每个组件模型都能控制其指定的输出子空间,从而防止干扰。研究表明,在特定条件下,这种组合方法可以保持长度泛化行为,为理解自回归系统中稳定的模型组合和合并提供了原则性的认识。
-
神经网络解决量子蒙特卡洛符号问题
研究人员开发了一种使用神经自回归控制变量的新方法来解决量子蒙特卡洛模拟中的符号问题。该技术采用两个自回归模型,每个模型仅限于正负符号扇区,以创建零均值控制变量。这种无偏可观测量显著降低了方差,提高了模拟的准确性。该方法已证明,即使对于低于 10^-3 的平均符号,标准误差也能降低一个数量级,能量估计误差也能降低三到五倍。
-
NVIDIA 发布 Nemotron-Labs 扩散语言模型,实现更快的文本生成
NVIDIA 推出了名为 Nemotron-Labs Diffusion 的新型扩散语言模型(DLM)系列,旨在克服传统自回归模型的局限性。这些 DLM 通过并行创建多个 token,然后进行迭代优化来生成文本,有望提高速度并能够修改之前的输出。该模型提供 3B、8B 和 14B 参数规模的版本,包括基础模型和指令微调的聊天模型变体,并包含一个视觉语言模型。
-
新研究解决扩散语言模型的局限性
研究人员正在探索改进扩散语言模型(DLM)的新方法,与自回归模型相比,DLM 提供了更快的推理速度。几篇近期论文介绍了增强 DLM 性能的技术,包括用于解耦重掩码的 NAVIRA、用于使用丢弃标记进行检索增强生成的 SARDI,以及用于支持标记揭示的 AXON。另一项研究确定了 DLM 的局限性,例如局部性偏差和来自掩码标记的干扰,并提出了一种无掩码的损失函数来改善上下文理解。此外,一项调查全面概述了 DLM 的格局,涵盖了基本原理、…
-
生成模型在两个不同的训练时间尺度上学习规则
研究人员在生成模型训练中识别出两个不同的时间尺度:生成变得规则有效的点($\tau_{\mathrm{rule}}$)和模型开始重现训练样本的点($\tau_{\mathrm{mem}}$)。两者之间的时间间隔被称为“创新窗口”,它随着数据集的增大而扩大,随着规则复杂度的增加而缩小。这种现象在扩散模型和自回归模型中都得到了观察,它解释了这些模型何时以及如何展现出真正的创新。