PulseAugur
中
实时 07:51:48
实体 Diffusion Transformer

Diffusion Transformer

PulseAugur coverage of Diffusion Transformer — every cluster mentioning Diffusion Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
229
90 天内 231
发布 · 30天
0
90 天内 0
论文 · 30天
189
90 天内 189
层级分布 · 90 天
主题
关系
情绪 · 30 天

17 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_289387 ·

    新的REACT框架利用VLA模型提升机器人控制的反应速度

    研究人员开发了REACT,一个旨在增强基于流的视觉-语言-动作(VLA)模型在机器人控制中反应速度的新框架。该系统维护一个持久的动作缓冲区,允许在部署前根据最新观察结果持续优化动作。通过解耦感知、VLM编码、去噪和动作执行,REACT能够在计算约束下实现高频更新和动作流式传输。在RoboTwin 2.0基准测试和真实机器人任务上的演示表明,与现有方法相比,任务成功率有所提高,反应延迟降低,轨迹也更平滑。

  2. TOOL · CL_287222 ·

    新的“位置强制”方法提升3D生成模型质量

    研究人员推出了一种名为“位置强制”(Position Forcing)的新型自条件框架,旨在提升3D生成模型的质量。该方法通过在去噪过程中从潜在估计中恢复和精炼位置信息,解决了单阶段模型隐式推断令牌位置的局限性。通过将这些逐步细化的位置编码反馈到扩散Transformer中,“位置强制”沿着粗到精的轨迹引导形状生成,从而获得可与某些多阶段方法相媲美甚至超越的改进结果。

  3. TOOL · CL_287223 ·

    新方法实现实时联合音视频生成

    研究人员开发了一种新颖的、使用扩散 Transformer 进行实时联合音视频生成的方法。该方法利用并行适配器组合,将用于流式视频的因果适配器与现成的几步适配器相结合。并行训练策略确保两个适配器的权重更新正交,防止干扰,并允许在推理时简单地将它们相加。生成的系统在 480x832 的分辨率下实现了约 26 帧/秒的实时生成速度,并在长时间内保持稳定的图像质量。

  4. TOOL · CL_286932 ·

    新型世界模型旨在简化AI数据策展

    研究人员推出LeCuration,这是一种新颖的小型世界模型,旨在协助物理AI应用的数据组织、过滤和策展。该模型利用LeWorldModel编码器和扩散Transformer解码器来预测游戏状态和识别异常。虽然目前仅在CS:GO游戏数据上进行了概念验证,但团队计划在未来探索量化策展指标和下游训练结果。

  5. TOOL · CL_280168 ·

    新的DAGS方法通过时间稳定性增强了DiT图像生成

    研究人员开发了DAGS,一种用于Diffusion Transformers (DiTs) 的新型条件方案,可提高图像生成质量和时间稳定性。该方法使用轻量级的、无注意力的编码器来引导一个固定的DiT,从而可以在不冒模型主干过拟合的风险的情况下独立控制外观和几何。DAGS集成了循环光照稳定器和无需训练的时间引导项,将每帧图像模型转变为流式渲染器,能够以比路径追踪更低的计算量生成高质量、可控的视觉效果。

  6. RESEARCH · CL_278611 ·

    循环循环Transformer架构显示出改进的状态跟踪能力

    研究人员推出了一种新颖的循环循环Transformer (RLT)架构,该架构通过将Transformer层分解为并行编码器和循环解码器来增强状态跟踪。这种设计允许计算路径以固定的每令牌成本随序列长度增长,在算法任务上显著优于标准Transformer。RLT在将奇偶校验泛化到更长的比特序列和排列跟踪任务方面表现出卓越的准确性,并且随着解码器深度的增加,性能有所提高。

  7. TOOL · CL_278489 ·

    ComfyUI 视频放大器更新,支持低显存系统

    ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT 工具的新版本已发布,特别针对拥有 6GB 或 8GB 显存的用户。1.6.0 版本引入了 DisTorch2 DiT 加载器节点和 Phase 2 VRAM 控制,旨在减少 Diffusion Transformer 处理过程中的显存峰值。此次更新为低显存系统提供了更大的批处理大小灵活性,但可能会略微降低图像质量。

  8. TOOL · CL_283404 ·

    循环流变换器 (LiFT) 引入新颖的生成模型架构

    研究人员引入了循环流变换器 (LiFT),这是一类新颖的生成模型。LiFT 通过重复应用共享的扩散变换器 (DiT) 核心并进行最小的架构更改来扩展计算。循环中的每一步都用单个回归目标进行训练,允许模型在不重新训练的情况下循环超出其训练深度。这种方法提高了生成质量,并允许在不增加参数的情况下增加推理计算。在 256x256 分辨率的 ImageNet 上,LiFT-L/2 在参数量和训练/推理 FLOPs 显著减少的情况下,取得了比密…

  9. TOOL · CL_275476 ·

    新的NEPA方法增强了扩散Transformer中的图像生成

    研究人员开发了一种名为下一嵌入预测自回归(NEPA)的新方法,用于使用扩散Transformer进行图像生成。该方法训练Transformer按顺序预测连续嵌入,从而在去噪过程中动态调整条件信号。在ImageNet上的实验表明,采用该技术的NEPA-DiT-XL模型在训练计算量显著低于先前方法的情况下,取得了具有竞争力的FID分数。

  10. RESEARCH · CL_280547 ·

    COSMI 数据集和模型合成复杂的多个对象交互

    研究人员开发了 COSMI,一种用于在生成模型中合成多个对象交互的新颖方法。该方法通过将单对象交互片段组合成更复杂的场景,解决了现有数据集的局限性,显著扩展了可用数据。COSMI 数据集包含 222,000 个序列和 275 小时的数据,最多包含五个对象,比以前的多对象数据集大近三十倍。在该数据上训练的文本到交互扩散 Transformer 模型在看不见的对象和交互组合上表现出强大的泛化能力,在文本对齐和接触准确性方面优于基线方法。

  11. TOOL · CL_284022 ·

    EMA Lightning:发布了小巧、快速、准确的土耳其语 TTS 模型

    一款名为 EMA Lightning 的新型紧凑型文本转语音模型已发布,在土耳其语生成方面具有惊人的准确性和速度。该模型采用 Diffusion Transformer 架构开发,其词错误率低于 ElevenLabs v4 和 Gemini 等成熟模型,甚至优于一个规模大得多的土耳其语 TTS 模型。EMA Lightning 设计高效,可在 GPU 或 CPU 上离线运行,并提供低延迟的实时流式传输功能。

  12. TOOL · CL_273516 ·

    TexTailor框架增强高分辨率视频虚拟试穿

    研究人员开发了TexTailor,一个用于高保真视频虚拟试穿的新框架,该框架解决了高分辨率场景下的挑战。该系统利用预训练的视频Diffusion Transformer,并引入自适应调制来调整去噪过程中的服装表示。它还结合了帧对齐位置编码,以改善服装与视频的对应关系并减少多重条件干扰。

  13. RESEARCH · CL_273515 ·

    新方法应对超低比特率生成式图像压缩

    两篇新研究论文提出了在极低比特率下进行生成式图像压缩的新方法。第一篇论文介绍了RAE-CoD,一种面向压缩的扩散模型,它使压缩表示和源表示对齐,即使在非常低的比特率下也能保持可识别的内容,在特征MSE和Fréchet距离方面优于竞争对手。第二篇论文提出了ResARC,一种残差感知自回归编解码器,它在解码器中显式补偿量化和生成残差,实现了具有竞争力的感知相似性和改进的分布保真度。

  14. TOOL · CL_273385 ·

    Delta-K 框架提升扩散模型中的多实例生成

    研究人员推出了一种新颖的推理框架 Delta-K,旨在增强扩散模型中复杂多实例场景的生成。这种即插即用方法通过增强交叉注意力的 Key 空间来工作,专门针对并注入缺失概念的语义签名。通过使用轻量级的视觉语言模型,Delta-K 分离出差分键($\Delta K$),然后将其集成到生成过程的早期,将噪声稳定地构建成结构,而不会改变现有概念。实验表明,Delta-K 在不使用空间掩码或额外训练的情况下,提高了 DiT 和 U-Net 等各…

  15. TOOL · CL_272967 ·

    ComfyUI 工具更新稳定低端 GPU 显存

    ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT 工具发布了新版本,专门解决了 Diffusion Transformer (DiT) 处理过程中显存使用峰值的问题。此次更新版本号为 1.5.7,旨在稳定显存消耗,使其对拥有 6GB 或 8GB 显存的用户更加友好。这些改进通过允许更高的批处理大小和更高效的处理,使所有用户受益,即使是在拥有更大显存容量的系统上。

  16. TOOL · CL_280939 ·

    Dream4ACT 模型将机器人动作建模与视觉界面统一

    研究人员推出 Dream4ACT,这是一种新颖的世界模型,专为跨不同机器人载体的联合视频-动作建模而设计。该模型利用一个共享的视觉动作界面(称为“动作视图”)来统一动作表示,通过从多个虚拟摄像头渲染目标关节配置。Dream4ACT 采用视频自动编码器和扩散 Transformer,并使用掩码流匹配进行训练,以支持前向和逆向动力学以及联合观察-动作生成。该系统在 RoboTwin 2.0 和 TriWorldBench 等基准测试中表现…

  17. TOOL · CL_268752 ·

    新方法利用自我运动训练无监督视频中的世界模型

    研究人员开发了一种名为“Action Forcing”的新颖方法,通过恢复自我运动基来使用无监督视频数据训练世界模型。该技术利用像素位移上的主成分分析,直接从无标签视频中提取油门和偏航等基础控制信号。该方法旨在克服现有方法需要昂贵的手动标注或仪器化平台的局限性。该研究还引入了超越传统视频生成度量的新世界模型评估指标,评估可控性、合理性和几何完整性。

  18. RESEARCH · CL_273474 ·

    ThinkV2V框架通过MLLM推理增强视频编辑功能 · 跟踪到2个来源

    研究人员推出ThinkV2V,一个旨在通过利用多模态大语言模型(MLLMs)的推理能力来增强指令引导视频编辑的新框架。与先前主要将MLLMs用作语义编码器的方法不同,ThinkV2V在视觉生成之前显式激活MLLM的“思考”,将对视频和指令的推理转化为精炼的编辑条件信号。该框架采用了专门的训练和推理策略,包括渐进式课程训练和推理时思考扩展,以提高复杂编辑任务的性能。该框架还附带了用于评估的ThinkV2V-150K数据集和ThinkV2…

  19. RESEARCH · CL_271369 ·

    扩散模型研究解决覆盖率、表格数据和效率问题 · 跟踪 6 个来源

    近期研究探索了扩散模型的进展,重点是提高其效率和覆盖率。一篇论文介绍了 'pass@k' 来评估蒸馏扩散模型的分布覆盖率,揭示某些训练目标可能会牺牲广泛覆盖率以换取单次抽样的质量。另一项研究提出了 CDMD,一种用于表格数据的跨数据集扩散模型,该模型在异构数据集上以更少的参数实现了高质量生成。此外,还详细介绍了改进的分布扩散模型 (DDM),它们减轻了训练开销,并允许进行依赖于时间的超参数调整,从而在图像生成任务上表现出色,且在不同采…

  20. RESEARCH · CL_271009 ·

    新研究解决视频生成的一致性和效率问题

    近期研究探索了用于视频生成和编辑的先进技术,重点在于提高一致性、效率和个性化。论文介绍了像CtrlCache这样的方法,通过将计算适应用户控制来加速视频世界模型的交互式生成;以及S2PD,通过结合串行和并行扩散过程来生成更具物理和逻辑一致性的视频。其他工作,如VIDiff,旨在构建能够基于多模态指令执行编辑和增强等多样化视频任务的统一基础模型。此外,研究还通过LoGo等技术(用于改进3D一致性)和Weave Forcing(用于组合内…