PulseAugur
中
实时 06:59:16
实体 Diffusion Transformer (DiT)

Diffusion Transformer (DiT)

PulseAugur coverage of Diffusion Transformer (DiT) — every cluster mentioning Diffusion Transformer (DiT) across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_252667 ·

    StepAudio 3 模型在实时对话、通用音频和音乐生成方面取得进展

    研究人员推出了 StepAudio 3 模型系列,涵盖实时交互、通用音频生成和音乐创作。StepAudio 3 Realtime 专注于具有“倾听-交谈-思考-行动”循环的连续语音对话,在 Artificial Analysis Full-Duplex Bench 等基准测试中取得了高性能。StepAudio 3 Gen 是一个统一的离散自回归模型,可用于文本到语音和音效等各种音频任务,并利用了残差向量量化令牌。StepAudio 3…

  2. RESEARCH · CL_235144 ·

    LLaDA-Image 设定了图像生成领域新的开源SOTA

    研究人员推出 LLaDA-Image,一个使用从头开始训练的 6B Diffusion Transformer 生成高质量图像的新颖框架。该模型利用纯图像预训练和专用优化器来实现照片级真实感结果和精确编辑能力。一个蒸馏版本 LLaDA-Image-Turbo 支持快速推理。LLaDA-Image 在 Qwen-Image-Bench 上设定了开源模型中的新最先进水平(SOTA),其权重、代码和训练方法已公开发布,以促进进一步研究。

  3. TOOL · CL_227233 ·

    新的RASA框架将空间和运动先验分离用于角色动画

    研究人员开发了RASA,一个用于跨身份角色动画的新框架,该框架将空间映射与运动控制分离开来。该系统使用一个两阶段过程:一个空间先验校准器(Spatial Prior Calibrator)来对齐身份与运动,以及一个内在运动引导器(Inherent Motional Guider)来编码关节参数。这种方法旨在提高角色动画的运动保真度和视觉质量,为该领域建立新的范式。

  4. RESEARCH · CL_178234 ·

    新研究探索用于生成、鲁棒性和速度的高级扩散模型

    研究人员正在为各种应用开发高级扩散模型,包括图像生成、时间序列合成和自然语言处理。Simplax 等新方法旨在通过使用辅助变量增强状态来改进分类生成,而 PhysDGM 将物理定律嵌入扩散模型中,用于动态系统中的真实时间序列数据合成。其他进展侧重于通过梯度掩蔽和空间压缩等技术增强扩散模型的对抗鲁棒性,并使用新颖的预测方法加速扩散 Transformer 的推理速度。此外,正在探索用于扩散模型更快采样以及开发平衡准确性和并行性的扩散大语…

  5. RESEARCH · CL_111286 ·

    新的剪枝框架大幅缩小图像模型尺寸,支持24GB GPU推理

    研究人员开发了一种树状混合策略剪枝(TMP)框架,旨在减少大规模图像生成模型的参数数量和计算需求。该框架适用于文本到图像和图像到图像任务,并支持混合专家(MoE)和扩散 transformer(DiT)等架构。实验表明,TMP能够将80B参数的HunyuanImage 3.0模型压缩至20B参数,使其能够在单块24GB GPU上进行推理,且生成质量损失极小。该框架还成功将Z-Image turbo模型从6B参数压缩到4B参数。

  6. RESEARCH · CL_100069 ·

    BrainG3N 推出双用途分词器,实现可控 3D 脑 MRI 生成

    研究人员开发了 BrainG3N,这是一种用于生成 3D 脑 MRI 扫描的新型分词器。该系统采用掩码自编码器 (MAE) 编码器和 CNN 解码器的双用途方法,将临床信息嵌入的需求与解剖结构精确重建的要求分离开来。在大型数据集上预训练的 MAE 编码器在临床任务上的表现优于现有的最先进模型。在这些嵌入上训练的条件扩散 Transformer 能够跨越各种属性和患者特定预测进行可控生成。

  7. RESEARCH · CL_63038 ·

    新研究解决了视频生成在控制、一致性和效率方面的挑战

    研究人员正在开发先进的视频生成技术,重点是提高控制、一致性和效率。CineOrchestra 旨在统一对电影视频中主体、摄像机和镜头转换的控制。TetherCache 通过管理缓存内存来解决长格式自回归视频生成中的漂移和质量下降问题。Argus 使用新颖的身份注入方法来增强在各种挑战性条件下的主体保留能力。MilliVid 采用分层潜在空间来实现长程一致性,而 RhymeFlow 通过解耦去噪轨迹来加速扩散变换器。Echo-Infin…