Diffusion Transformer (DiT)
PulseAugur coverage of Diffusion Transformer (DiT) — every cluster mentioning Diffusion Transformer (DiT) across labs, papers, and developer communities, ranked by signal.
-
新的剪枝框架大幅缩小图像模型尺寸,支持24GB GPU推理
研究人员开发了一种树状混合策略剪枝(TMP)框架,旨在减少大规模图像生成模型的参数数量和计算需求。该框架适用于文本到图像和图像到图像任务,并支持混合专家(MoE)和扩散 transformer(DiT)等架构。实验表明,TMP能够将80B参数的HunyuanImage 3.0模型压缩至20B参数,使其能够在单块24GB GPU上进行推理,且生成质量损失极小。该框架还成功将Z-Image turbo模型从6B参数压缩到4B参数。
-
BrainG3N 推出双用途分词器,实现可控 3D 脑 MRI 生成
研究人员开发了 BrainG3N,这是一种用于生成 3D 脑 MRI 扫描的新型分词器。该系统采用掩码自编码器 (MAE) 编码器和 CNN 解码器的双用途方法,将临床信息嵌入的需求与解剖结构精确重建的要求分离开来。在大型数据集上预训练的 MAE 编码器在临床任务上的表现优于现有的最先进模型。在这些嵌入上训练的条件扩散 Transformer 能够跨越各种属性和患者特定预测进行可控生成。
-
新研究解决了视频生成在控制、一致性和效率方面的挑战
研究人员正在开发先进的视频生成技术,重点是提高控制、一致性和效率。CineOrchestra 旨在统一对电影视频中主体、摄像机和镜头转换的控制。TetherCache 通过管理缓存内存来解决长格式自回归视频生成中的漂移和质量下降问题。Argus 使用新颖的身份注入方法来增强在各种挑战性条件下的主体保留能力。MilliVid 采用分层潜在空间来实现长程一致性,而 RhymeFlow 通过解耦去噪轨迹来加速扩散变换器。Echo-Infin…