PulseAugur
实时 06:49:28
实体 HunyuanVideo

HunyuanVideo

PulseAugur coverage of HunyuanVideo — every cluster mentioning HunyuanVideo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 21
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 16
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 21 条
  1. RESEARCH · CL_212076 ·

    新的稀疏注意力方法提高了 Transformer 处理长上下文的效率 · 跟踪 4 个来源

    研究人员正在开发新方法来提高 Transformer 语言模型的效率,尤其是在处理长上下文方面。一种名为 BF1 的方法,通过确定性的块对齐稀疏注意力机制对现有模型进行改造,与密集注意力相比,显著加快了预填充时间并提高了训练困惑度。另一种方法侧重于使用稀疏注意力策略对模型进行微调,使其能够适应并优于使用精确注意力训练的模型,名为 KeysAndValues 的开源库促进了这些长上下文推理和微调任务。此外,还开发了一种名为 Sparse…

  2. TOOL · CL_216382 ·

    LinCa框架通过可学习特征缓存加速扩散模型

    研究人员开发了LinCa,一个旨在加速用于图像和视频生成的扩散模型的新型框架。该方法通过采用可学习的逆向网络来分解特征,解决了迭代采样的计算瓶颈。然后,LinCa对这些组件应用差异化预测策略,确保高质量的重建,并在速度提升方面显著优于现有方法,同时保持近乎无损的质量。

  3. RESEARCH · CL_206230 ·

    新方法通过新颖的特征缓存策略加速扩散模型 · 已追踪2个来源

    两篇新的研究论文提出了加速扩散模型的新颖方法,扩散模型在图像和视频生成方面计算量很大。第一篇论文《重新思考逐令牌特征缓存》(Rethinking Token-wise Feature Caching)介绍了DuCa,一种双重特征缓存策略,通过随机令牌选择迭代地应用激进和保守的缓存,挑战了“重要”令牌总是需要计算的观念。第二篇论文《LinCa: 通过可学习分解特征缓存加速扩散模型》(LinCa: Accelerating Diffusi…

  4. RESEARCH · CL_200239 ·

    SCOPE框架提升扩散Transformer在视频注意力方面的效率

    研究人员开发了SCOPE,一个新颖的无需训练的稀疏注意力框架,旨在提高扩散Transformer(DiTs)在视频处理中的效率。SCOPE通过采用子空间聚类和在线每头Top-K估计方法来解决自注意力的二次成本问题。这种方法允许更具适应性和细粒度的注意力键选择,在保真度和延迟方面均优于现有方法。在测试中,SCOPE在HunyuanVideo数据集上实现了高达1.99倍的速度提升。

  5. RESEARCH · CL_193678 ·

    新方法LoSA和HEART加速视频扩散Transformer

    研究人员开发了两种新方法LoSA和HEART,通过优化稀疏注意力机制来加速视频扩散Transformer。LoSA通过识别和移除冗余的注意力交互,在无需重新训练的情况下保持近乎无损的保真度,从而实现显著的加速。HEART利用注意力中的头部异质性,在去噪步骤中重用稳定的稀疏掩码,并根据误差敏感性校准阈值,以进一步提高效率。这两种方法都旨在改善视频生成任务的速度-质量权衡,而无需重新训练模型。

  6. TOOL · CL_193443 ·

    新的LFV方法可加速视频VAE潜在空间的光谱编辑

    研究人员开发了一种名为潜在频率有效性(Latent-Frequency Validity, LFV)的新方法,可在视频VAE潜在空间中实现更快、更精确的光谱编辑。该技术无需进行完整的解码-过滤-重新编码循环,即可控制噪声、闪烁和流畅度。LFV通过学习特定于VAE的光谱响应并有选择地应用它来实现这一点,从而显著降低计算成本并提高各种视频生成模型的保真度。

  7. RESEARCH · CL_187284 ·

    LC-GRPO框架通过Langevin校正改进生成模型训练

    研究人员推出了一种新颖的基于流的GRPO框架LC-GRPO,该框架结合了Langevin校正,以弥合生成模型中训练和推理之间的差距。该方法解决了在使用随机微分方程(SDE)进行训练和使用常微分方程(ODE)进行推理时出现的差异,这种差异可能导致样本模糊和性能下降。通过在ODE欧拉步之后应用Langevin校正,LC-GRPO在理论上减少了Wasserstein误差,并与标准的SDE离散化相比提高了样本精度。在SD3.5-Medium、…

  8. TOOL · CL_183478 ·

    新的T2VAttack方法揭示了文本到视频扩散模型的漏洞

    研究人员开发了T2VAttack,一种探测文本到视频扩散模型漏洞的新方法。该攻击侧重于视频生成的语义和时间两个方面,旨在降低生成视频与其文本提示之间的对齐度,以及视频本身的时间连贯性。T2VAttack采用同义词替换和优化词语插入等策略来扰乱提示,证明即使是微小的改动也会显著损害包括ModelScope和Open-Sora在内的几款领先模型的视频质量和时间动态。

  9. RESEARCH · CL_180670 ·

    新的RACER控制器提高了扩散模型的速度和可靠性 · 跟踪2个来源

    研究人员开发了RACER,一种新的闭环控制器,旨在提高扩散模型的效率和可靠性。与盲目信任预测的先前方法不同,RACER分析预测之间的一致性,以确定何时以及在多大程度上信任它们。这种方法允许在不牺牲质量的情况下更积极地加速扩散采样,从而在SD3.5-Large、FLUX.1-dev、Wan2.1-14B和HunyuanVideo等各种模型中实现更快的生成速度。

  10. TOOL · CL_167429 ·

    MXAttention 框架优化 MXFP4 注意力以用于视频生成

    研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…

  11. TOOL · CL_148823 ·

    NVIDIA 和 Hugging Face 发布 NeMo Automodel,用于可扩展的扩散模型微调

    NVIDIA 和 Hugging Face 合作发布了 NeMo Automodel,这是一个开源的 PyTorch 库,旨在简化扩散模型的微调过程。这个新工具允许用户在 Hugging Face Diffusers 格式下训练和微调模型,而无需进行任何代码重写或检查点转换。NeMo Automodel 支持多种并行策略,包括 FSDP2、张量并行和流水线并行,能够从单个 GPU 扩展到数百个 GPU 进行训练。

  12. TOOL · CL_144355 ·

    AI利用Claude和开源工具生成其视角的视频

    一位用户利用Claude的创意自由,从AI的视角生成了一个视频。该项目使用了HunyuanVideo和EdgeTTS等开源工具来实现AI的设想。生成的视频在Reddit上分享,展示了AI与人类创造力之间的协作潜力。

  13. RESEARCH · CL_143398 ·

    ACID方法通过动态缓存加速视频生成

    研究人员开发了ACID,一种新颖的自适应缓存方法,旨在加速扩散模型的视频生成。与使用固定缓存阈值的现有方法不同,ACID根据漂移信号的变化率动态调整此阈值。这种方法允许在不太关键的去噪步骤中进行更积极的缓存,同时在关键步骤中保持高质量。在与流行的缓存技术和开源视频模型进行测试时,ACID在视觉质量几乎没有下降的情况下,展示了比基线方法显著的速度提升。

  14. COMMENTARY · CL_124200 ·

    开源AI视频模型:性能声明与现实的差距

    开源AI视频模型领域竞争激烈且常常具有误导性,各种模型在VBench等基准测试中声称性能优越。诸如Wan-2.2、Open-Sora 2.0和HunyuanVideo等模型被频繁提及,但其报告的指标可能无法准确反映实际能力或显存需求。虽然自托管有潜在优势,但对于某些用例,Runway ML等商业解决方案可能仍然是更好的选择。

  15. TOOL · CL_121996 ·

    AI工作站配置:4x RTX 5090 对比 1x RTX 6000 Blackwell

    一位用户正在为YouTube自动化和数据蒸馏等商业应用寻求高端AI工作站的配置建议。他们正在权衡两种GPU配置:四块RTX 5090显卡,总计128GB显存,或一块RTX 6000 Blackwell显卡,拥有96GB显存。用户担心多GPU分片用于视频生成和微调的实际操作性,以及单块大显存显卡的简便性,尤其是在成本相似的情况下。

  16. TOOL · CL_119498 ·

    OTCache框架使用最优传输加速扩散模型

    研究人员推出OTCache,一个旨在通过预测最优缓存计划来加速扩散模型的新型框架。该方法利用最优传输(OT)原理来模拟在不同推理预算下缓存策略的演变,解决了现有基于图的方法的局限性。OTCache在FLUX.1、Qwen-Image和HunyuanVideo等模型上实现了3.66倍至4.7倍的显著加速,同时与当前最先进的方法相比,还提高了生成保真度。

  17. SIGNIFICANT · CL_113064 ·

    阿里巴巴发布开源视频生成套件 Wan 2.1

    阿里巴巴的 Wan 团队发布了 Wan 2.1,这是一个开源视频生成模型套件,旨在让高质量视频生成更加易于获取。该套件包括文本到视频、图像到视频和视频编辑功能,其参数大小针对高端和消费级 GPU 进行了优化。Wan 2.1 采用了一种 Diffusion Transformer 架构,并配备了一种新颖的视频变分自编码器,该编码器可保持时间因果关系以减少闪烁伪影,并支持中文和英文文本提示。

  18. RESEARCH · CL_111312 ·

    NaviCache 通过新颖的自校准技术加速视频生成

    研究人员推出了一种名为 NaviCache 的新颖方法,旨在通过解决视频扩散模型 (VDM) 的计算成本来加速视频生成。与依赖离线校准或瞬时近似的先前方法不同,NaviCache 采用了一种测试时间自校准技术。它将特征演化建模为惯性导航系统 (INS) 问题,自适应地跟踪特征变化及其潜在漂移,从而实现有误差界限的计算跳过。在 HunyuanVideo 和 Open-Sora 等数据集上的实验表明,NaviCache 提高了计算跳过的准…

  19. RESEARCH · CL_111248 ·

    LearniBridge 通过可学习特征缓存加速扩散模型 · 已追踪 2 个来源

    研究人员开发了 LearniBridge,一种通过优化特征缓存来加速 Diffusion Transformers (DiTs) 等扩散模型的新颖方法。该技术通过使用轻量级 LoRA 更新来校准多个时间步之间的中间表示,从而解决了现有方法中的误差累积问题。LearniBridge 仅需少量训练数据,并在各种图像和视频生成任务上实现了显著的加速,最高可达 5.87 倍,同时在基准测试中保持或提高了性能。

  20. RESEARCH · CL_111315 ·

    ResilPhase框架在不损失质量的情况下加速扩散模型 · 跟踪3个来源

    研究人员开发了ResilPhase,一个旨在加速扩散模型推理速度而不牺牲质量的新框架。现有方法在更高加速比下,由于离散外插和数值不稳定的问题,性能常常会下降。ResilPhase通过将加速重新构建为ODE空间中稳定的宏轨迹外插,并将预测与模型的全局漂移对齐来解决这个问题。它采用无导数外插器和有界相位映射来减轻噪声并抑制误差增长,在FLUX.1-dev和HunyuanVideo上展示了最先进的保真度。