PulseAugur
中
实时 09:10:20
实体 Wan2.2

Wan2.2

PulseAugur coverage of Wan2.2 — every cluster mentioning Wan2.2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
38
90 天内 39
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_261437 ·

    新的DART方法改进了视频扩散模型中LoRA的重用

    研究人员开发了DART,一种新颖的无需训练的方法,旨在改进少步视频扩散模型中LoRA适配器的重用。该技术解决了当为更长扩散轨迹训练的LoRA应用于更短轨迹时可能出现的质量下降和功能改变问题。DART结合了低秩坐标传输和目标调度响应校准,在四步Wan2.2目标上实现了联合质量分数和功能保留的显著改进。

  2. TOOL · CL_258754 ·

    Nunchux AI 发布 VC-Attention 以加速视频扩散 Transformer

    Nunchux AI 开发了 VC-Attention,这是一种新颖的、无需训练的低比特注意力核,旨在加速视频扩散 Transformer。这项创新解决了两个关键瓶颈:值量化误差和缓慢的 softmax 计算。通过实施 V-Smooth 等技术来管理值异常值,以及使用 ExpCast-FP8 进行高效的对数域指数运算,VC-Attention 显著加速了视频生成模型中的注意力机制。

  3. RESEARCH · CL_254962 ·

    VC-Attention 框架通过优化低比特注意力来加速视频生成

    研究人员推出了一种新颖的 VC-Attention 框架,旨在提高扩散 Transformer 中注意力机制的效率和准确性,这对于最先进的视频生成至关重要。该方法解决了两个主要瓶颈:长序列导致的注意力计算成本以及 softmax 函数施加的速度限制。VC-Attention 采用双管齐下的方法:值平滑 (V-Smooth) 通过重新排序值 token 来减少量化误差,以及融合概率转换 (ExpCast-FP8),该方法绕过了 soft…

  4. TOOL · CL_251666 ·

    RTX 3060 用户寻求无审查的本地 AI 模型进行图像生成

    一位 Reddit 用户正在寻找本地 AI 图像生成模型的推荐,这些模型可以在配备 RTX 3060 GPU 和 32GB RAM 的系统上有效运行。他们特别寻找不需要复杂配置或额外 LoRA 且默认无审查的模型。该用户已尝试过 Wan2.2 和 MiniMax-H3 等模型,但发现 MiniMax 在某些输出方面不令人满意。

  5. TOOL · CL_237973 ·

    用户寻求关于 Forge Neo 中 Wan2.2 模型生成的颗粒感视频的帮助

    一位 Reddit 用户正在寻求帮助,关于在使用 Forge Neo 界面中的 Wan2.2 文本到视频模型生成视频时遇到的问题。他们发现输出的视频出现颗粒感和像素化,并正在寻求关于不正确设置或配置的帮助。

  6. RESEARCH · CL_231681 ·

    新框架通过3D映射和合成数据增强长时视频生成

    研究人员开发了几个新的框架和方法来生成长时、世界一致的视频。SolarWM为交互式视频世界模型提供了一个开放的基础,统一了高达33B参数模型的各种数据源和训练配方。另一种方法使用Unreal Engine创建合成的、动作条件化的视频数据,生成数千小时的高分辨率素材。此外,Statebench和Stateagent旨在通过关注世界状态推理来改进视频续写,而OctWorld和Streaming4D则利用3D映射和增量重建来实现长距离、一致…

  7. TOOL · CL_225122 ·

    Stable Diffusion 用户对 MiniMax H3 4 步 Turbo LoRA 的质量感到困扰

    r/StableDiffusion 子版块的用户正在讨论 MiniMax H3 模型(特别是其 4 步 Turbo LoRA)的性能。许多用户报告称 4 步 LoRA 的结果不令人满意,发现即使是 8 步 LoRA 或 Wan2.2 等其他模型的较低分辨率生成也能产生更好的质量。主要问题似乎是生成速度和图像质量之间的权衡,对于许多人来说,更快的 4 步 LoRA 产生了较差的结果。

  8. SIGNIFICANT · CL_214716 ·

    商汤发布开源8B文生图模型SenseNova U1.5 Lite

    商汤发布了其开源8B文生图模型SenseNova U1.5 Lite的正式版本。该更新模型在理解长而复杂的指令、生成更高质量的视觉效果以及执行更精确的图像编辑方面提供了改进的功能,同时保持了原生4K分辨率输出。模型的进步归功于一种训练方法,该方法首先开发专门的“专家”模型来处理文本渲染和图像编辑等任务,然后使用多教师蒸馏策略将这些技能重新整合到一个统一的8B模型中。

  9. RESEARCH · CL_212076 ·

    新的稀疏注意力方法提高了 Transformer 处理长上下文的效率 · 跟踪 4 个来源

    研究人员正在开发新方法来提高 Transformer 语言模型的效率,尤其是在处理长上下文方面。一种名为 BF1 的方法,通过确定性的块对齐稀疏注意力机制对现有模型进行改造,与密集注意力相比,显著加快了预填充时间并提高了训练困惑度。另一种方法侧重于使用稀疏注意力策略对模型进行微调,使其能够适应并优于使用精确注意力训练的模型,名为 KeysAndValues 的开源库促进了这些长上下文推理和微调任务。此外,还开发了一种名为 Sparse…

  10. MEME · CL_191919 ·

    MiniMax H3 可用于个人媒体服务器模仿,用户报告

    一位 Reddit 用户分享了他们使用 MiniMax H3 为其 Plex 媒体服务器创建模仿内容的经验,突出了该模型在个人使用方面的能力。他们指出,自早期版本以来,开源模型已取得显著进步,并将当前技术比作拥有一个个人 Sora。

  11. RESEARCH · CL_191118 ·

    新的手术世界模型增强了机器人学习和视频生成能力

    两篇新的研究论文,Surgical WAM 和 Surg-UniWorld,引入了用于手术机器人技术的高级世界模型。Surgical WAM 通过在无动作视频上进行预训练来学习视觉动力学,从而提高数据效率,然后在有限的标记演示下增强闭环操作。Surg-UniWorld 提出了一种统一的多模态方法,使用分层锚点和相对模态专家来生成逼真且可控的手术视频,在一个新的基准测试中表现优于现有方法。

  12. TOOL · CL_187504 ·

    新EmoWorld框架提供可控情感视频生成

    研究人员开发了EmoWorld,一个旨在增强视频生成中情感控制的新框架。该系统将通常纠缠在现有视频生成模型中的全局氛围、语义情感线索和时间进程解耦。通过与冻结的流匹配视频扩散 transformer (Video DiT) 集成,EmoWorld 使用视觉氛围引导 (VAS)、语义情感引导 (SAS) 和时间情感引导 (TAS) 来独立控制这些情感元素。在 Wan2.2 数据集上的评估显示,情感一致性和时间一致性有显著提高,EmoWo…

  13. TOOL · CL_186009 ·

    机器人可能不需要专用大脑,而是利用视频模型

    一篇新论文介绍了一种名为 Masked Visual Actions (MVA) 的方法,该方法通过利用视频生成模型来统一机器人的世界建模和动作生成。MVA 不训练专门的机器人基础模型,而是将动作视为视频帧内的掩码轨迹,从而使机器人能够直接利用成熟的视频模型。这种方法只需要极少的微调,在不同机器人硬件上展现出强大的零样本泛化能力,并为工业自动化中的跨体挑战提供了潜在解决方案。

  14. TOOL · CL_183400 ·

    新的CAPE-T2V框架增强文本到视频生成的对齐

    研究人员推出CAPE-T2V,一个旨在通过解决训练字幕和推理时提示之间的不匹配来改进文本到视频生成的新框架。该系统首先微调一个提示增强器(PE),从源字幕生成各种目标提示。随后,它使用这些增强的字幕微调文本到视频扩散变换器(DiT),确保PE的输出与DiT的训练数据之间更好的对齐。这种方法在StoryEval和VBench 2.0等基准测试中提高了性能,并显示出“PE-字幕差距”的减小。

  15. TOOL · CL_180900 ·

    新的 DAR 方法使视频模型能够渲染 4D 场景

    研究人员开发了 DAR,这是一种新颖的方法,使预训练的视频扩散模型能够充当 4D 渲染器。该方法使用动画网格、相机轨迹和参考图像来约束这些模型,从而实现考虑相机运动和内部对象动画的场景生成。DAR 投影一个神经 4D G-缓冲区,其中包含跟踪、世界位置和法线信息,然后通过加宽的控制适配器将其集成到模型中。在 DAR-4D 基准测试上的评估表明,与 Wan2.2-Depth 等现有方法相比,PSNR、SSIM 和 LPIPS 有显著提高。

  16. MEME · CL_167030 ·

    用户分享使用 Wan2.2 模型生成的第一个视频

    一位 Reddit 用户分享了他们使用 Wan2.2 模型进行图像生成和视频创作的初步体验。他们详细介绍了自己的学习历程,从基础的移动端 AI 编辑器到更高级的工具,如 AUTOMATIC1111、Flex、Flux,最终到 Wan。用户强调了使用 Flux 和 Wan 创建了一个 Lora 角色,并随后使用 Wan2.2 的 i2v 模型生成短视频片段,同时指出了生成时间和硬件限制。

  17. TOOL · CL_167429 ·

    MXAttention 框架优化 MXFP4 注意力以用于视频生成

    研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…

  18. TOOL · CL_166404 ·

    LTX 2.3用户报告Dr34mL4Y LoRA存在身体比例问题

    LTX 2.3图像到视频模型的用户在保持身体和面部比例一致性方面遇到问题,特别是乳房尺寸在视频生成过程中似乎会缩小。这个问题似乎与使用特定的LoRA有关,例如Dr34mL4Y LoRA,而较旧的版本如WAN2.2则没有表现出这种行为。问题出现在生成视频的最初几秒钟之后,导致结果看起来不自然。

  19. MEME · CL_164088 ·

    用户寻求超越 Wan2.2 的高级视频编辑 AI 模型

    一位 Reddit r/LocalLLaMA 版块的用户正在寻找在视频编辑模型方面优于 Wan2.2 的推荐。他们询问社区目前有哪些替代方案以及大家正在使用哪些工具,并提到他们拥有一张 RTX 3090 显卡。

  20. MEME · CL_153364 ·

    用户寻求关于使用 Wan2.2 和 sky reel 的 AI 项目的反馈

    Reddit 的 r/StableDiffusion 子版块的一位用户正在寻求对其最近项目的反馈,该项目涉及“Wan2.2”和“sky reel”技术的集成。用户对在“Wan2.2”上实现正确的唇部同步和控制表示满意,这表明开发过程成功。