实体
Video DiT
Video DiT
PulseAugur coverage of Video DiT — every cluster mentioning Video DiT across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的ForeWAM模型在无需未来视频解码的情况下预测机器人动作
研究人员开发了ForeWAM,一种新颖的世界动作模型(WAM),它通过以预测的未来状态为条件来增强机器人动作生成,而无需显式进行未来视频解码。该方法利用了Future-KV机制,该机制处理当前的视觉信息和未来的随机槽以生成层级键值状态。这些状态在整个动作去噪过程中被重复使用,使模型能够捕捉由交互引起的过渡,如物体运动和任务进展。ForeWAM在LIBERO和LIBERO-Plus等机器人基准测试中取得了高成功率,证明了其在动态环境中的…
-
新EmoWorld框架提供可控情感视频生成
研究人员开发了EmoWorld,一个旨在增强视频生成中情感控制的新框架。该系统将通常纠缠在现有视频生成模型中的全局氛围、语义情感线索和时间进程解耦。通过与冻结的流匹配视频扩散 transformer (Video DiT) 集成,EmoWorld 使用视觉氛围引导 (VAS)、语义情感引导 (SAS) 和时间情感引导 (TAS) 来独立控制这些情感元素。在 Wan2.2 数据集上的评估显示,情感一致性和时间一致性有显著提高,EmoWo…