PulseAugur
实时 15:20:51
实体 video world models

video world models

PulseAugur coverage of video world models — every cluster mentioning video world models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. RESEARCH · CL_191381 ·

    新的WorldTrace框架改进了视频模型中的视觉记忆

    研究人员开发了WorldTrace,一个旨在增强视频世界模型中视觉持久性的新颖框架。这种新方法解决了现有模型因时间旋转位置嵌入(RoPE)问题而在超出训练范围后难以回忆信息的局限性。WorldTrace通过为摘要槽分配不同的虚拟位置来维护一个“可寻址内存”,从而能够更好地检索存储的内容。该框架包括两种压缩方法:用于时间连贯性的WorldTrace-Field和用于情景回忆的WorldTrace-Landmark,在LoopBench基…

  2. RESEARCH · CL_180972 ·

    新的交互式视频世界模型框架出现

    研究人员推出了两个新的视频世界模型框架,这对于具身AI和交互式模拟至关重要。第一个框架HelloWorld通过允许角色响应诸如转弯或挥手之类的提示,实现了用户与视频环境中的角色之间的社交互动。它利用了自蒸馏管道和新颖的推理模块来实现响应的时间局部化。第二个框架MiniWorld旨在通过提供一个轻量级、可复现的系统,该系统可以在适度的计算资源上从头开始训练,从而实现这些模型的训练民主化。MiniWorld采用了块因果视频扩散Transf…

  3. RESEARCH · CL_154690 ·

    AlayaWorld 以 720p 生成能力推动交互式视频世界建模

    研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…

  4. RESEARCH · CL_119376 ·

    MemLearner 通过自适应上下文查询改进视频世界模型 · 追踪 2 个来源

    研究人员推出 MemLearner,这是一种通过改进视频世界模型在长序列中的记忆和场景一致性来增强其性能的新方法。该方法利用基于学习的自适应上下文查询与查询令牌,解决了先前基于规则的检索系统在遮挡和动态对象场景中的局限性。MemLearner 利用预训练的视觉先验和多数据集训练策略,在实验中展示了显著的性能提升。

  5. RESEARCH · CL_63038 ·

    新研究解决了视频生成在控制、一致性和效率方面的挑战

    研究人员正在开发先进的视频生成技术,重点是提高控制、一致性和效率。CineOrchestra 旨在统一对电影视频中主体、摄像机和镜头转换的控制。TetherCache 通过管理缓存内存来解决长格式自回归视频生成中的漂移和质量下降问题。Argus 使用新颖的身份注入方法来增强在各种挑战性条件下的主体保留能力。MilliVid 采用分层潜在空间来实现长程一致性,而 RhymeFlow 通过解耦去噪轨迹来加速扩散变换器。Echo-Infin…

  6. RESEARCH · CL_65852 ·

    新基准测试机器人操作模型的可信度

    研究人员开发了新的基准来评估用于机器人操作的视频世界模型的可信度。这些基准使用真实的DROID片段,在正常、约束敏感、反事实和对抗性场景下评估模型。初步评估显示,尽管当前模型可以生成视觉上连贯的视频,但它们在推理约束、物理交互和抑制不安全指令方面存在困难,这表明仅凭视觉质量不足以满足可靠的机器人应用。

  7. RESEARCH · CL_65075 ·

    StressDream 引导视频世界模型实现高影响力结果

    研究人员开发了 StressDream,一种用于改进视频世界模型中策略评估和增强的新颖方法。该技术通过优化基于扩散的模型中的初始噪声,将这些模型的想象力引导至高影响力、可信的未来结果。StressDream 同时采用语义和可信度目标,以确保生成的视频信息丰富且逼真,从而能够更好地识别机器人操作和自动驾驶场景中的潜在故障。

  8. RESEARCH · CL_48998 ·

    新的4D模型通过几何约束增强机器人操作能力

    研究人员通过增强具有几何理解能力的视频世界模型,开发了新的机器人操作方法。GEM-4D将4D对应监督注入生成模型,以确保运动一致性和物理基础,将实际操作成功率从61%提高到81%。另外,GAF使用高斯动作场来表示4D中的动态场景,从而能够直接从感知运动的表示中进行动作推理,并将操作成功率提高了7.3%。这两种方法都旨在弥合逼真视频生成与可靠机器人任务执行之间的差距。