研究人员推出 GEST-Engine,一个旨在从自然语言文本生成合成视频的系统。该引擎利用显式世界模型,表示为时空事件图 (GEST),以维护模拟环境的详细且可检查的状态。该系统通过一个四阶段管道处理 GEST,以零额外标注成本生成各种形式的标注视频数据,包括 RGB 视频、深度图和分割掩码。GEST-Engine 的输出旨在用作视频理解任务的训练数据、评估基准和诊断工具。 AI
影响 能够为训练和评估视频理解模型创建标注视频数据。
排序理由 该集群描述了一份技术报告,详细介绍了一种新的合成视频生成系统,该系统属于研究范畴。
- arXiv
- GEST-Engine
- Graph of Events in Space and Time
- Hugging Face
- LLM Director
- Nicolae Cudlenco
- Zahir Khan
- Gest
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →