研究人员开发了一种新颖的4张量注意力模型,用于预测场景中的下一个语义状态,可应用于视频生成和机器人规划。该模型处理具有语义和时间上下文纤维的状态,并在一个窗口内进行注意力归一化。在ROCStories数据集上进行下一个句子预测任务训练时,4张量模型在各种设置下均优于一维Transformer,取得了更低的交叉熵得分。值得注意的是,4张量模型还显示出显著更快的训练速度。 AI
影响 该模型在场景预测和更快的训练方面的进步可能会加速视频生成和机器人技术的发展。
排序理由 该集群包含一篇详细介绍新模型架构及其在基准数据集上性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →