研究人员开发了 Flex-$\pi$,一个拥有 60 亿参数的世界动作模型,该模型将 3D 几何和对象语义与 RGB 数据集成在一起。该模型利用预训练的视频生成 VAE,无需额外训练即可编码 3D 点图,从而实现统一的潜在空间。Flex-$\pi$ 使用了具有跨模态强制的 Transformer 混合骨干网络,使其能够高效地处理输入流的各种子集。该模型在真实世界双臂操作任务的演示效率和泛化能力方面表现出显著的改进,优于现有基线。 AI
影响 该模型高效集成各种视觉信号的能力,可以通过提高泛化能力和减少数据需求来推动机器人和操作任务的发展。
排序理由 该集群描述了一篇介绍新模型架构及其在特定任务上性能的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Dino
- Flex-π
- Gotit.pub
- Hugging Face
- Mixture-of-Transformers
- ScienceCast
- variational auto-encoder
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →