marble
PulseAugur coverage of marble — every cluster mentioning marble across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
李飞飞的World Labs发布Atlas,一款用于机器人技术的多模态世界模型
李飞飞的World Labs公布了Atlas,这是一款新颖的多模态世界模型,能够生成具有像素级相机控制的图像和视频,从稀疏输入进行3D场景重建,并模拟空间和时间动态。该模型被描述为机器人领域“从现实到模拟”(Real-to-Sim)工作流程的重大进步,它整合了大语言模型和视频模型的概念,采用了多模态自回归扩散Transformer架构。Atlas还可以根据文本提示生成图像,并且设计上具有可扩展性,早期访问已向部分合作伙伴开放。
-
World Labs 发布 Atlas,一个用于空间智能的全能世界模型 · 跟踪 8 个来源
World Labs 推出了 Atlas,一个专为空间智能设计的新型 AI 模型,能够从图像、视频、文本和深度数据等各种输入生成、重建和模拟 3D 世界。与专用模型不同,Atlas 将所有输入整合到一个统一的空间上下文中,使其能够生成更一致、更详细的 3D 表示。该模型旨在通过提供对空间关系和场景动态的更深入理解来推动机器人技术、模拟和 3D 内容创作的发展。
-
AVITA 发布机器人操作系统;Autodesk Flow Studio 集成 3D 世界 AI
AVITA 发布了 AVITA OS,一个专为虚拟化身和机器人设计的操作系统基础。另外,Autodesk 的 3D 合成工具 Flow Studio 已与用于生成 3D 世界的 AI Marble 集成。
-
李飞飞的World Labs推出R2S2R用于机器人训练
李飞飞的World Labs推出了一款名为Real-to-sim-to-real (R2S2R) 的新型机器人训练和评估引擎。该引擎通过首先将真实世界的机器人交互重建到虚拟世界(Real-to-Sim),然后在这些模拟环境中训练和评估机器人策略,再将其部署回物理机器人(Sim-to-Real),从而弥合了模拟环境与真实世界机器人部署之间的差距。这个闭环系统旨在克服当前机器人开发中普遍存在的扩展数据采集和评估的局限性,从而实现更高效、更…
-
AMI Labs 筹集 10 亿美元用于“世界模型”,同时批评 LLM · 跟踪 1 个来源
前 Meta 和 Nabla 的 Alexandre Lebrun 为他的新公司 AMI Labs 筹集了 10.3 亿美元,Yann LeCun 担任董事长。Lebrun 预测“世界模型”将成为一个普遍的热门词,但他认为这与当前的 LLM 存在根本性的架构分歧。他认为 LLM 缺乏对物理世界、持久记忆、推理和规划能力的理解,并引用了自回归的错误累积和文本对现实的有限表征。虽然“世界模型”一词被应用于生成视频预测和显式 3D 表示等各…
-
ABot-3DWorld 0:通用3D模型可根据文本、图像、视频生成世界
研究人员推出了ABot-3DWorld 0,这是一种新颖的通用多模态3D世界模型,能够从文本、图像和视频输入生成可探索的3D环境。该系统利用统一的空间生成基元(SGP)来高效表示3D空间,结合了全景图和点云。该框架允许从丰富的输入中进行严格的几何恢复,并从单个图像或句子进行生成式补全,旨在普及3D内容创作并实现原生地图空间探索。
-
Decart 发布 Oasis 3,用于实时逼真驾驶模拟
AI 初创公司 Decart 推出了 Oasis 3,这是一款新的交互式世界模型,能够实时生成逼真的驾驶环境。该模型可通过 API 使用,最初面向需要模拟罕见驾驶场景的自动驾驶汽车公司,并计划扩展到机器人和其他物理 AI 应用。Decart 旨在效仿 OpenAI 在语言模型方面的做法,围绕其世界模型构建开发者生态系统,并利用其高效的 Decart Optimization Stack (DOS) 提供具有竞争力的价格。
-
李飞飞将AI世界模型定义为渲染、模拟和规划
李飞飞提出了一个框架来阐明AI中世界模型的定义,将其归类为三个核心功能:渲染、模拟和规划。她认为,虽然渲染侧重于视觉保真度,规划侧重于动作序列,但模拟是通过确保几何、物理和动态一致性来连接两者的关键桥梁。李还强调了这些功能在单一模型内融合的趋势,并提出一个统一的世界模型可以理解、想象、推理并与物理世界互动。
-
WorldAct框架将静态3D世界转换为交互式场景
研究人员开发了WorldAct,一个旨在将静态生成的3D环境转换为交互式和可编辑场景的新框架。该系统采用多模态代理来分解单体3D世界,识别关键对象,并将它们重构为适合操作的对齐网格。该框架还通过3D修复恢复背景,从而实现对象级编辑、具有碰撞感知的交互以及具身任务执行,同时保持整体场景的连贯性。