PulseAugur
实时 00:24:54
实体 Droid

Droid

PulseAugur coverage of Droid — every cluster mentioning Droid across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. MEME · CL_228379 ·

    OpenAI Droid 应用 Bug 导致无法显示回复

    一位 Reddit 用户在 OpenAI Droid 应用中遇到了一个持续存在的 Bug,一个方框出现,导致他们无法看到 AI 的回复或思考过程。这个问题似乎是随机发生的,尤其是在 AI 进行复杂或深入对话时。用户怀疑该 Bug 与应用在未经提示的情况下尝试使用图像生成器有关,他们的解决方法是明确告知 AI 停止使用此功能。

  2. RESEARCH · CL_219185 ·

    新框架通过跨具身学习和程序化生成增强具身AI模拟

    研究人员开发了用于为具身AI创建更真实、更通用的模拟环境的新框架。CLAP通过协调不同的动作空间,能够在不同机器人和人类代理的各种视频数据上进行训练,旨在提高泛化能力并超越单一具身模型。4DSynth从自然语言、蓝图或照片生成可控、可编辑的4D环境,便于创建动态模拟。NeoWorld-Pro使用MLLM将单张图像转换为可执行程序,用于交互式3D环境,并通过物理引擎进行优化以提高真实性,从而能够执行复杂的下游任务。

  3. TOOL · CL_216638 ·

    新发布的“Droid - Announcer Audio Pack”用于AI和机器人音效

    一款名为“Droid - Announcer Audio Pack”的新音频包已发布,其中包含适用于各种应用的音效和配音。该包包含与机器人、人工智能和赛博格相关的元素,旨在提供全面的音效设计解决方案。

  4. TOOL · CL_210640 ·

    新的ORV框架通过4D占用先验提升机器人视频生成能力

    研究人员推出ORV,一个旨在通过解决数据稀缺性并提高视觉真实性来增强机器人视频生成的新型框架。这种以4D占用为中心的模型将动作先验与占用衍生的视觉先验相结合,从而产生更忠实、时间上更一致的视频输出。ORV还促进了多视角合成和仿真到真实世界的迁移,在各种机器人基准测试中展示了视频生成质量和可控性的显著改进。

  5. TOOL · CL_200821 ·

    使用 Docker 沙盒安全地运行 AI 编码代理

    该集群讨论使用 Docker 沙盒作为安全运行 AI 编码代理的方法。文章提供了有关设置和使用 Docker 沙盒的入门指南,包括安装说明和基本命令。目标是为开发人员提供一个安全的实验 AI 编码工具的环境。

  6. TOOL · CL_200763 ·

    新工具揭示像素指标在机器人视频上无法对世界模型进行排序

    一款名为 worldproof 的新开源工具已被开发出来,用于诊断世界模型的故障点,世界模型根据动作预测未来帧。该工具的验证显示,标准的像素指标通常无法区分模型在真实机器人视频数据上的性能。具体来说,当预测误差不随预测范围一致增加时,SSIM 和 PSNR 等指标可能会失效,导致所有模型看起来性能相似。

  7. TOOL · CL_198077 ·

    G0.5模型将机器人推理与行动整合到单一流中

    研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。

  8. TOOL · CL_187562 ·

    机器人学习人类动作:连接视频数据与机器人控制的四种方法 · 跟踪 1 个来源

    清华大学、香港科技大学和微软亚洲研究院的联合论文提出了一种统一的框架,使机器人能够从人类视频中学习人类动作。该研究确定了四种主要方法:潜在动作、显式二维轨迹、显式三维轨迹和世界模型,所有这些都旨在构建人类动作与机器人控制信号之间的“表示桥梁”。虽然世界模型被视为泛化的有希望的方向,但目前的实际演示通常依赖于结合了强化学习的视觉-语言-动作(VLA)模型,这凸显了在为具身人工智能寻找最佳“配方”方面仍然存在挑战。

  9. TOOL · CL_185518 ·

    新的 SAFECAST 系统增强了机器人领域 AI 故障检测能力

    研究人员开发了 SAFECAST,这是一个旨在改进视觉-语言-动作 (VLA) 策略故障检测的新系统。通过利用对比集扰动,SAFECAST 增强了隐藏状态探针的训练和校准,使其在部署条件与训练环境不同时也能更加可靠。在 DROID 和 LIBERO 基准测试上的实验表明,与现有方法相比,SAFECAST 显著提高了故障检测的准确性,尤其是在同时采用视觉和语言扰动时。

  10. SIGNIFICANT · CL_154716 ·

    NVIDIA 发布用于物理AI的Cosmos3基础模型

    NVIDIA 发布了其Cosmos3基础模型平台,旨在加速物理AI应用的开发。该平台包含多个全模态世界模型,能够根据文本、图像和视频等各种输入生成视频、图像、音频和动作指令。这些模型将用于机器人、自动驾驶和智能空间环境,并有专门针对机器人控制和生成逼真视觉内容等任务的版本。

  11. SIGNIFICANT · CL_118639 ·

    Fireworks AI 发布更快的 GLM 5.2 以支持代理工作流

    Fireworks AI 推出了 GLM 5.2 Fast,这是一款专为代理工作流设计的模型,其运行速度比标准版本快 2-3 倍。这种增强的速度对于处理大上下文、编写计划和使用工具的代理至关重要,使其更加实用且具成本效益。该模型支持 100 万个 token 的上下文窗口,并具有优化的提示缓存功能,为重复使用的上下文提供显著折扣,这是代理操作中的主要成本因素。GLM 5.2 Fast 采用了一种特殊的架构,结合了混合专家模型 (MoE…

  12. RESEARCH · CL_65852 ·

    新基准测试机器人操作模型的可信度

    研究人员开发了新的基准来评估用于机器人操作的视频世界模型的可信度。这些基准使用真实的DROID片段,在正常、约束敏感、反事实和对抗性场景下评估模型。初步评估显示,尽管当前模型可以生成视觉上连贯的视频,但它们在推理约束、物理交互和抑制不安全指令方面存在困难,这表明仅凭视觉质量不足以满足可靠的机器人应用。

  13. TOOL · CL_56498 ·

    新基准测试揭示视频模型在因果推理方面存在不足

    研究人员推出了“What-If World”,这是一个旨在评估具身场景下视频生成模型因果推理能力的新基准测试。该基准测试包含319对提示,用于测试模型对场景中物理细节变化的响应,评估其对提示的遵循度、物理一致性、环境保持性以及结果的正确性。包括开源选项在内的当前最先进模型表现不佳,没有一个系统的配对得分超过52%,这表明它们在可靠支持条件动作模拟或基于模型规划方面存在显著局限性。

  14. COMMENTARY · CL_47572 ·

    开发者 Ben Tossell 分享 AI 课程、书签搜索应用

    开发者兼教育家 Ben Tossell 分享了他最近的项目和工具,重点是教非程序员如何使用 AI 进行构建。他正在开发一门名为“Fork Off”的季度课程,用于教授 AI 应用和代理的创建,并利用 Droid 构建的自定义平台。Tossell 还创建了一个用于搜索 X 书签的 Web 应用,并尝试使用 Replit Agent 构建了一个电子邮件分类系统,但他认为该系统尚不完善。他的技术栈包括 Chops 等技能管理工具和 Clau…