PulseAugur
实时 12:28:06
实体 HowTo100M

HowTo100M

PulseAugur coverage of HowTo100M — every cluster mentioning HowTo100M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_187562 ·

    机器人学习人类动作:连接视频数据与机器人控制的四种方法 · 跟踪 1 个来源

    清华大学、香港科技大学和微软亚洲研究院的联合论文提出了一种统一的框架,使机器人能够从人类视频中学习人类动作。该研究确定了四种主要方法:潜在动作、显式二维轨迹、显式三维轨迹和世界模型,所有这些都旨在构建人类动作与机器人控制信号之间的“表示桥梁”。虽然世界模型被视为泛化的有希望的方向,但目前的实际演示通常依赖于结合了强化学习的视觉-语言-动作(VLA)模型,这凸显了在为具身人工智能寻找最佳“配方”方面仍然存在挑战。

  2. RESEARCH · CL_70329 ·

    发布了新的主动式AI助手基准和架构

    研究人员推出了一种名为Pro extsuperscript{2}Bench的新型数据集和基准套件EgoProactive,旨在评估主动式程序辅助系统。这些系统旨在为任务提供实时、分步指导,包括自主决定何时打断以及如何指导用户,尤其是在用户偏离预期计划时。所提出的解耦规划器-交互架构在Llama 4上进行训练后,在客观干预质量和偏离计划恢复方面,相比专有模型和开源模型均取得了显著改进。

  3. RESEARCH · CL_09753 ·

    DenseStep2M 管道自动化视频标注以增进理解

    研究人员开发了 DenseStep2M,一个新颖的管道,可以在无需训练数据的情况下自动从教学视频中提取详细的程序性标注。该系统分割视频、过滤无关内容,并使用 Qwen2.5-VL 和 DeepSeek-R1 等先进的多模态和大型语言模型来生成结构化的、带时间戳的步骤。由此产生的 DenseStep2M 数据集包含约 100,000 个视频和 200 万个步骤,显著提高了密集视频字幕和时间定位等任务的性能。