EgoIntention
PulseAugur coverage of EgoIntention — every cluster mentioning EgoIntention across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的Rita框架提高了视觉语言模型推理的一致性
研究人员推出了一种新颖的强化学习框架Rita,旨在提高视觉语言模型推理过程与其最终答案之间的一致性。Rita解决了“思维漂移”问题,即模型可能在内部逻辑存在缺陷的情况下得出正确输出。该框架利用了两种新的奖励:思维奖励和一致性奖励,这两种奖励均源自参考答案的条件概率,并结合了难度感知的数据过滤策略。在EgoIntention和RefEgo-Int基准上的实验表明,Rita的性能优于现有的监督微调和标准RL方法。
-
新数据集EgoIntention增强了AI助手的第一人称视觉对齐能力
研究人员推出了EgoIntention,一个旨在提高AI助手第一人称视觉意图对齐能力的新型数据集。该数据集挑战多模态大语言模型(LLMs)在从第一人称视角推理不常见的物体功能时,理解并忽略不相关的上下文物体。提出的Reason-to-Ground (RoG)指令调优方法通过结合显式物体对齐和隐式意图推理,提高了模型性能,优于标准的微调技术。
-
新的SmartRes框架提高了自我中心视觉基础的效率
研究人员开发了SmartRes,一个旨在通过动态路由高分辨率图像块来提高自我中心视觉基础效率的新颖框架。该方法解决了多模态大型语言模型处理高分辨率输入带来的高计算成本问题。SmartRes编码低分辨率全局上下文,并使用轻量级路由器激活特定的以对象为中心的区域,在保持性能的同时显著减少视觉令牌。该框架还包含一个边距正则化路由目标,以提高前景召回率,特别是在前景-背景元素不平衡的情况下。
-
SmartRes 框架提高了以自我为中心的视觉地面定位效率
研究人员开发了 SmartRes,一个旨在提高以自我为中心的视觉地面定位任务效率的新型框架。该方法通过动态地将高分辨率块路由到以对象为中心的区域来优化像素空间的处理,从而减少了对大量视觉标记处理的需求。与现有的标记减少技术相比,SmartRes 在保持高性能的同时,实现了高达 67% 的视觉标记显著减少,并提供了更快的推理速度。该框架的有效性在 Ego4D 和 EgoIntention 等数据集上得到了证明,尤其是在小型对象地面定位应用方面。