PulseAugur
中
实时 22:13:34
实体 Vista

Vista

PulseAugur coverage of Vista — every cluster mentioning Vista across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
22
90 天内 22
层级分布 · 90 天
主题
时间线
  1. 2026-08-23 research_milestone Researchers introduced VISTA, a new test-time alignment framework for visual autoregressive models. 来源
  2. 2026-06-12 research_milestone Publication of the VISTA paper detailing a new training framework for GUI grounding. 来源
  3. 2026-05-20 research_milestone VISTA system achieved first place in the EgoVis 2026 Ego4D STA Challenge. 来源
  4. 2026-05-20 research_milestone VISTA achieved first place in the EgoVis 2026 Ego4D STA Challenge. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 25 条
  1. TOOL · CL_280219 ·

    新的VISTA策略提高了机器人操作中的数据效率

    研究人员开发了VISTA,一种新颖的视觉-触觉扩散策略,专为接触丰富的机器人操作任务中的高效模仿学习而设计。该系统通过将视觉和触觉观测投影到球形令牌并进行等变融合来解决获取昂贵专家数据这一挑战。然后,VISTA使用这种融合的表示来条件化扩散策略,使其能够预测空间一致的动作,并在模拟和现实世界的机器人环境中,与现有方法相比,显著提高了数据效率。

  2. TOOL · CL_268811 ·

    ViSTA 适配器将大语言模型与临床时间序列数据连接起来

    研究人员开发了 ViSTA,这是一种新颖的适配器,旨在将临床时间序列数据集成到多模态大语言模型中。该适配器允许预训练的视觉-语言模型处理不规则的数值测量,从而增强其在医疗保健领域的预测能力。ViSTA 在 MIMIC-IV 数据集上实现了急性肾损伤和死亡率预测的高性能,甚至优于那些进行了大量基于文本推理的模型。

  3. RESEARCH · CL_268765 ·

    新的基准和框架推动多模态AI代理能力发展

    新研究引入了用于评估和改进多模态AI代理在复杂任务中表现的基准和框架。RobotWorld在物理世界交互方面测试代理,揭示了数字能力向机器人技术迁移的差距,其中Astra和Opus 5.5展现出不同的优势。其他研究侧重于通过选择性地迁移训练更新、用于决策规则的代理搜索以及用于多模态图模型的联邦学习来增强视觉推理能力。此外,Hob-VL和VISTA等新基准旨在评估和改进视觉基础推理和交互式世界性能。

  4. TOOL · CL_259262 ·

    新的VISTA框架应对深度学习轨迹偏差

    研究人员推出了一种新颖的自蒸馏框架VISTA,旨在解决深度学习模型中的轨迹偏差问题。当模型在不触发传统过拟合信号的情况下,放弃先前为特定数据子集学习到的特征时,就会出现这种现象。VISTA采用了一种经过验证的边缘覆盖得分来识别专家锚点,这些锚点是具有专业数据能力的早期模型状态。通过在训练过程中整合这些锚点的覆盖加权集成,VISTA对损失景观进行正则化并保留知识,在提高鲁棒性和泛化能力的同时,显著降低了存储开销,优于现有方法。

  5. TOOL · CL_239529 ·

    VISTA基准评估课堂环境下的视觉语言模型

    研究人员推出了VISTA,一个用于评估课堂环境中视觉语言模型的新基准。VISTA利用本科STEM课堂观察协议(COPUS)为视频讲座提供密集、多标签的标注。一个基线模型VISTA使用MiniCPM-V-4.5和一个多层感知器头,在未见过的讲座上比零样本方法取得了更高的准确率。

  6. RESEARCH · CL_227065 ·

    VISTA方法通过师生适应性学习增强AI推理能力 · 跟踪2个来源

    研究人员开发了VISTA,一种用于策略内自蒸馏(OPSD)的新方法,可增强AI模型的推理能力。与标准的OPSD不同,VISTA根据已验证的学生试运行来调整教师模型,特别关注教师模型和学生模型之间差异最大的区域。当应用于不同大小(1.7B、4B和8B参数)的Qwen3模型时,该方法在多个基准数据集(AIME24、AIME25、HMMT25)上表现出性能提升,优于现有的OPSD技术。

  7. TOOL · CL_218273 ·

    VISTA框架提升视觉自回归模型的组合准确性

    研究人员开发了VISTA,一个新颖的测试时对齐框架,旨在提高视觉自回归(VAR)模型的组合准确性。与之前的扩散模型方法不同,VISTA专门为VAR生成的离散、多分辨率采样过程而设计。它在冻结的Transformer内优化中间表示,以增强属性绑定和空间关系,而无需更改模型参数或进行额外训练。VISTA在组合类别方面显示出显著的改进,在2B骨干模型上得分提高了高达20%,并保持了图像质量,甚至使一个较小的模型能够超越一个较大的模型。

  8. RESEARCH · CL_227859 ·

    新框架VISTA和DiverseVAR增强视觉自回归模型

    研究人员开发了两个新框架VISTA和DiverseVAR,以解决文本到图像生成中视觉自回归(VAR)模型的局限性。VISTA基于Infinity构建,是首个用于VAR模型的基于梯度的测试时对齐方法,在2B骨干模型上将组合准确性提高了近20%,而无需更改模型参数。DiverseVAR通过将噪声注入文本嵌入并采用新颖的尺度-旅行细化技术来保持图像质量,专注于在测试时增强图像多样性。这两种方法都旨在在无需重新训练的情况下提高VAR模型的性能。

  9. TOOL · CL_174118 ·

    VISTA平台生成和审计以自我为中心的AI辅助场景

    研究人员开发了VISTA,一个旨在为评估AI代理生成和审计以自我为中心的辅助场景的新平台。该系统使用自然语言场景种子来创建可编辑的计划、以自我为中心的视频和可审计的审查记录。VISTA围绕不同的交互模式和后果类型构建场景,允许用户在媒体制作前修改生成管道的每个阶段。人类评估表明,与基线方法相比,VISTA生成的视频更准确地反映了其预期场景,使得有针对性的场景生成可检查和可修改。

  10. TOOL · CL_120335 ·

    伊朗冲突推高航空燃油价格,影响DHL运营

    伊朗的冲突已严重影响全球供应链,特别是导致航空燃油价格急剧上涨。DHL作为一家主要的物流公司,已亲身体验到这些影响,航空燃油成本翻倍不止。为缓解这些挑战,DHL已将其燃料采购地点多元化,利用油轮策略避开高价加油点,并增加了可持续航空燃料的使用。该公司还对冲突地区的燃油成本和安全风险实施了附加费,以维持运营利润率并确保服务连续性。

  11. RESEARCH · CL_117324 ·

    新的VISTA界面增强了LLM代理的上下文管理

    研究人员开发了VISTA,这是一种新颖的无需训练的界面,旨在改进大型语言模型(LLM)代理管理其上下文的方式。VISTA解决了LLM对其自身上下文“本体感觉盲”的局限性,这意味着它们无法固有地衡量令牌使用、时效性或访问历史。通过提供运行时仪表板和工作内存块的归档系统,VISTA使代理能够更好地处理长时任务。这种方法显著提高了在LOCA-Bench等基准测试上的性能,将Gemini-3-Flash的性能从22.7%提高到50.7%。

  12. TOOL · CL_96235 ·

    VISTA导航模型利用动作历史提高机器人泛化能力

    研究人员推出了一种新颖的视觉导航方法VISTA,该方法解决了视觉导航基础模型(VNMs)中归一化动作的脆弱性问题。通过对归一化动作历史进行条件化处理,VISTA明确了预测与物理位移之间的关系,从而减轻了性能下降和碰撞风险。该模型还集成了DINOv3编码器,通过捕捉空间和几何维度来更好地处理视觉重复的环境。VISTA展示了强大的泛化能力,在室外、森林和办公室等零样本真实世界部署中实现了100%的目标预测准确率,平均越过95%的检查点。

  13. RESEARCH · CL_95864 ·

    新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源

    近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…

  14. RESEARCH · CL_90827 ·

    新方法提升 VLM 在 GUI 基础任务上的准确性 · 2 篇论文

    两篇新研究论文介绍了用于提高视觉语言模型 (VLM) 在 GUI 基础任务上的准确性和可靠性的新方法。第一篇论文《Trust the Right Teacher》提出了一种质量感知自蒸馏方法,通过使用正确性感知门控和概率缩放来处理不可靠的坐标-token 预测,从而优化教师信号。第二篇论文《VISTA》提出了一个视图一致性自验证训练框架,该框架利用 GUI 的多个语义等价视图来稳定强化学习并提高坐标生成准确性,在 Qwen 主干上取得…

  15. RESEARCH · CL_74171 ·

    新的VISTA框架增强了LLM提示优化

    研究人员开发了VISTA,一个用于自动优化大型语言模型提示的新框架。该方法旨在克服现有反思性提示优化技术的局限性,这些技术可能不透明并导致性能下降。VISTA将假设生成与提示重写分离,从而实现更具可解释性的优化跟踪,并提高在算术应用题等复杂任务上的准确性。

  16. RESEARCH · CL_70319 ·

    VISTA框架通过验证数据改进机器人训练

    研究人员开发了VISTA,一个旨在利用真实机器人数据改进视觉-语言-动作(VLA)模型训练的框架。该框架解决了相机视角失真和人类收集的轨迹在物理上不可行等挑战。VISTA包含一个新的数据集(UMI-VQA),用于处理失真的视觉输入,以及一个验证流程,用于过滤不安全或不可能的机器人动作,从而提高策略性能。

  17. RESEARCH · CL_62291 ·

    新的VISTA框架增强长视频事件预测能力

    研究人员开发了VISTA,一个旨在改进长视频事件预测的新框架。与以往在复杂叙事和详细分析方面存在困难的模型不同,VISTA提取特定的视觉细节并使用迭代检索策略来构建连贯的事件链。该方法旨在通过整合多层次语义信息,生成更准确、更鲁棒的未来事件预测。

  18. TOOL · CL_53663 ·

    新的VISTA基准评估用于生成Web应用的AI代理

    研究人员推出了VISTA,一个旨在评估AI代理端到端Web应用程序生成能力的新基准。VISTA专注于现实的UI开发,要求代理根据不明确的输入创建功能性和视觉上一致的应用程序,这与之前专注于算法任务的基准不同。该基准包含五种不同的提示-信息条件,改变视觉保真度、结构信息和堆栈约束,以提供一个全面的测试平台。评估方法包括基于DOM的参考匹配、特定行为的浏览器测试以及基于CLIP的视觉相似性,以衡量结构对齐、功能完整性和视觉保真度。

  19. TOOL · CL_45054 ·

    VISTA框架改进了内窥镜视频中罕见病理的检测

    研究人员开发了VISTA,一个用于检测胶囊内窥镜视频中罕见病理的新型框架。该系统集成了空间和时间基础模型以及解剖学解码,以提高识别临床相关发现的准确性。VISTA框架在竞赛后取得了0.3726 [email protected]的性能,在RAREVISION任务评估中获得第二名。

  20. RESEARCH · CL_40517 ·

    Metropolis 专注于 AI 识别经济,估值达 50 亿美元

    Metropolis 是一家专注于物理空间计算机视觉的 AI 基础设施公司,已达到 50 亿美元的估值。该公司最初通过解决停车支付问题起步,现在旨在创建一个“识别经济”,让用户在不同地点无缝识别。Metropolis 最近完成了重要的收购,并获得了大量资金,包括由 J.P. Morgan 和 LionTree 领投的 16 亿美元融资。