PulseAugur
实时 10:50:23
实体 Multimodal foundation models

Multimodal foundation models

PulseAugur coverage of Multimodal foundation models — every cluster mentioning Multimodal foundation models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_193940 ·

    新的“PRAC”攻击针对AI代理的视觉模态

    研究人员开发了一种名为PRAC的新攻击,该攻击针对多模态基础模型的视觉模态,特别是计算机使用代理(CUAs)。与之前直接操纵模型输出的攻击不同,PRAC使用隐蔽的对抗性补丁来重定向模型的注意力。该方法已被证明成功地操纵了在线购物平台上的CUA选择特定目标产品。虽然该攻击需要白盒访问权限才能创建,但它对微调模型表现出泛化能力,对基于开放权重模型构建的CUA构成了重大的安全风险。

  2. COMMENTARY · CL_150525 ·

    视觉提示:多模态AI的新交互范式

    视觉提示是一种与多模态基础模型交互的新范式,不同于仅仅提供图像作为输入。它涉及精心设计的视觉上下文,以引导模型的注意力、约束其推理并改善其基础。这种方法将视觉输入视为指令性人工制品,类似于工程化的文本提示,从根本上改变了用户与AI的交互方式。

  3. TOOL · CL_104018 ·

    ReFine3D框架增强3D视觉语言模型适应性

    研究人员开发了ReFine3D,一个用于微调3D视觉语言模型的新框架。该方法解决了在数据有限的情况下将这些模型适应新领域所面临的挑战,防止过拟合和灾难性遗忘。ReFine3D采用选择性层微调,并结合多视图一致性和文本多样性正则化技术。实验表明,ReFine3D在3D领域泛化基准测试中显著提高了泛化能力、迁移能力和少样本准确率。

  4. TOOL · CL_80194 ·

    综述论文梳理多模态AI模型的测试时缩放

    一篇新的综述论文详细介绍了多模态基础模型(MFM)中新兴的测试时缩放(TTS)领域。该论文将现有的TTS方法分为基于采样、基于反馈和基于搜索的方法。它还概述了增强MFM在生成和推理任务中性能的常见应用、基准和未来研究方向。