large multimodal model
PulseAugur coverage of large multimodal model — every cluster mentioning large multimodal model across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
MAGA共和党人和美国企业被指控在AI/LMM欺诈中损失数十亿美元
美国企业和MAGA共和党人向AI和大型多模态模型(LMM)炒作、数据中心建设和自我交易投入了数十亿美元,作者将此定性为证券欺诈。作者批评了特朗普政府的政策,包括石油战争和关税,并表示由于这些行为,对美国共和党人缺乏信任,并认为美国市场因此蒙上了“污名”。
-
新型LMM支持感知度量的3D空间推理和地面定位
研究人员推出Ground3D-LMM,这是一种旨在增强3D环境自然语言理解的新型模型。该模型通过提供明确关联到特定3D区域并包含真实世界单位度量衡的响应,支持关于3D空间的交互式对话。为此,定义了一个名为3D Grounded Measurement的新任务,以及一个包含约250万个问答对、源自ScanNet和ScanNet++的大规模数据集。
-
新型Caption Bottleneck Models通过自然语言增强AI可解释性
研究人员推出了一种名为Caption Bottleneck Models (CaBM) 的新颖框架,旨在通过使用自然语言标题而非预定义的概念集来增强机器学习的可解释性。与需要专家定义或LLM生成概念列表的传统Concept Bottleneck Models (CBMs) 不同,CaBM利用大型多模态模型生成的自由文本。该方法通过严格基于图像派生的标题训练分类器,确保了无泄露的架构,并在训练后自主发现数据集特定的概念。实验表明,CaB…
-
新研究利用先进AI框架解决零样本检索问题 · 追踪2个来源
两篇新研究论文探讨了面向大规模零样本场景的先进检索技术。一篇论文介绍了EMMETT和IRENE框架,它们旨在为新颖项目即时合成分类器,在实际测试中将检索准确率提高了高达15%,并将广告点击率提高了4.2%。另一篇论文提出了Paracosm,一种无需训练的方法,用于组合图像检索,它利用大型多模态模型生成“心理图像”,在具有挑战性的基准测试中取得了最先进的性能。
-
新的CABLE框架提高了V2X系统中LMM的效率
研究人员开发了CABLE,一个旨在提高大型多模态模型(LMM)在车联网(V2X)系统中效率的新框架。该系统通过仅将感兴趣区域(ROIs)的遮蔽部分从边缘设备上传到云端,而不是上传完整分辨率的帧,从而减少了通信开销和云端延迟。CABLE利用先前的分割掩码、自身运动补偿和残差运动线索来定义这些ROIs,在云端和边缘之间创建了一个反馈循环。在多个数据集上的实验表明,在检测质量略有下降的情况下,通信节省显著,LMM预填充速度得到提高。
-
新AI防御框架可捕获并净化多智能体系统中的感染
研究人员开发了一个名为“前瞻性引导局部净化”(Foresight-Guided Local Purification, FLP)的新框架,用于对抗由大型多模态模型驱动的多智能体系统(MASs)中的传染性越狱攻击。目前的防御措施通常会使智能体响应同质化,这不足以实现真正的恢复。FLP通过让每个智能体模拟未来的交互来跟踪行为演变并消除感染,从而显著降低了感染率。