PulseAugur
中
实时 10:16:42
实体 large multimodal model

large multimodal model

PulseAugur coverage of large multimodal model — every cluster mentioning large multimodal model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_229372 ·

    新的神经ODE-LMM模型学习纵向研究中复杂的协变量效应

    研究人员开发了一种名为神经ODE-LMM的新型统计模型,该模型将神经常微分方程(Neural ODE)集成到线性混合效应模型(LMM)框架中。这种新方法能够灵活地学习时变协变量对健康结果的复杂影响,而无需预先指定函数形式。该模型应用于“三城”(3C)队列研究,揭示了身体质量指数(BMI)、空腹血糖和认知能力下降之间轨迹依赖性关联。

  2. COMMENTARY · CL_213217 ·

    作者认为数学方程默认就是多模态的

    这篇文章认为,数学方程是人类发现的表示现实的最强大、最通用的形式。作者认为,方程本身就是多模态的,能够从一个紧凑的结构生成文本、图像、运动、声音和物理预测。这一观点挑战了将方程视为抽象公式的普遍看法,而是将其定位为构建能够真正理解和模拟物理世界而非仅仅讨论它的AI系统的基本基础。

  3. TOOL · CL_193541 ·

    新的VIGIL系统使用LMM进行精确的视觉失真检测

    研究人员推出了一种名为VIGIL的新系统,该系统专为用户生成图像中的精确视觉失真检测而设计。与依赖大型多模态模型(LMM)的文本驱动监督微调的先前方法不同,VIGIL采用了一种新颖的方法,将LLM解码器的不同层视为多个同步检测器。这种方法应用于包含超过14万张图像的VIGIL-140K训练集,旨在解决合成图像和真实图像之间显著的泛化差距,即所谓的合成到真实(S2A)挑战。

  4. RESEARCH · CL_193371 ·

    新的RAVEN-Eval框架使用大型多模态模型自动评判AI视频生成

    研究人员推出了RAVEN-Eval,一个旨在自动评估AI视频生成模型的新框架。该系统利用大型多模态模型(LMMs)作为评判者,采用基于评分标准的偏好判断来区分视频中细微的质量差异。RAVEN-Eval精心策划了特定的文本到视频和图像到视频任务,收集了大量的AI生成视频数据集,并建立了排行榜,以减少人工干预来评估模型性能。

  5. RESEARCH · CL_185149 ·

    新的CoCo-IR模型支持使用LMM进行迭代图像搜索

    研究人员推出CoCo-IR,一项新的上下文组合图像检索任务和模型,它允许对视觉搜索进行迭代优化。提出的大型多模态模型(LMM)解释交互历史以生成不断演变的变换图像嵌入(TIE)。为了促进训练,一个自主数据引擎利用LMM进行数据生成和模型引导的硬负例验证。CoCo-IR在CIRCO基准上实现了39.4 mAP@5,在其新的4轮对话基准上实现了44.1 R@1,显著优于现有方法,展示了最先进的性能。

  6. MEME · CL_165703 ·

    MAGA共和党人和美国企业被指控在AI/LMM欺诈中损失数十亿美元

    美国企业和MAGA共和党人向AI和大型多模态模型(LMM)炒作、数据中心建设和自我交易投入了数十亿美元,作者将此定性为证券欺诈。作者批评了特朗普政府的政策,包括石油战争和关税,并表示由于这些行为,对美国共和党人缺乏信任,并认为美国市场因此蒙上了“污名”。

  7. TOOL · CL_131646 ·

    新型LMM支持感知度量的3D空间推理和地面定位

    研究人员推出Ground3D-LMM,这是一种旨在增强3D环境自然语言理解的新型模型。该模型通过提供明确关联到特定3D区域并包含真实世界单位度量衡的响应,支持关于3D空间的交互式对话。为此,定义了一个名为3D Grounded Measurement的新任务,以及一个包含约250万个问答对、源自ScanNet和ScanNet++的大规模数据集。

  8. TOOL · CL_121224 ·

    新型Caption Bottleneck Models通过自然语言增强AI可解释性

    研究人员推出了一种名为Caption Bottleneck Models (CaBM) 的新颖框架,旨在通过使用自然语言标题而非预定义的概念集来增强机器学习的可解释性。与需要专家定义或LLM生成概念列表的传统Concept Bottleneck Models (CBMs) 不同,CaBM利用大型多模态模型生成的自由文本。该方法通过严格基于图像派生的标题训练分类器,确保了无泄露的架构,并在训练后自主发现数据集特定的概念。实验表明,CaB…

  9. RESEARCH · CL_109472 ·

    新研究利用先进AI框架解决零样本检索问题 · 追踪2个来源

    两篇新研究论文探讨了面向大规模零样本场景的先进检索技术。一篇论文介绍了EMMETT和IRENE框架,它们旨在为新颖项目即时合成分类器,在实际测试中将检索准确率提高了高达15%,并将广告点击率提高了4.2%。另一篇论文提出了Paracosm,一种无需训练的方法,用于组合图像检索,它利用大型多模态模型生成“心理图像”,在具有挑战性的基准测试中取得了最先进的性能。

  10. TOOL · CL_97986 ·

    新的CABLE框架提高了V2X系统中LMM的效率

    研究人员开发了CABLE,一个旨在提高大型多模态模型(LMM)在车联网(V2X)系统中效率的新框架。该系统通过仅将感兴趣区域(ROIs)的遮蔽部分从边缘设备上传到云端,而不是上传完整分辨率的帧,从而减少了通信开销和云端延迟。CABLE利用先前的分割掩码、自身运动补偿和残差运动线索来定义这些ROIs,在云端和边缘之间创建了一个反馈循环。在多个数据集上的实验表明,在检测质量略有下降的情况下,通信节省显著,LMM预填充速度得到提高。

  11. TOOL · CL_18562 ·

    新AI防御框架可捕获并净化多智能体系统中的感染

    研究人员开发了一个名为“前瞻性引导局部净化”(Foresight-Guided Local Purification, FLP)的新框架,用于对抗由大型多模态模型驱动的多智能体系统(MASs)中的传染性越狱攻击。目前的防御措施通常会使智能体响应同质化,这不足以实现真正的恢复。FLP通过让每个智能体模拟未来的交互来跟踪行为演变并消除感染,从而显著降低了感染率。