PulseAugur
实时 06:52:10
实体 ACM Multimedia 2026

ACM Multimedia 2026

PulseAugur coverage of ACM Multimedia 2026 — every cluster mentioning ACM Multimedia 2026 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_239548 ·

    TourPhysics框架将物理学集成到视觉世界模型中

    研究人员推出了TourPhysics,一个旨在将物理学集成到视觉世界模型中的新框架,以增强探索和操纵能力。该系统从单一图像和定义的物理配置初始化,通过实现持久交互而非仅有限合成来扩展先前的工作。TourPhysics区分观测数据和物理干预,使用确定性模拟器进行轨迹计算,并使用生成器进行视觉输出,同时还分别管理外观记忆和几何证据。

  2. RESEARCH · CL_233600 ·

    AI图像取证研究推动检测和定位技术发展

    两篇提交至arXiv的研究论文提出了检测和定位被操纵图像(尤其是AI生成图像)的先进方法。第一篇论文介绍了一个用于GenText-Forensics挑战的证据引导系统,该系统结合了图像级检测器、空间定位器和多模态大语言模型来生成取证报告。该系统在该挑战中获得第二名。第二篇论文提出了一个统一框架,该框架超越了简单的检测,包括对篡改区域的像素级定位,在分类准确性和定位方面均优于现有基准。

  3. RESEARCH · CL_215972 ·

    新AI模型增强了跨多种生成方法的深度伪造检测能力 · 跟踪3个来源

    研究人员正在开发先进的深度伪造(deepfake)检测方法,重点是提高跨不同生成技术的泛化能力。一种名为DF-MoE的方法,利用具有预训练模型的多模态专家混合(Mixture-of-Experts)骨干网络来提取多样化的视听线索,在多个基准测试中取得了优越的性能。另一种方法AdaptPrompt,采用视觉-语言模型(VLMs)的参数高效适应,并引入了一个新的数据集Diff-Gen,以更好地检测来自扩散模型以及Midjourney和DA…

  4. TOOL · CL_198653 ·

    新的AdvNav框架揭示了导航机器人隐藏的视觉漏洞

    研究人员开发了AdvNav,一个新颖的黑盒对抗攻击框架,旨在测试视觉-语言导航(VLN)系统的安全漏洞。与以往的方法不同,AdvNav在不访问机器人内部参数的情况下运行,而是通过分析其导航行为来优化扰动。该框架利用双粒度反馈机制和自适应优化来识别弱点,在针对HAMT和MapGPT等模型时取得了显著的成功率。

  5. MEME · CL_187824 ·

    ACM多媒体2026会议费用引发研究人员不满

    一位研究人员分享了他们对ACM多媒体2026会议注册和文章处理费(APC)政策的不满。用户认为为两篇论文支付两次单独注册费和两次APC是不合理的,尤其是在会议论文集不包含在注册费内的情况下。提交两篇研讨会论文的总费用,包括ACM会员费,共计1850美元,用户认为不值得。

  6. TOOL · CL_154571 ·

    微动作分析挑战赛2026推出细粒度理解任务

    微动作分析大挑战(MAC)发布了第三届MAC 2026,与ACM Multimedia 2026同期举行。今年的挑战赛超越了传统的识别和检测,专注于细粒度的微动作理解。一项新任务利用多模态大语言模型来评估模型在解读人类细微的微动作和捕捉细粒度语义线索方面的能力。该挑战赛提供了标准化的数据集、任务设置和评估协议,相关论文中详细介绍了结果和表现最佳的解决方案。