PulseAugur
实时 10:50:01
实体 InternVL2

InternVL2

PulseAugur coverage of InternVL2 — every cluster mentioning InternVL2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. COMMENTARY · CL_248156 ·

    Open-source multimodal models challenge GPT-4o on cost and performance · 2 sources tracked

    Open-source multimodal models are rapidly catching up to GPT-4o in performance and cost-effectiveness, with several models like Alibaba's Qwen2.5-VL and Mistral's Pixtral 12B offering competitive capabilities for tasks …

  2. TOOL · CL_229680 ·

    Li 和 Wu 推出 TrAct 以统一机器人控制和视觉预测

    研究人员(包括 Fei-Fei Li 和 Jiajun Wu)推出 TrAct,这是一种弥合机器人控制与视觉预测之间差距的新方法。TrAct 利用“视觉轨迹”作为中间语言,将机器人特定的“动作方言”翻译成世界模型可理解的通用“图像语言”。该系统包含三个组件:VLAT 用于生成动作-轨迹对,TWM 基于这些轨迹进行视觉预测渲染,VLAC 根据任务目标对预测进行评分。通过在机器人和人类第一人称视频的混合数据上进行训练,TrAct 旨在提高…

  3. TOOL · CL_216206 ·

    新的 VLM 框架可自动评估用于心脏消融规划的心脏 MRI 图像质量

    研究人员开发了一种新颖的两阶段视觉语言模型 (VLM) 框架,用于自动评估用于心脏消融规划的 LGE-MR 图像的临床质量和可用性。第一阶段采用微调的 VLM,根据噪声、运动伪影和边界准确性等标准生成放射学风格的报告。第二阶段使用基于 GPT 的模块将这些报告映射到结构化质量分数和临床可用性的二元决策。在基准测试中,InternVL2 在标准级评估中表现出高精度,而 DeepSeek 在临床可用性方面实现了完美一致。

  4. TOOL · CL_160971 ·

    新的 C-PTQ 方法提高了多模态大语言模型的量化效率

    研究人员开发了 C-PTQ,一种新颖的训练后量化方法,旨在提高多模态大语言模型(MLLMs)的效率。该技术解决了由对量化高度敏感的异常通道引起的性能下降问题。C-PTQ 利用 Fisher 加权目标,近似二阶导数,以更好地捕捉量化对特定任务损失的影响。在 Qwen2.5VL、InternVL2 和 LLaVA-OV 等模型以及多个基准测试上的实验表明,C-PTQ 在仅权重量化和权重-激活量化场景中都有效。

  5. TOOL · CL_70592 ·

    新型统一模型可检测和定位假图像

    研究人员开发了Venus-DeFakerOne,一个用于检测和定位假图像的统一模型,解决了当前假图像检测研究的碎片化问题。该新模型集成了InternVL2和SAM2,能够同时对各种伪造类型执行图像级检测和像素级伪造定位。DeFakerOne展示了最先进的性能,在众多基准测试中优于现有方法,并对先进的生成模型表现出鲁棒性。

  6. RESEARCH · CL_50513 ·

    新研究推进AI模型的向量量化技术

    几篇最新的研究论文探讨了AI模型向量量化技术的进展。ArcVQ-VAE引入了球形角度裕度先验,以提高图像建模中的潜在表示多样性和码本利用率。高斯VAE被用于一种无需训练的方法(Gaussian Quant)中,将其转换为VQ-VAE,性能优于现有方法。DiVeQ提供了一种使用重参数化技巧进行向量量化端到端训练的可微分方法,提高了压缩和生成任务的性能。MGVQ通过集成多维敏感度感知和梯度-Hessian融合来实现超低比特量化,专注于压缩…