PulseAugur
中
实时 03:39:12
实体 Qwen2.5-VL

Qwen2.5-VL

PulseAugur coverage of Qwen2.5-VL — every cluster mentioning Qwen2.5-VL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
58
90 天内 58
发布 · 30天
0
90 天内 0
论文 · 30天
45
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/3 页 · 共 60 条
  1. RESEARCH · CL_273370 ·

    新基准测试挑战多模态AI模型在生成和图表到代码任务上的能力 · 已追踪2个来源

    发布了两个新的基准测试来评估多模态大语言模型的能力。第一个,MMMG,专注于跨图像、音频以及交错文本和图像/音频的多任务多模态生成,与人类判断的一致性达到94.4%。第二个,Chart2Code,评估图表理解和代码生成,具有层次化的难度级别,并评估代码的正确性和视觉保真度。两个基准测试都揭示了当前最先进的模型,包括GPT Image和GPT-5,在复杂生成和交错任务方面仍有显著的改进空间。

  2. TOOL · CL_255737 ·

    llama.cpp 错误导致 M-RoPE 嵌入批次结果不确定

    llama.cpp 库中的一个错误会导致在处理 Qwen3.5 和 Qwen2.5-VL 等 M-RoPE 模型的嵌入批次时产生不正确的结果。该问题源于堆缓冲区溢出,库读取了超出位置数组分配内存的区域。这可能导致不确定的 logits,在某些情况下还会导致错误的 token 预测,尽管它通常很微妙且难以检测。该问题在使用这些模型的嵌入模式时发生,而标准的 token 处理不受影响。

  3. TOOL · CL_254894 ·

    视觉-语言模型在手写考试评分方面展现潜力

    研究人员评估了各种视觉-语言模型(VLM)在基于成果的教育中对手写考试进行评分的有效性。该研究比较了包括 Qwen2.5-VL、InternVL3 和 Pixtral 在内的配置,并使用了零样本提示、少样本提示和低秩适配(LoRA)等方法。使用 LoRA 的 Qwen2.5-VL 实现了 0.727 的 Quadratic Weighted Kappa (QWK) 分数,超过了平均人类配对 QWK 的 0.551,显示出自动评分的潜力…

  4. TOOL · CL_254875 ·

    StepPrune方法通过自适应选择视觉标记来加速多模态大语言模型推理

    研究人员开发了一种新颖的StepPrune方法,用于在多模态大语言模型(MLLMs)中自适应地选择视觉标记以加速推理。与之前独立处理标记的Top-K方法不同,StepPrune根据先前选择的标记和文本上下文来顺序选择标记,动态确定要保留的标记数量。该方法在LLaVA-1.5上已显示出显著的性能保留,实现了94.6%的完整前缀归一化性能,同时删除了88.9%的视觉标记。该方法还实现了1.50倍的预填充速度提升,将延迟从59.95毫秒降低…

  5. COMMENTARY · CL_248156 ·

    开源多模态模型在成本和性能上挑战 GPT-4o · 跟踪 2 个来源

    开源多模态模型在性能和成本效益方面正迅速追赶 GPT-4o,其中阿里巴巴的 Qwen2.5-VL 和 Mistral 的 Pixtral 12B 等模型在文档处理和视觉问答等任务上提供了竞争性的能力。虽然 GPT-4o 在复杂跨模态推理和细微指令遵循方面仍处于领先地位,但开源替代方案在部署灵活性和更低的推理成本方面具有显著优势,使其对许多生产用例具有吸引力。OpenAI 最近的 GPT-4o 更新改进了其原生图像和音频推理能力,降低了…

  6. TOOL · CL_246075 ·

    Hugging Face 使用 Gradio Workflow 重建 AUTOMATIC1111

    Hugging Face 开发了一款名为 Workflow1111 的新工具,该工具利用 Gradio 的工作流功能重建了 AUTOMATIC1111 Stable Diffusion Web UI 的功能。这个新工作流由十一个媒体管道和七十三(73)个节点组成,集成了各种最先进的模型,用于文本到图像生成、放大、图像编辑和对象检测等任务。用户可以通过登录其 Hugging Face 账户来访问和修改这些管道,从而利用他们自己的推理配额。

  7. RESEARCH · CL_227219 ·

    新的基准和方法解决了跨模态和跨领域的 LLM 幻觉问题

    研究人员正在开发新的方法和基准,以检测和减轻各种模态和领域的 LLM(大语言模型)中的幻觉。OmniHallu 为检测多模态理解和生成任务中的幻觉提供了一个统一的框架,并得到了新基准的支持。另一种方法侧重于特定领域的幻觉检测,结合分类、不确定性量化和偏好优化,以减少 Qwen2.5 等模型中的错误。对于法律应用,LexAgentHallu 被引入为一个基准,用于分析工具增强型法律代理中的幻觉,并突出代理的失败。此外,证据对齐实体验证 …

  8. TOOL · CL_223349 ·

    Video-FLAIR框架学习自适应推理以处理多模态查询

    研究人员推出了一种新颖的训练框架Video-FLAIR,旨在优化多模态查询的推理策略。该系统采用强化学习,为每个查询动态选择最合适的推理模式——感知、组合或审议式——从而提高效率和准确性。通过比较所有三种模式生成的响应并使用复合奖励信号,Video-FLAIR学会了在不需要每个查询的标注的情况下进行自适应推理。这种方法在MathVista、Video-Holmes和Video-MMMU等基准测试中显著提高了准确性,同时大幅降低了计算成本。

  9. RESEARCH · CL_218205 ·

    新研究解决视频和语言模型中的AI幻觉问题

    研究人员正在开发新的方法来对抗AI模型中的幻觉,特别是在视频-语言和大型语言模型方面。一种名为CounterVid的方法使用反事实视频生成来创建合成数据,以训练Qwen2.5-VL和InternVL3等模型更好地区分动作和时间顺序。另一种名为Prediction of Prediction (PoP) 的方法,通过在单次前向传播中分析内部隐藏状态动态来检测大型语言模型中的事实错误,在TruthfulQA基准测试上达到了75.5%的AU…

  10. TOOL · CL_216060 ·

    新型视觉语言模型无需OCR即可提取文档数据,性能超越大型模型

    研究人员开发了一种从文档图像中提取键值对的新方法,无需依赖传统的OCR预处理。他们对一个名为SmolDocling的紧凑型2.56亿参数视觉语言模型进行了微调,以端到端地执行此任务,联合处理识别、定位和关联。据报道,这种方法在FUNSD和XFUND等基准测试上的表现优于大型零样本视觉语言模型,同时比Qwen2.5-VL等模型更小、更快。

  11. RESEARCH · CL_215992 ·

    新基准测试探究视觉语言模型空间推理能力,揭示定位和关系理解的差距 · 跟踪 5 个来源

    研究人员正在开发新的基准测试和方法论,以更好地理解和诊断视觉语言模型 (VLM) 在空间推理方面的失败。一种名为 GUI-Primitives 的方法使用对比指令对来隔离在图形用户界面中理解空间关系方面的失败,揭示当前 VLM 在定位和特定的关系类型(如包含和遮挡)方面存在困难。另一项研究调查了 LLaVA-1.5 和 Qwen2.5-VL 等 VLM 的内部机制,发现精确的物体定位并非总是空间推理所必需的,空间推理遵循一个分阶段的从…

  12. TOOL · CL_206556 ·

    新框架Zero-MELO提升MLLM微手势识别能力

    研究人员开发了Zero-MELO,一个旨在提高多模态大语言模型(MLLMs)在微手势识别(MGR)方面性能的新框架。该框架通过引入一种测试时证据校准方法,解决了MLLMs在处理细粒度和以动作为中心任务方面的局限性。该方法使用树搜索机制收集局部视觉证据,并使用校准模块纠正分数偏差,与基线模型相比,在iMiGUE和MA-52等数据集上的准确性显著提高。

  13. RESEARCH · CL_183204 ·

    新框架提升AI长视频理解效率

    研究人员开发了两个新框架EcoFrame和EviSelect,旨在提高大型语言模型处理长视频理解的效率。EcoFrame采用一种无需训练的方法,根据模型的输出不确定性和注意力模式来调整帧选择过程,实现了显著的加速,并且准确性与现有方法相当。EviSelect则采用一种基于目标模型内部注意力的动态视觉选择方法,通过自适应地调整采样率和空间分辨率,同时优化准确性和效率。

  14. RESEARCH · CL_181051 ·

    新的PhyCheck数据集评估视频大语言模型对物理定律的理解

    研究人员推出了PhyCheck,这是一个旨在评估和改进视频大语言模型(VideoLLMs)物理定律理解能力的新数据集。该数据集包含粗粒度和细粒度子集,用于评估模型是否能识别物理定律的违规行为以及导致这些违规行为的具体细节。使用PhyCheck数据对Qwen2.5-VL进行微调的实验表明,物理一致性有了显著提高,尽管当前模型在整合额外的因果背景方面仍存在困难。

  15. RESEARCH · CL_179099 ·

    新框架通过视觉令牌和自我诊断增强视觉语言模型推理能力 · 跟踪3个来源

    研究人员开发了新的框架来增强视觉语言模型(VLMs)的推理能力。其中一种方法,Chain-of-Visual-Thought(COVT),使用连续的视觉令牌来捕获密集的感知信息,当集成到Qwen2.5-VL和LLaVA等模型中时,在各种基准测试上的性能提高了3-16%。另一种方法,ReGround,通过使VLMs能够自我诊断和重新检查视觉证据,解决了多步推理中视觉基础丢失的问题,在视觉密集型任务上显示出持续的收益,并且推理开销适中。此…

  16. RESEARCH · CL_172037 ·

    新方法增强多模态大语言模型空间推理能力 · 跟踪4个来源

    研究人员开发了新的方法来提高多模态大语言模型(MLLMs)的空间推理能力。SpatialCLI 使用专业的视觉模型作为工具来增强 MLLMs 的感知和推理能力,在 MindCube 等基准测试中取得了显著的性能提升。另一种方法 ByDeWay-V2 将显式的空间关系上下文与深度线索相结合,以减少幻觉并提高可审计性,在 BLINK 和 VSR 基准测试中表现强劲。第三篇论文介绍了视觉信用审计(VCA),用于评估空间基准测试在多大程度上依…

  17. RESEARCH · CL_167440 ·

    新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源

    三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。

  18. RESEARCH · CL_165240 ·

    新方法剪枝视觉令牌以实现高效MLLM推理 · 跟踪4个来源

    研究人员开发了多种新方法来高效剪枝多模态大语言模型(MLLM)的视觉令牌,旨在降低推理成本和延迟。LAST框架利用最后一个查询令牌的注意力来指导剪枝,无需访问云端模型,即可在将令牌数量减少87.5%的同时保留94.5%的准确率。SFPruner将剪枝重新构建为单次前向传播,将Qwen2.5-VL的令牌选择时间从112.4毫秒显著缩短至2.5毫秒。SPARE是另一种方法,将剪枝视为子空间重建,通过最小化重建误差并纳入“反相关性”标准,在…

  19. TOOL · CL_159639 ·

    Qwen Image Edit Plus 可通过文本命令编辑图像中的文本

    “Jimniting”(源自Gemini)已成为通过文本命令编辑图像的热门俚语,尤其用于更改图像内的文本。阿里巴巴的开源模型Qwen Image Edit Plus被重点介绍,它能够添加、删除和替换图像中的文本,并旨在保留原始字体、大小和样式。虽然Qwen Image Edit在中文和英文文本编辑的基准测试中表现强劲,但其对西里尔文文本的有效性仍未经验证,并且中国大陆以外的用户可能需要通过变通方法才能访问。

  20. TOOL · CL_158320 ·

    Visionary 应用简化了 macOS 上的 AI 数据集创建

    Visionary 是一款新的、本地运行的 macOS 应用程序,旨在简化为 AI 模型构建和策划训练数据集的过程。它整合了多个现有工具的功能,提供近乎重复项检测、按人物或分辨率对图像进行分组以及标签管理等功能。该应用程序与各种字幕模型集成,并支持与 kohya 和 diffusers 等流行训练框架兼容的导出格式。