PulseAugur
实时 05:11:46
实体 Qwen VL

Qwen VL

PulseAugur coverage of Qwen VL — every cluster mentioning Qwen VL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 21
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_228956 ·

    新的 GUI-PRA 代理解决了长时程 GUI 自动化挑战

    研究人员开发了 GUI-PRA,这是一种旨在通过解决错误累积来改进长时程 GUI 自动化的新型代理。该代理利用经验注入标准合成来推导通用验证原则,并利用标准引导的自回归感知来使用多粒度视觉工具主动调查与任务相关的 UI 证据。GUI-PRA 在 AndroidWorld 和 Mobile-MiniWoB++ 等基准测试中,相比标准的进程奖励模型取得了显著改进,其中 Qwen3-VL 在 AndroidWorld 上达到了 54.74% 的成功率。

  2. TOOL · CL_228772 ·

    研究发现:多模态大语言模型难以处理低资源的高棉语文档

    一项新的试点研究评估了多模态大语言模型(MLLMs)在理解低资源高棉语文档方面的能力。研究人员发现,虽然当前的多模态大语言模型可以处理视觉清晰的英文和结构化数字内容,但可靠的原生高棉语文档理解仍然是一个重大挑战。该研究从KH-FUNSD数据集中构建了一个评估子集,测试了Qwen-VL模型,并发现像Tesseract和PaddleOCR这样的外部OCR工具在处理高棉语脚本答案方面比直接提示效果更好。

  3. TOOL · CL_218357 ·

    Sa2VA模型通过SAM-2和MLLM统一图像和视频理解

    研究人员推出Sa2VA,这是一种旨在全面理解图像和视频的新型模型。Sa2VA集成了基础视频分割模型SAM-2与先进的多模态大语言模型(MLLM),在统一的token空间内处理文本、图像和视频。这种集成使得Sa2VA能够执行多种任务,包括指代分割和对话,只需极少的指令调整。该模型还引入了Ref-SAV,一个包含72,000多个复杂视频场景中物体表达的新数据集,以提高性能,特别是在指代视频物体分割方面。

  4. RESEARCH · CL_217839 ·

    AI模型在多语言和基于梗图的仇恨言论检测方面存在困难

    研究人员正在探索先进方法以提高AI检测仇恨言论的能力,特别是在多语言和多模态的背景下。一项研究侧重于训练时可解释性,以使AI推理与人类的理由保持一致,从而提高在英语和Hinglish语中检测反穆斯林仇恨言论的准确性和可解释性。另一篇论文定性分析了LLaVA-7B、Qwen-VL、GPT-4o mini和Claude 3 Haiku等最先进的视觉语言模型在识别梗图中的仇恨言论方面的有效性,超越了简单的准确性评估,以评估它们的理由。第三项…

  5. TOOL · CL_208639 ·

    新的MS-MFAD系统使用MLLM实现强大的面部反欺骗检测

    研究人员开发了MS-MFAD,这是一个利用多模态大语言模型(MLLM)的新型人脸反欺骗检测系统。与传统方法不同,MS-MFAD采用细粒度的像素语义锚定机制,以确保可审计的推理并防止定位幻觉。通过标注有限数量的高质量掩码,该系统显著降低了错误率,并证明了其对抗对抗性攻击的鲁棒性,同时满足实时部署的要求。

  6. RESEARCH · CL_200229 ·

    视觉语言模型用于机器人安全风险评估

    研究人员评估了三种开源视觉语言模型(VLM)——InternVL、Qwen-VL 和 SmolVLM——在评估机器人第一人称图像近邻风险方面的能力。尽管微调和高级提示策略在整体上仅显示出适度改进,但 Qwen-VL 在使用特定提示时,在正确识别高危险场景方面表现出显著的提高。研究还发现,准确的危险分类并不一定与更好的空间定位相关,这表明 VLM 可以在不精确关注图像关键区域的情况下提供有用的安全标签。

  7. RESEARCH · CL_191100 ·

    新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源

    研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。

  8. TOOL · CL_181085 ·

    新的TinyDamage系统提高了VLM在车辆损伤评估中的空间基础能力

    研究人员开发了TinyDamage,这是一种新颖的架构,旨在提高视觉语言模型(VLM)在精细化车辆损伤评估中的空间基础能力。该系统集成了专用分割模型和最先进的VLM Qwen-VL,以提高识别划痕和裂缝等细微缺陷的准确性。这种混合方法在LangGraph智能体管道中实现,通过将VLM输出与精确的分割数据相结合,显著降低了报告幻觉率,解决了当前VLM在视觉评估任务中的关键局限性。

  9. TOOL · CL_175872 ·

    LiteLLM和LangGraph统一176个LLM API,实现无缝切换

    一种使用LiteLLM和LangGraph的新方法已被开发出来,用于统一超过176个大语言模型的接口,包括来自OpenAI、Claude、Qwen和DeepSeek的模型。该系统解决了集成不同LLM API时所需的高昂切换成本和代码修改的重大挑战。通过LiteLLM标准化模型交互(将所有模型以OpenAI兼容格式呈现),并使用LangGraph编排复杂工作流,开发人员可以在其AI应用程序中实现无缝的模型切换、自动回退机制和更好的成本控制。

  10. TOOL · CL_172217 ·

    微软移除 Mage Flow,开发新的文本编码器

    微软已移除其 Mage Flow 工具,但据报道正在开发一种更高效的文本编码器。这款新的编码器有望改进 Qwen VL,并可能带来一个更完善、功能更强大的 Mage Flow 版本,可能包含增强的功能。

  11. TOOL · CL_167042 ·

    IHUI AI 使用 LiteLLM 和 LangGraph 统一 176 个大模型,实现无缝切换

    IHUI AI 开发了一个使用 LiteLLM 和 LangGraph 的系统,统一了包括 OpenAI、Claude、Qwen 和 DeepSeek 在内的 176 多个大语言模型的 API。该解决方案解决了集成不同大模型 API 的重大挑战,这些 API 通常具有不同的响应格式和功能,导致开发者的切换成本很高。通过 LiteLLM 抽象化这些差异,开发者可以使用类似于 OpenAI 格式的单一、一致的接口与各种模型进行交互。然后,…

  12. TOOL · CL_154288 ·

    新的乐高基准揭示了视觉语言模型在细粒度理解方面的局限性

    研究人员推出了 LEGO Co-builder,这是一个新的基准,旨在测试人工智能模型在解释多模态组装说明时的细粒度视觉语言理解能力。该基准结合了真实世界的乐高组装逻辑和程序生成场景,以评估指令遵循、物体检测和状态检测。虽然 InstructBLIP 等模型在物体检测方面取得了高性能,但 GPT-4o 和 Gemini 等先进模型在细粒度场景理解和组装状态检测方面遇到了困难,凸显了这些领域的当前局限性。

  13. TOOL · CL_133552 ·

    新框架使用LLM进行广播电视分析,评估Gemini、Llama、Qwen、Gemma

    一篇新的研究论文介绍了一个专为广播电视分析设计的多模态标注框架,解决了处理具有领域特定约束的视听内容的独特挑战。该研究系统地评估了各种多模态大型语言模型(LLMs),包括Gemini 3.0 Pro、LLaMA 4 Maverick、Qwen-VL和Gemma 3,在不同的管道架构和输入策略下。结果表明,更大的模型从视频中的时间连续性中获益更多,而较小的模型可能会因延长的多模态上下文而遭受令牌过载。该框架已部署到广播剧集中,将分钟级标…

  14. TOOL · CL_121330 ·

    ICML 2026 投稿量激增,关注点转向 AI 推理与安全

    在首尔举行的国际机器学习大会 (ICML) 2026 收到了超过 23,000 篇论文,投稿量几乎翻倍,同时保持了 26.6% 的录用率。关键研究趋势表明,研究重点正从简单地扩展模型转向“更好思考”,更加关注 LLM 推理、AI 安全与对齐,以及通过压缩和加速技术提高模型效率。中国研究人员的引用率日益提高,并开始定义研究问题,特别是 DeepSeek 在高效模型开发和多模态 AI 方面的贡献产生了影响。

  15. TOOL · CL_117809 ·

    新数据集和模型以多样化视角增强多模态数学推理能力

    研究人员推出了 MathV-DP,这是一个旨在通过捕捉每个图像-问题对的多样化解题轨迹来改进多模态数学推理的新数据集。该数据集旨在提供比传统的一对一图像-文本配对更丰富的监督。他们还开发了 Qwen-VL-DP,一个基于 Qwen-VL 的模型,该模型使用监督学习和一种新颖的组相对策略优化(GRPO)方法。该方法结合了正确性辨别和多样性感知奖励,使模型能够从不同的推理视角中学习,并区分正确但不同的解法。在 MathVista 和 Ma…

  16. RESEARCH · CL_117799 ·

    新研究通过先进的检测方法解决 LLM 和 VLM 幻觉问题

    研究人员正在开发新的方法来对抗大型语言模型 (LLM) 和视觉语言模型 (VLM) 中的幻觉。一种名为“不确定时验证”的方法,通过跨模型一致性检查来提高幻觉检测的准确性,同时降低计算成本。另一种方法 CORTEX,通过比较检索文档的有无对内部模型表示的差异,专注于检索增强生成 (RAG) 中的 token 级检测。对于 VLM,ViPSy 和 Context-aware Attention Intervention (CAI) 等技术…

  17. TOOL · CL_115539 ·

    新的BYORn框架保护LVLMs免受后门攻击

    研究人员开发了一个名为BYORn(Bootstrap Your Own Responses)的新型防御框架,用于在监督微调(SFT)过程中保护大型视觉语言模型(LVLMs)免受后门攻击。该方法利用预训练模型固有的语义理解能力来检测并用动态生成的、语义一致的响应替换恶意篡改的响应。BYORn能有效中和各种后门攻击,对模型的通用性能影响极小,在某些情况下甚至通过正则化效应提升了模型性能。

  18. RESEARCH · CL_115308 ·

    ReScene框架以更高精度重建3D室内场景 · arXiv论文

    研究人员开发了ReScene,一个旨在从多视图捕获中构建可用于仿真的3D室内场景的新框架。该方法通过专注于跨视图关系融合和物理上合理的场景组装,而不是仅仅进行单对象重建,来解决现有方法的局限性。ReScene利用HierView组件来优先化重建视图,并使用Relation-Aware Assembly将多帧预测与几何先验相结合,从而生成一个置信度加权的场景图。该框架在ScanNet场景上实现了最先进的性能,显著降低了Chamfer D…

  19. RESEARCH · CL_99621 ·

    新AI框架使机器人能够与人类共同创作音乐

    研究人员开发了Co-policy,一个新颖的框架,使机器人能够与人类共同创作音乐。该系统整合了语义理解和物理执行,允许机器人在语音、音乐输入和视觉线索的基础上生成互补的音乐响应。与真实机器人的实验证明了Co-policy在与人类意图保持一致和准确执行音乐表演方面的有效性。

  20. TOOL · CL_116658 ·

    Qwen-RobotManip 模型通过统一对齐技术推进机器人操作

    研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。