PulseAugur
实时 18:26:52
实体 Qwen VL

Qwen VL

PulseAugur coverage of Qwen VL — every cluster mentioning Qwen VL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_154288 ·

    新的乐高基准揭示了视觉语言模型在细粒度理解方面的局限性

    研究人员推出了 LEGO Co-builder,这是一个新的基准,旨在测试人工智能模型在解释多模态组装说明时的细粒度视觉语言理解能力。该基准结合了真实世界的乐高组装逻辑和程序生成场景,以评估指令遵循、物体检测和状态检测。虽然 InstructBLIP 等模型在物体检测方面取得了高性能,但 GPT-4o 和 Gemini 等先进模型在细粒度场景理解和组装状态检测方面遇到了困难,凸显了这些领域的当前局限性。

  2. TOOL · CL_133552 ·

    新框架使用LLM进行广播电视分析,评估Gemini、Llama、Qwen、Gemma

    一篇新的研究论文介绍了一个专为广播电视分析设计的多模态标注框架,解决了处理具有领域特定约束的视听内容的独特挑战。该研究系统地评估了各种多模态大型语言模型(LLMs),包括Gemini 3.0 Pro、LLaMA 4 Maverick、Qwen-VL和Gemma 3,在不同的管道架构和输入策略下。结果表明,更大的模型从视频中的时间连续性中获益更多,而较小的模型可能会因延长的多模态上下文而遭受令牌过载。该框架已部署到广播剧集中,将分钟级标…

  3. TOOL · CL_121330 ·

    ICML 2026 投稿量激增,关注点转向 AI 推理与安全

    在首尔举行的国际机器学习大会 (ICML) 2026 收到了超过 23,000 篇论文,投稿量几乎翻倍,同时保持了 26.6% 的录用率。关键研究趋势表明,研究重点正从简单地扩展模型转向“更好思考”,更加关注 LLM 推理、AI 安全与对齐,以及通过压缩和加速技术提高模型效率。中国研究人员的引用率日益提高,并开始定义研究问题,特别是 DeepSeek 在高效模型开发和多模态 AI 方面的贡献产生了影响。

  4. TOOL · CL_117809 ·

    新数据集和模型以多样化视角增强多模态数学推理能力

    研究人员推出了 MathV-DP,这是一个旨在通过捕捉每个图像-问题对的多样化解题轨迹来改进多模态数学推理的新数据集。该数据集旨在提供比传统的一对一图像-文本配对更丰富的监督。他们还开发了 Qwen-VL-DP,一个基于 Qwen-VL 的模型,该模型使用监督学习和一种新颖的组相对策略优化(GRPO)方法。该方法结合了正确性辨别和多样性感知奖励,使模型能够从不同的推理视角中学习,并区分正确但不同的解法。在 MathVista 和 Ma…

  5. RESEARCH · CL_117799 ·

    新研究通过先进的检测方法解决 LLM 和 VLM 幻觉问题

    研究人员正在开发新的方法来对抗大型语言模型 (LLM) 和视觉语言模型 (VLM) 中的幻觉。一种名为“不确定时验证”的方法,通过跨模型一致性检查来提高幻觉检测的准确性,同时降低计算成本。另一种方法 CORTEX,通过比较检索文档的有无对内部模型表示的差异,专注于检索增强生成 (RAG) 中的 token 级检测。对于 VLM,ViPSy 和 Context-aware Attention Intervention (CAI) 等技术…

  6. TOOL · CL_115539 ·

    新的BYORn框架保护LVLMs免受后门攻击

    研究人员开发了一个名为BYORn(Bootstrap Your Own Responses)的新型防御框架,用于在监督微调(SFT)过程中保护大型视觉语言模型(LVLMs)免受后门攻击。该方法利用预训练模型固有的语义理解能力来检测并用动态生成的、语义一致的响应替换恶意篡改的响应。BYORn能有效中和各种后门攻击,对模型的通用性能影响极小,在某些情况下甚至通过正则化效应提升了模型性能。

  7. RESEARCH · CL_115308 ·

    ReScene框架以更高精度重建3D室内场景 · arXiv论文

    研究人员开发了ReScene,一个旨在从多视图捕获中构建可用于仿真的3D室内场景的新框架。该方法通过专注于跨视图关系融合和物理上合理的场景组装,而不是仅仅进行单对象重建,来解决现有方法的局限性。ReScene利用HierView组件来优先化重建视图,并使用Relation-Aware Assembly将多帧预测与几何先验相结合,从而生成一个置信度加权的场景图。该框架在ScanNet场景上实现了最先进的性能,显著降低了Chamfer D…

  8. RESEARCH · CL_99621 ·

    新AI框架使机器人能够与人类共同创作音乐

    研究人员开发了Co-policy,一个新颖的框架,使机器人能够与人类共同创作音乐。该系统整合了语义理解和物理执行,允许机器人在语音、音乐输入和视觉线索的基础上生成互补的音乐响应。与真实机器人的实验证明了Co-policy在与人类意图保持一致和准确执行音乐表演方面的有效性。

  9. TOOL · CL_116658 ·

    Qwen-RobotManip 模型通过统一对齐技术推进机器人操作

    研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。

  10. RESEARCH · CL_95864 ·

    新研究解决 LVLM 幻觉问题并改进视觉-语言学习

    研究人员正在开发新方法来提高大型视觉-语言模型 (LVLM) 的鲁棒性和能力。一种名为 SeeMe 的方法侧重于通过工程化视觉标记来抑制不相关信息同时保留关键证据,从而减轻幻觉。另一个框架 Text as Partial Constraint (TPC) 旨在通过将多视图字幕视为不完整监督并提炼共识语义核心来创建更可靠的表示。此外,还在探索像 HiMe 这样的新架构,用于长视域的视觉-语言-动作控制,将具身智能解耦为分层组件,以实现更…

  11. TOOL · CL_94281 ·

    阿里巴巴的 Qwen LLM 已通过 promptra.ru API 在俄罗斯上线

    由阿里巴巴集团开发的大型语言模型 Qwen 系列现已通过名为 promptra.ru 的 API 聚合器在俄罗斯提供。该服务允许俄罗斯用户以卢布支付 Qwen 模型(包括 Qwen 3.6 Plus)的费用,无需使用外国支付方式。该聚合器提供兼容 OpenAI 的端点,并遵循阿里巴巴的定价,使其成为开发者的经济高效选择。Qwen 模型以其多语言能力(尤其是在亚洲语言方面)、强大的编码任务性能以及高达一百万个 token 的大上下文窗口而著称。

  12. SIGNIFICANT · CL_94039 ·

    阿里巴巴推出 Qwen-Robot 具身大模型系列

    阿里巴巴已推出其首个全面的具身人工智能模型家族 Qwen-Robot 系列。该系列包含三个独立的模型:用于视觉-语言-动作(VLA)操作的 Qwen-RobotManip,用于视觉-语言导航(VLN)的 Qwen-RobotNav,以及作为世界模型的 Qwen-RobotWorld。这些模型可以独立运行或协同工作,旨在为各种机器人在物理世界中有效运行提供基础能力。

  13. FRONTIER RELEASE · CL_94272 ·

    阿里巴巴的Qwen推出具身智能机器人套件

    阿里巴巴的Qwen推出了Qwen-Robot Suite,这是一套专为具身智能设计的三个基础模型集合。该套件包括用于导航的Qwen-RobotNav,用于物理交互和操作的Qwen-RobotManip,以及用于模拟物理环境的Qwen-RobotWorld。这个集成工具旨在弥合AI的感知和推理能力与其在现实世界中执行物理动作的能力之间的差距。

  14. RESEARCH · CL_94273 ·

    Qwen-RobotManip 和 PAIWorld 推动机器人操作基础模型发展

    研究人员开发了 Qwen-RobotManip,一个机器人操作基础模型,它利用统一的对齐框架来大规模处理异构数据。这种方法使模型能够实现显著的泛化能力,包括零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于先前的最先进模型。另外,PAIWorld 通过几何感知和跨视图注意力增强了扩散-Transformer 世界模型,以提高机器人操作任务中的 3D 一致性,并在特定排行榜上获得最高排名。

  15. TOOL · CL_62707 ·

    PhyDrawGen 使用神经符号 AI 生成精确的物理图表

    研究人员开发了 PhyDrawGen,一个从自然语言描述生成物理图表的新颖系统。这个神经符号管道首先使用大型语言模型从文本中提取场景图,然后由求解器将其转换为精确的几何表示。经过微调的 Qwen-VL 模型会迭代地优化图表,以确保其符合物理定律和几何约束。在 1,449 个物理问题基准测试中,PhyDrawGen 的表现优于 GPT-5-image 和 Gemini 等现有模型。

  16. TOOL · CL_62342 ·

    NVIDIA 的 PiD 放大器显示出潜力但难以处理文本

    对 NVIDIA 新的潜在空间放大器模型 PiD(Pixel Diffusion Decoder)和流行的 SeedVR2 模型进行的比较显示结果好坏参半。PiD 由于其上下文理解能力,在渲染人脸方面表现出色,伪影和噪点更少,但在准确放大文本方面却遇到困难。虽然 PiD 比 SeedVR2 慢,但它被认为是一项重大进展,在处理电影颗粒感等艺术效果方面优于其竞争对手。

  17. SIGNIFICANT · CL_62104 ·

    商汤科技8B模型重新定义开源图像生成

    商汤科技发布了SenseNova U1,一个拥有80亿参数的开源模型,通过移除VAE组件重新定义了图像生成能力。这种名为NEO-unify的新架构实现了语言和视觉的端到端直接建模,在像素级别进行处理,消除了压缩带来的信息损失。该模型在各种基准测试中表现出最先进的性能,在同类模型中超越了一些闭源模型,并根据Apache 2.0许可协议可用于商业用途。

  18. TOOL · CL_58882 ·

    视觉虫洞为异构AI智能体实现潜在空间通信

    研究人员推出“视觉虫洞”(Vision Wormhole),这是一种利用视觉语言模型(VLMs)的视觉界面,实现异构多智能体系统(MAS)之间通信的新颖方法。该方法将推理轨迹映射到一个共享的连续参考空间,允许在不同模型架构之间进行潜在状态转移,而无需成对特定的翻译器。视觉虫洞利用中心辐射型拓扑结构实现可扩展性,并使用无标签蒸馏进行训练,在各种推理基准测试中展示了更低的运行时和更高的准确性。

  19. RESEARCH · CL_51137 ·

    研究发现VLMs在视觉重审测试中失败

    近期研究表明,视觉语言模型(VLMs)的视觉基础可能不如其自我反思的陈述所暗示的那样。使用图像交换技术和反事实干预的研究显示,即使在声称重新审视图像的情况下,VLMs也常常无法检测到图像中的语义变化。这种“视觉谄媚”现象因模型规模的扩大而加剧,并且通过对齐训练无法解决,这凸显了当前VLM能力的一个关键差距。

  20. RESEARCH · CL_18948 ·

    AMD 瞄准数十亿美元 AI 收入,机器人模型 RAM 首次亮相,蓝色起源修改激励措施

    来自浙江大学、香港中文大学和浙江大学的研究人员开发了一个名为 RAM 的新模型,用于机器人中的 3D 空间理解和操作。该模型通过创建一个外部 3D 知识库,解决了当前视觉语言模型的局限性,从而能够更好地理解物体姿态和进行远程任务规划。实际测试表明,该模型在语言驱动和图像引导的操作方面均取得了高成功率,并且 RAM 与各种大型模型和机器人平台兼容。