Qwen3-VL-Embedding
PulseAugur coverage of Qwen3-VL-Embedding — every cluster mentioning Qwen3-VL-Embedding across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的TraVEL框架通过运动感知嵌入增强驾驶视频检索
研究人员开发了TraVEL,一个用于学习专门针对驾驶视频检索的视频嵌入的新框架。该方法使用配对剪辑和推理轨迹的监督微调,然后进行运动感知微调,来微调一个通用多模态嵌入模型Qwen3-VL-Embedding。TraVEL在策略优化框架内使用自我轨迹相似性作为奖励信号,以增强对运动中心事件的理解,在一个新的驾驶视频检索基准上显著优于标准微调。
-
新的Stresa框架增强了用于推荐的多模态嵌入模型
研究人员推出了一种名为Stresa的新型框架,旨在增强大规模预训练多模态嵌入模型在序列推荐任务中的性能。Stresa通过引入流感知隐藏适配器融合(SHAF)来保持融合过程中的历史记忆,并使用残差流适配器(ReSA)在层间进行选择性更新,从而解决了这些模型的适配挑战。实证评估表明,Stresa在公共数据集上的表现优于现有的侧面适配器和最先进的基线模型,展示了其在适配大规模嵌入模型以用于推荐系统方面的有效性。
-
PixelRAG 使用网页截图而非文本来改进 LLM 检索
一篇新研究论文介绍 PixelRAG,这是一种新颖的检索增强生成 (RAG) 方法,它使用网页截图而非文本来增强大型语言模型。该方法通过直接在像素空间操作,以视觉方式表示网站,从而绕过了传统的文本解析。PixelRAG 已扩展到一个包含 3000 万张图像的语料库,并在文本中心问答和多模态 QA 等各种任务上展示了优于基于文本的 RAG 基线的性能。该方法还通过图像压缩提高了效率,可能降低了 token 成本。