Q-Former
PulseAugur coverage of Q-Former — every cluster mentioning Q-Former across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究人员推出新的步态检索任务和数据集
研究人员推出了组合步态检索(Composed Gait Retrieval, CoGR),这是一项专注于根据参考序列和自然语言修改查询来检索步态序列的新任务。为了支持这项任务,他们开发了两个新的步态-语言数据集:Language-Augmented CCPG 和 Language-Augmented CASIA-B,并使用大型视觉语言模型进行标注。他们还提出了 ComposeGait,一个旨在通过使用部件感知身份适配器将身份证据聚合到…
-
新研究增强了AI在临床上忠实的医学图像字幕生成能力 · 跟踪2个来源
两篇新研究论文探讨了医学图像字幕生成方面的进展,重点是提高临床忠实度和准确性。第一篇论文引入了一个框架,通过分离训练和推理阶段来增强视觉和文本数据之间的对齐,并利用了BioMedCLIP、SigLIP2和LLaMA等模型。第二篇论文提出了一种用于训练后优化的结构化奖励系统,整合了生物医学语义和临床图一致性,以提高生成字幕的事实性和相关性。
-
新的脑电图基础模型EEG-PRIME改进了跨数据集解码
研究人员开发了EEG-PRIME,这是一种新颖的两阶段基础模型,旨在改进不同数据集和受试者之间的脑电图(EEG)解码。该模型结合了掩码预训练和原型对齐指令调优,以实现更好的泛化能力,即使在零样本迁移场景下也是如此。在十六个多样化的EEG数据集上进行的实验表明,EEG-PRIME优于现有的最先进方法,在无需目标域优化的情况下,其性能与需要会话内校准的模型相当。
-
新框架学习隐式音乐风格以进行符号生成
研究人员开发了一个新颖的跨模态框架,用于学习和应用隐式音乐风格来进行符号音乐生成。该模型受BLIP-2启发,利用查询Transformer(Q-Former)从音频语言模型中提取风格表示,然后对符号语言模型进行钢琴编曲的条件设置。通过联合基于乐谱(内容)和参考音频示例(风格)进行条件设置,该方法能够实现可控且风格忠实的生成。实验表明,在钢琴翻唱生成、风格迁移和音频到MIDI检索等任务中,风格感知对齐和音乐质量均有显著提升。
-
新型大语言模型生成可解释的自动驾驶行为描述
研究人员开发了CommandLM,这是一种新颖的多模态大语言模型,旨在从融合的传感器数据生成人类可读的自动驾驶车辆行为描述。该模型通过Q-Former适配器和量化、LoRA微调的大语言模型集成了LiDAR和多摄像头输入。它在CommandLM-nuScenes数据集上进行训练,旨在通过提供可解释的、意图感知的字幕来增强自动驾驶系统的安全性、信任度和法规遵从性。
-
新的MEUSLI投影仪支持多语言ASR和语音理解
研究人员开发了MEUSLI,这是一种新颖的多语言投影仪,旨在将语音编码器与大型语言模型(LLMs)连接起来,以进行高级语音处理任务。该系统通过支持28种欧洲语言的端到端自动语音识别(ASR)来扩展现有的单语投影仪,并且可以进一步适配其他语言。MEUSLI还展示了超越ASR的能力,能够以最小的任务特定监督来促进多语言语音翻译和主题识别。
-
新的CAPTAIN方法利用语言模型进行APT检测,数据整理需求更少
研究人员开发了CAPTAIN,一种用于大规模日志中检测高级持续性威胁(APT)的新方法。与需要大量数据整理和预处理的先前方法不同,CAPTAIN利用预训练语言模型,只需极少、与领域无关的步骤。它编码最近的日志历史并将此上下文注入语言模型以计算困惑度,从而指示潜在威胁。此方法旨在降低APT检测相关的开发和运营成本。
-
研究发现 Video-LLM 在时间信息流方面存在困难
研究人员发现,视频大型语言模型(Video-LLMs)在处理时间信息方面存在一个重大的瓶颈,这阻碍了它们理解视频播放方向的能力。虽然以视频为中心的编码器可以有效地捕捉时间信号,但标准的 Video-LLM 架构通常无法可靠地传递这些信息。研究强调,投影层是一个关键组成部分,某些设计会破坏时间数据,而保留时间的 MLP 投影可以改善信息流。通过优化编码器、投影器并纳入特定的监督,一个新的 Video-LLM 在时间推理任务上达到了接近人类的准确率。
-
CSMCIR框架通过对称对齐增强组合图像检索
研究人员推出了一种新颖的CSMCIR框架,旨在通过解决现有方法中表示空间的碎片化问题来改进组合图像检索(CIR)。该方法利用多级思维链(CoT)提示策略为目标图像生成语义兼容的字幕,从而建立模态对称性。此外,CSMCIR采用对称双塔架构,并使用共享参数的Q-Former进行一致的跨模态编码,以及一个基于熵的记忆库来提供高质量的负样本。
-
ViBE框架将视觉刺激映射到M/EEG脑信号
研究人员开发了ViBE,一种新的大脑编码框架,可将视觉刺激转化为脑磁图(MEG)和脑电图(EEG)信号。该系统利用时空卷积变分自编码器(TSC-VAE)来重建神经反应,并利用Q-Former将视觉特征与神经表征对齐。在THINGS-EEG2和THINGS-MEG数据集上的实验表明,ViBE能够生成高质量的M/EEG信号,有望助力视觉假体的发展。