Porphyra umbilicalis
PulseAugur coverage of Porphyra umbilicalis — every cluster mentioning Porphyra umbilicalis across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
PFAdapter 框架增强了多模态大语言模型的个性化联邦学习 · 跟踪 2 个来源
研究人员推出 PFAdapter,一个旨在增强多模态大语言模型 (MLLMs) 个性化联邦学习的新框架。该方法将 LoRA (低秩适配) 参数进行分层分解,将其分离为用于通用多模态语义的全局共享组件和用于边缘特定适配的本地私有组件。通过采用正交正则化和选择性聚合,PFAdapter 在各种数据集和任务上显著降低了近 50% 的通信成本,同时将准确率提高了 2.4% 至 4.8%。
-
新研究解决 LVLM 幻觉问题并改进视觉-语言学习
研究人员正在开发新方法来提高大型视觉-语言模型 (LVLM) 的鲁棒性和能力。一种名为 SeeMe 的方法侧重于通过工程化视觉标记来抑制不相关信息同时保留关键证据,从而减轻幻觉。另一个框架 Text as Partial Constraint (TPC) 旨在通过将多视图字幕视为不完整监督并提炼共识语义核心来创建更可靠的表示。此外,还在探索像 HiMe 这样的新架构,用于长视域的视觉-语言-动作控制,将具身智能解耦为分层组件,以实现更…
-
新框架修剪因果图以提升医学VQA模型泛化能力
研究人员开发了一个名为“可学习因果修剪”(LCT)的新框架,以提高医学视觉问答(MedVQA)模型的泛化能力。该方法将因果修剪直接集成到端到端优化过程中。LCT利用动态解剖特征库(DAFB)来捕获常见模式,并使用可微分修剪模块来抑制与这些全局原型相关的特征,从而鼓励模型专注于实例特定的证据。在多个医学VQA数据集上的实验表明,与现有的去偏方法相比,LCT提高了鲁棒性和泛化能力。
-
前沿VLM因定位不佳和混淆在医疗VQA测试中失败
一篇新论文评估了五种领先的视觉-语言模型(VLM)在可信医疗视觉问答(VQA)方面的表现。研究发现,这些模型在准确识别解剖目标方面的能力存在显著局限性,并且存在左右混淆的倾向,表现最好的模型平均IoU仅为0.23。将定位整合到流程中会进一步降低性能,凸显了定位是关键瓶颈。虽然领域适应在提高VQA准确性方面显示出希望,但感知和可信度问题仍然存在。