PulseAugur
中
实时 08:21:33
实体 Llava

Llava

PulseAugur coverage of Llava — every cluster mentioning Llava across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
47
90 天内 47
发布 · 30天
0
90 天内 0
论文 · 30天
37
90 天内 37
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/3 页 · 共 53 条
  1. RESEARCH · CL_273465 ·

    新框架增强视觉语言模型以适应专业任务 · 跟踪2个来源

    研究人员开发了两种新颖的框架,用于将视觉语言模型(VLMs)适应专业领域。第一个是归纳视觉逻辑(IVL),它使用一种无需训练的方法,从VLMs的描述能力中构建分类知识,特别适用于分布外任务。第二个是ScaleEarth with CS-HLoRA,它通过将低秩适应条件化于图像的地面采样距离(GSD)来适应遥感VLMs,在对尺度敏感的任务上取得了改进的性能。

  2. TOOL · CL_273318 ·

    ShieldCLIP框架增强多模态模型的安全对齐

    研究人员推出ShieldCLIP,一个旨在通过选择性处理有害内容来增强多模态基础模型安全对齐的新型框架。与以往将所有生成样本都视为不安全的先前方法不同,ShieldCLIP根据单个模态的安全状态进行区分。该方法得到了ViSUv2的支持,这是一个具有按模态安全标签的新数据集。ShieldCLIP已证明在减少各种任务中的有害输出方面是有效的,包括使用Stable Diffusion v1.4和SDXL等模型的跨模态检索和文本到图像生成,同…

  3. RESEARCH · CL_280290 ·

    用于边缘和本地使用的开源多模态模型,以及关于高级UMM能力的研究

    Liquid Foundation Models 发布了一系列专为边缘计算设计的开源“d1 decision models”,其中包括在 Decision Index 0.2.1 基准测试中表现出色的 d1-3B 模型,支持文本和图像输入。这些模型针对速度进行了优化,d1-3B 在 NVIDIA 硬件上实现了低延迟。同时,研究论文正在探索统一多模态模型的高级概念,例如用于处理不可能请求的视觉弃权、量化理解与生成之间的差距、通过自适应模…

  4. TOOL · CL_257180 ·

    新的ViD框架解决了视觉语言模型中的性别偏见问题

    研究人员推出了一种新颖的框架ViD,旨在缓解大型视觉语言模型(LVLMs)中的性别偏见。与需要训练阶段调整或事后校准的先前方法不同,ViD通过分析注意力机制来动态解决视觉偏见,而无需额外的训练开销。该框架采用后门调整和精炼的token选择,以抑制源于强大语言先验的偏见,同时保持通用的推理和文本生成质量。ViD在FACET和MS COCO等基准测试中显著减少了性别偏见,尤其提升了LLaVA模型的性能。

  5. TOOL · CL_254414 ·

    统一视觉语言模型增强PSMA PET/CT分析

    研究人员开发了一种新颖的统一视觉语言模型,旨在增强前列腺癌管理中PSMA PET/CT扫描的分析。该模型将报告生成、视觉问答和病灶分割整合到一个单一架构中。与现有模型相比,它在报告生成和病灶分割任务上表现出卓越的性能,为解读这些医学影像提供了一种更全面、更具交互性的方法。

  6. TOOL · CL_254250 ·

    MLLMs 模仿人类对双稳态图像的感知

    研究人员调查了多模态大语言模型(MLLMs)在呈现双稳态图像(如经典的鸭兔图)时是否表现出类似人类的报告行为。研究使用了 LLaVA 系列模型,探讨了视觉线索和语言先验如何影响模型响应,发现这些因素会系统性地改变报告,这与人类感知一致。模型也像人类一样,主要倾向于单一解释,其内部计算涉及竞争性的图像-标记表示和不同的调制通路。

  7. TOOL · CL_227256 ·

    图像增强技术被测试为深度学习图像检索系统的生成器

    本文介绍了一种利用图像增强技术作为测试生成器来测试深度学习图像检索系统的新方法。该研究对50种增强方法进行了分类,并实证评估了它们在生成多样化测试用例方面的有效性。使用Amazon Titan和OpenCLIP模型在CIFAR-10、ImageNet-1K和March Networks数据集上进行的实验表明,天气模拟和SaSPA技术在保持真实性的同时,产生了最高的嵌入不确定性和故障率。相反,基于GAN的增强由于合成伪影而显示出较低的真实性。

  8. TOOL · CL_212130 ·

    新的 ClustRS 算法提升了 VLM 的效率和鲁棒性

    研究人员开发了 ClustRS,这是一种新颖的、无需训练的两部分算法,旨在提高视觉语言模型(VLM)的效率和鲁棒性。该方法采用注意力加权聚类方法来识别和选择代表性的视觉令牌,然后进行去噪步骤来精炼这些令牌。ClustRS 算法显著减少了所需的视觉令牌数量,使得 LLaVA 等 VLM 更适合在边缘设备上部署,并提高了它们对各种图像噪声条件的抵抗能力。

  9. TOOL · CL_203728 ·

    开发者通过顺序加载在本地运行多个AI模型

    一位开发者详细介绍了一种策略,通过采用顺序加载方法,在VRAM有限的单台本地服务器上运行多个大型AI模型。该方法涉及加载一个模型,使用它完成特定任务,然后在加载下一个模型之前将其卸载,从而避免同时出现VRAM过载。该开发者分享了他们选择和配置模型(如用于转录的Whisper,用于跨语言文档分析的BGE M3-Embedding,以及用于图像分析的Gemma)的经验,并指出了性能、准确性和资源消耗之间的权衡。

  10. COMMENTARY · CL_200645 ·

    Stable Diffusion 用户寻求图像生成一致性建议

    Reddit 的 r/StableDiffusion 版块上一位用户正在寻求关于如何在图像生成中实现特定构图控制和产品一致性的建议。他们正在比较包括 ChatGPT、Krea 2、Grok、Z Image 和 Flux.2 Klein 9B 在内的各种模型的生成结果,并指出在复制预期结果方面遇到的困难。该用户正在询问是应该使用 LoRA、更改文本编码器,还是问题主要在于提示词、条件设置或工作流程。

  11. RESEARCH · CL_194006 ·

    新方法利用多模态伪标签和测试时自适应来增强开放词汇分割

    研究人员开发了用于开放词汇实例和全景分割的新方法,旨在识别预定义类别之外的对象,而无需大量手动标注。一种方法,在 arXiv 论文中有所详述,使用 Grounded SAM 和 LLaVA 等模型生成的多模态伪标签,并通过 CLIP 引导过滤和 GPT 驱动的字幕重建进行增强。另一种方法,测试时原型自适应 (TPA),是一种无训练的即插即用模块,在输出层面运行,使用未标注的部署域图像从 DINO 特征构建类别原型,以提高分割准确性。

  12. TOOL · CL_201665 ·

    发布新的西班牙语网络安全视觉语言模型

    研究人员开发了VectraYX-Vision-1B,一个专为西班牙语和拉丁美洲网络安全图像设计的紧凑型视觉语言模型。该模型参数量小于20亿,集成了SigLIP-SO400M编码器和专用解码器,使其能够处理网络安全用户界面并以西班牙语响应。它通过原生标记和工具调用能力实现结构化视觉推理,并有可能通过llama.cpp的LLaVA格式进行隔离部署。初步测试显示在视觉基础方面存在挑战,但团队正在解决这些问题,并已发布代码、配置和模型权重,以…

  13. RESEARCH · CL_193699 ·

    新的西班牙语网络安全视觉语言模型显示出潜力,尽管存在基础问题

    研究人员开发了VectraYX-Vision-1B,一个专为西班牙语和拉丁美洲网络安全图像设计的视觉语言模型。这个参数量小于20亿的模型集成了SigLIP编码器和西班牙语安全解码器,使其能够用西班牙语回答、生成结构化推理并调用工具。尽管功能管道已建立,初步结果显示视觉基础几乎为零,模型在很大程度上忽略了图像内容。研究团队正在调查补救策略,并探索与位置编码层相关的架构问题。

  14. RESEARCH · CL_185181 ·

    新研究通过最优传输和潜在去噪探索多模态对齐

    两篇新研究论文探讨了改进大型模型中多模态对齐的方法。第一篇论文引入了联合核熵格罗莫夫-沃塞尔斯坦最优传输(JK-EGW),通过最小化二次最优传输目标来对齐不同模态的数据,在数据稀疏的情况下显示出改进的检索性能。第二篇论文为 LLaVA 等大型多模态模型(LMMs)提出了一种潜在去噪框架,通过在训练期间添加去噪目标来增强内部视觉表示和对分布变化的鲁棒性。

  15. RESEARCH · CL_179099 ·

    新框架通过视觉令牌和自我诊断增强视觉语言模型推理能力 · 跟踪3个来源

    研究人员开发了新的框架来增强视觉语言模型(VLMs)的推理能力。其中一种方法,Chain-of-Visual-Thought(COVT),使用连续的视觉令牌来捕获密集的感知信息,当集成到Qwen2.5-VL和LLaVA等模型中时,在各种基准测试上的性能提高了3-16%。另一种方法,ReGround,通过使VLMs能够自我诊断和重新检查视觉证据,解决了多步推理中视觉基础丢失的问题,在视觉密集型任务上显示出持续的收益,并且推理开销适中。此…

  16. RESEARCH · CL_165240 ·

    新方法剪枝视觉令牌以实现高效MLLM推理 · 跟踪4个来源

    研究人员开发了多种新方法来高效剪枝多模态大语言模型(MLLM)的视觉令牌,旨在降低推理成本和延迟。LAST框架利用最后一个查询令牌的注意力来指导剪枝,无需访问云端模型,即可在将令牌数量减少87.5%的同时保留94.5%的准确率。SFPruner将剪枝重新构建为单次前向传播,将Qwen2.5-VL的令牌选择时间从112.4毫秒显著缩短至2.5毫秒。SPARE是另一种方法,将剪枝视为子空间重建,通过最小化重建误差并纳入“反相关性”标准,在…

  17. TOOL · CL_162795 ·

    新框架提升 LVLM 对抗攻击的鲁棒性

    研究人员开发了一个双对抗微调框架,以提高 LLaVA 和 GPT-4V 等大型视觉语言模型 (LVLM) 在对抗攻击下的鲁棒性。与以往仅限于单任务场景的方法不同,这种新方法通过联合优化视觉和语义监督信号,增强了跨多个任务的泛化能力。实验表明,该框架在分类、图像字幕和视觉问答等任务的对抗鲁棒性方面优于现有的最先进方法。

  18. TOOL · CL_150103 ·

    用户寻求训练自定义Minecraft皮肤生成器的最佳实践

    一位用户正在寻求关于训练自定义文本到图像和图像到图像模型以生成Minecraft皮肤的最佳实践的指导。他们已经整理了一个包含约7000个皮肤的数据集,并正在探索各种模型架构和训练技术,包括微调Stable Diffusion以及考虑BLIP/LLaVA等替代方案。用户在数据标记准确性和模型输出质量方面遇到问题,并正在寻求关于数据集格式、模型选择和有效训练策略的建议,以改进纹理生成。

  19. RESEARCH · CL_131401 ·

    VLM增强交通标志评估,性能优于人工方法

    研究人员开发了一个新的框架,利用三个微调的视觉语言模型(VLM)来全面评估交通标志的状况。该系统整合了白天的视觉性能(评估清晰度、颜色、表面完整性和周围环境)和夜间的逆反射性能测量。该框架使用情感分析和CLIP评分将VLM的预测转换为数值分数,最终创建一个标志状况指数(SCI)用于维护指导。评估显示,LLaVA和Qwen模型的表现优于InternVL,相似性得分在0.67-0.76之间,并且该系统标记了462个标志中的68个需要立即更换。

  20. COMMENTARY · CL_126618 ·

    LocalLLaMA社区寻求2026年7月最佳开源视觉语言模型

    Reddit上的r/LocalLLaMA版块正在就截至2026年7月最佳本地可运行的视觉语言模型(VLMs)征求社区意见。鼓励参与者分享他们偏好的模型,并详细说明其硬件设置、使用应用以及任何特定的工具或提示。该讨论强调了由于基准测试不可靠和工具不成熟,在评估VLMs方面存在的挑战,并严格限制贡献仅限于开源模型。