ViT-B-32
PulseAugur coverage of ViT-B-32 — every cluster mentioning ViT-B-32 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新系统PeakPatch可恢复CLIP模型中的否定信号
研究人员开发了PeakPatch,一个新颖的事后系统,旨在解决像CLIP这样的对比视觉-语言模型中的否定盲点。该系统通过在冻结的CLIP文本编码器的组合峰值处拦截中间特征来工作。一个嵌入校正网络(ECN)提取否定特定信号并预测偏差向量,将丢失的语法重新注入最终的嵌入中,而一个互补的得分校正网络(SCN)则调整判别任务的标量偏移。PeakPatch添加的参数极少,并在否定基准测试中展示了显著的改进,在不改变原始模型权重的情况下,其性能优于现有方法。
-
新的CT-Merging算法可高效合并LoRA适配器以实现多任务模型
研究人员推出了一种新颖的CT-Merging算法,旨在将多个LoRA适配器高效地合并成一个多任务适配器。该方法解决了为众多下游任务存储和选择单个适配器的挑战。CT-Merging通过平均任务子空间投影仪估计共识方向,并分配任务级RMS系数尺度,改进了现有的模型合并技术。在使用DC-Merge CLIP适配器的基准测试中,CT-Merging表现出卓越的性能,优于最先进的方法,并特别提升了ViT-B/32和ViT-L/14检查点的结果。
-
新框架支持印度尼西亚传统服装的零样本描述
研究人员开发了Custom ZeroCLIP,一个新颖的检索增强视觉-语言框架,专为印度尼西亚传统服装的零样本描述而设计。该系统结合了CLIP和BERT文本编码器以及LSTM字幕解码器,在来自24个印度尼西亚省份的数据上进行训练,并在8个未见过省份上进行评估。该框架取得了强劲的性能,CLIPScore为0.8536,BLEU-4为0.3342,METEOR为0.4859,在文化词汇恢复和整体准确性方面显示出显著的改进,特别是在低资源遗产背景下。
-
AI模型在超声检查中显示出强大的乳腺密度预测能力,泛化性良好
研究人员对三种深度学习模型——DenseNet121、ViT-B/32和ResNet50——进行了外部验证,用于从超声图像预测乳腺密度。这些模型表现出强大的性能,尤其是在极度致密的乳腺中,尽管异质性致密的乳腺仍然是一个挑战。当整合到风险预测模型中时,AI衍生的密度与乳房X线摄影报告的密度显示出可比的结果,表明其在不同人群中的泛化能力。
-
我抓取了194万张Airbnb照片,发现了“鸦片窝点”、宠物客串和杂乱厨房
研究人员利用Burla并行处理库分析了119个城市的194万张Airbnb照片和评论。他们使用CLIP进行初步图像评分,并使用Claude Haiku Vision对可疑房源进行详细验证,识别出“鸦片窝点”、宠物客串和杂乱厨房等类别。该过程还包括使用多层漏斗对评论进行评分,包括嵌入和Haiku Vision分析,以标记异常房源。