ViT-L-14
PulseAugur coverage of ViT-L-14 — every cluster mentioning ViT-L-14 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新系统PeakPatch可恢复CLIP模型中的否定信号
研究人员开发了PeakPatch,一个新颖的事后系统,旨在解决像CLIP这样的对比视觉-语言模型中的否定盲点。该系统通过在冻结的CLIP文本编码器的组合峰值处拦截中间特征来工作。一个嵌入校正网络(ECN)提取否定特定信号并预测偏差向量,将丢失的语法重新注入最终的嵌入中,而一个互补的得分校正网络(SCN)则调整判别任务的标量偏移。PeakPatch添加的参数极少,并在否定基准测试中展示了显著的改进,在不改变原始模型权重的情况下,其性能优于现有方法。
-
新的CT-Merging算法可高效合并LoRA适配器以实现多任务模型
研究人员推出了一种新颖的CT-Merging算法,旨在将多个LoRA适配器高效地合并成一个多任务适配器。该方法解决了为众多下游任务存储和选择单个适配器的挑战。CT-Merging通过平均任务子空间投影仪估计共识方向,并分配任务级RMS系数尺度,改进了现有的模型合并技术。在使用DC-Merge CLIP适配器的基准测试中,CT-Merging表现出卓越的性能,优于最先进的方法,并特别提升了ViT-B/32和ViT-L/14检查点的结果。
-
新的基准和数据集推动音频、图像和视频的深度伪造检测
研究人员推出了几个新的数据集和基准,旨在改进跨各种媒体的深度伪造检测。Echoes 专注于音乐深度伪造,强调语义对齐和提供商多样性,以创建更强大的检测模型。VendorBench-100 提供了一个统一的框架,用于评估商业 API、视觉语言模型和开源检测器中的深度伪造图像检测,突出了性能差异和指标分歧。HumanForge 采用以人为中心的方法来检测深度伪造视频,使用多代理管道进行注释,并专注于人与物体以及人与人之间的交互。此外,…
-
行车记录仪AI系统每月零成本实现市政代码执法自动化
一位开发者创建了一个经济高效的系统,该系统利用行车记录仪和AI来自动化市政代码执法。该系统处理行车记录仪的录像,以识别13种类型的住房代码违规行为,利用GPS数据将其地理定位到特定房产,并将调查结果整合到市政CRM中。这种方法大大减少了房产检查所需的人工和时间,运行在预算Linux服务器上,没有重复的月度成本。