lpips
PulseAugur coverage of lpips — every cluster mentioning lpips across labs, papers, and developer communities, ranked by signal.
- used by Structural Similarity Index Measure 70%
- instance of peak signal-to-noise ratio 70%
- instance of Structural Similarity Index Measure 70%
- competes with Structural Similarity Index Measure 60%
- uses Structural Similarity Index Measure 60%
- used by peak signal-to-noise ratio 60%
- used by Gotit.pub 60%
5 天有情绪数据
-
新的SRIM方法增强了图像抵御恶意编辑的能力
研究人员开发了一种名为SRIM的新方法来保护图像免受恶意编辑,尤其是在图像被缩放时。现有方法针对特定分辨率进行了优化,但SRIM通过采样锚点尺度的网格来考虑未知的缩小因子。这种方法显著增加了像FLUX.2-klein、FLUX.2-dev和9B模型等模型所进行的编辑的干扰性,在高清照片上提供大致两倍的同等可见性保护。
-
新型视频编解码器利用事件流提高RGB压缩效率
研究人员开发了一种事件引导的神经视频编解码器(ENVC),它利用事件流(捕捉帧间亮度变化)来提高RGB视频压缩的效率。ENVC模型将这些事件流整合到运动编码和帧编码过程中。对于运动编码,它形成一个事件引导的运动先验并编码残差;对于帧编码,一个事件条件预测器改进了时间上下文。在六个基准上的评估显示,BD率显著节省,ENVC使用PSNR-RGB比DCMVC基线高39.13%,使用LPIPS比DCMVC基线高67.63%,证明了事件作为互补…
-
新的雅可比矩阵透镜距离指标超越现有图像感知评估方法
研究人员推出了一种新颖的图像感知差异评估指标——雅可比矩阵透镜距离(JLD)。与依赖人类判断且对分辨率变化敏感的先前方法不同,JLD 从冻结的视觉编码器中提取其感知几何。这种方法允许使用固定的度量张量,在无标签图像上快速拟合,并提供清晰的几何解释。JLD 在多个感知数据库上展示了最先进的性能,超越了 LPIPS 和 DISTS 等现有指标,并显示出对分辨率变化的鲁棒性。该方法还能有效地扩展到视频质量评估。
-
新研究通过提高效率、保真度和应用性来推进3D高斯溅射技术 · 已追踪10个来源
多篇研究论文介绍了增强3D高斯溅射(3DGS)能力的新技术和框架。EffGS专注于提高复杂场景的效率和保真度,而ClearGS通过整合可靠性感知视图分配和视频内恢复来解决手持视频数据中的挑战。其他进展包括用于压缩GS参数域质量评估的GS-PQM,用于分离光照与几何的EvenSplat,以及用于对象级网格提取的MEGA。此外,FrontierGS和UGOD分别通过逐步扩展视点和使用不确定性引导的不透明度来解决稀疏视图监督问题。Stere…
-
新研究评估作物表型分析的网格重建方法
一篇新论文评估了七种网格重建流程在作物表型分析中的有效性,这一过程对于提高农业产量至关重要。研究发现,GGGS、PGSR和2DGS流程在定量和定性上都产生了最有利的结果。具体而言,在用户评分、Chamfer距离、LPIPS、PSNR和SSIM这五个关键指标上,GGGS流程的性能比第二好的流程2DGS高出约27%。
-
AI利用迁移学习生成合成麻风病图像
研究人员开发了一种新颖的方法,通过利用从慢性伤口数据集中迁移学习来生成合成麻风病图像。该方法解决了麻风病图像标注稀缺的问题,而这种稀缺性限制了传统机器学习模型的有效性。该流程包括一个用于提取病灶掩码的分割网络,一个从Stable Diffusion 1.5改编的掩码条件潜扩散模型,以及在较少量的麻风病图像上进行微调。生成的图像展示了与真实麻风病图像相当的多样性,并且在感知上接近真实分布,表明慢性伤口数据在合成麻风病病灶方面具有可行性。
-
新的FRPSS方法通过结构完整性改进单图像生成
一篇新论文介绍了FRPSS,一种旨在提高结构完整性和局部多样性的单图像生成方法。FRPSS利用具有测地线表面特征增强的流形结构重排(MSR-FAGS)模块来指导图像生成,减少了现有方法中常见的错位问题。该方法还结合了尺度自适应滑动窗口块提取(SSPE)策略和对比语言-图像预训练监督模块(CLIP-SSPE),以增强风格化等下游任务。
-
PixelIR框架将图像保真度和感知度解耦,用于超分辨率
研究人员推出了一种新颖的图像超分辨率框架PixelIR,该框架将保真度和感知质量解耦。与之前同时优化这两个目标的方法不同,PixelIR首先生成忠实的重建,然后合成感知上逼真的细节。该方法通过像素空间图像残差流匹配实现。该框架已被提炼成一个高效的一步学生模型,在PSNR、SSIM和LPIPS指标上取得了最先进的结果,同时保持了保真度、感知度和效率的良好平衡。
-
UltraPIPS 库利用领域特定模型增强 B 模式超声图像分析
研究人员开发了 UltraPIPS,这是一个专门为 B 模式超声数据设计的新型感知图像相似性度量库。与在自然图像上训练的模型不同,UltraPIPS 利用了在超声影像上微调的基础模型,这能更好地捕捉该医学成像模态的独特特征。实验表明,UltraPIPS 度量与下游任务(如分类和重建)的性能相关性更强,并在用于损失优化时能提高图像质量和真实感。
-
新的4D-SG方法增强了稀疏视角谱CT重建
研究人员开发了一种名为共享结构4D谱高斯表示(4D-SG)的新方法,用于从有限的计算机断层扫描(CT)投影视图重建能量分辨衰减体积。该方法将空间结构学习与光谱衰减变化分离开来,从而能够从离散的光谱测量中获得连续的4D-SG表示。实验表明,4D-SG的性能优于现有的高斯基线方法,在峰值信噪比(PSNR)、结构相似性指数度量(SSIM)和LPIPS等指标上有所提高。
-
RadioVIL框架通过异常检测增强6G无线电地图以实现车辆定位
研究人员开发了RadioVIL,一个用于高精度无线电地图构建的新型两阶段框架,这对于6G集成传感与通信(ISAC)应用至关重要。与以往平滑细节的方法不同,RadioVIL使用去噪扩散概率模型(DDPM)来捕捉环境结构,并使用基于扩散的中介中间层优化(DMILO)算法来分离车辆散射异常。这种方法保留了物理纹理,并能够从稀疏的无线电地图中实现精确的零样本车辆定位,召回率达到75.20%,平均误差为3.31米。
-
新的PROVE方法使用可验证证据恢复AI图像提示
研究人员开发了PROVE,一种新颖的无训练方法,用于从文本到图像模型生成的图像中恢复文本提示。与依赖优化、字幕或强化学习的现有技术不同,PROVE通过直接从图像证据组合可验证的场景描述来重建提示。这种方法旨在通过提供基于显式视觉数据的可审计提示来解决版权和内容所有权问题。PROVE在多个数据集和生成器上,与当前基线相比,在图像相似性和文本-图像对齐方面表现出优越的性能,而无需任何训练或生成器访问。
-
小米MiLM Plus发布视频物体移除的PROVE基准
小米的MiLM Plus推出了PROVE,这是一个新的基准和指标集,旨在更有效地评估视频物体移除模型。PSNR和SSIM等传统指标在处理物体移除的固有不适定性方面存在困难,因为存在多种可能的输出。PROVE使用了两个新颖的指标:RC-S用于空间一致性,RC-T用于时间一致性,它们在深度特征空间内局部运行,并且不需要参考视频。该系统已被ACM MM 2026收录,并作为一个开源PyTorch存储库提供,旨在用于模型评估、CI门禁和数据过滤。
-
新的GVCHR方法通过分层引用增强生成式视频压缩
研究人员推出了一种新颖的生成式视频压缩方法GVCHR,该方法以分层方式组织潜在帧。该方法通过为经常被用作引用的低层帧分配更多比特,从而提高了编码效率并减少了伪影传播。GVCHR采用了分层时间上下文挖掘技术以实现有效的潜在编码,以及分层注意力适配器以在生成式重建过程中将注意力限制在相关的引用上。实验表明,GVCHR在BD率方面显著优于最先进的方法,并且在视觉质量方面也有显著提高。
-
新框架CodecArena使用视觉强化学习评估视频编解码器质量
研究人员推出CodecArena,一个新颖的视觉-语言框架,用于评估视频编解码器质量,特别是在低比特率和超低比特率场景下。与关注特征相似度的现有指标不同,CodecArena通过比较参考视频及其重建视频来评估内容保真度,考虑身份、对象、文本、纹理和时间一致性等方面。该框架使用Facet-GRPO(一种视觉强化学习方法)进行优化,并得到两个新资源的支持:用于自动化偏好数据集生成的CodecArena-1K,以及用于人类排名、域外评估的C…
-
新方法解决视频帧插值中的模糊匹配问题
研究人员开发了一个新颖的视频帧插值框架,解决了光流估计中模糊匹配的挑战。这种新方法保留了多个候选对应关系,并使用一个可靠性引导的路由器来选择最合适的对应关系来合成中间帧。在MA-HD基准和其他公共数据集上的实验表明,与现有方法相比,该方法在LPIPS和DISTS指标方面取得了更优异的结果。
-
新框架利用外观印迹从事件流中重建视频
研究人员开发了Engram-E2VID,一个用于从事件流和参考帧重建目标RGB帧的新颖框架。该方法解决了事件派生结构与参考帧外观信息关联的挑战,尤其是在复杂运动和长时时间间隔下。通过将参考帧编码为标记空间外观印迹,并利用事件流创建运动结构支架,Engram-E2VID使目标结构能够在没有直接像素对应的情况下访问参考外观。该框架在三个基准测试中展示了PSNR和LPIPS的改进,并显示出随着重建间隔的增加,性能有所增强。
-
新的扩散模型增强病理图像分辨率以改善诊断 · 跟踪到2个来源
两篇新的研究论文提出了用于增强病理图像分辨率的先进扩散模型,旨在提高诊断准确性。S$^3$-Diff 利用结构语义协同方法,结合标本感知锚定和结构引导语义调优,以保留关键的病理形态。Morph-ISR 采用形态感知隐式网络,配备自适应核生成器和形态保真先验,以维持细粒度的细胞细节和边界。这两种方法都旨在克服当前超分辨率技术可能导致临床病理学中纹理过度平滑和语义漂移的局限性。
-
新的扩散模型使用小波域条件生成卫星图像
研究人员开发了一个新颖的扩散框架,该框架利用小波域条件从地图数据生成卫星图像。该方法建立在ControlNet和Stable Diffusion骨干之上,采用了在地图和小波表示上训练的两个适配器,并通过MultiControlNet进行融合。该方法在新德尼泊尔数据集和Pix2Pix地图-卫星基准上进行了评估,在图像保真度和分布真实性相关的几个指标上优于现有方法。
-
新的WorldDynCache框架加速了扩散世界模型
研究人员开发了WorldDynCache,一个旨在加速扩散世界模型推理过程的新型框架。该系统采用风险控制的潜在动态近似来减轻重复Transformer评估的计算成本。通过引入轻量级风险估计器和面向阶段的代理模型,WorldDynCache有效地跟踪和管理近似缺陷,从而在HunyuanVoyager-13B和Aether-5B等模型上实现了显著的加速,同时在各种指标上保持了高质量的生成效果。