PulseAugur
实时 09:09:45
English(EN) MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff框架通过多模态集成增强热红外到可见光人脸转换

研究人员推出了一种新颖的多模态潜扩散框架MTVDiff,旨在增强热红外到可见光人脸转换。该方法通过整合深度和文本信息,解决了几何不连续和身份退化等挑战。关键技术贡献包括用于特征提取的双分支交叉注意力融合模块、用于语义引导的门控文本到视觉特征对齐机制,以及用于自适应多模态先验集成的空间特征变换。在MCXFace和SpeakingFaces数据集上的实验表明,MTVDiff在图像质量和人脸验证性能方面显著优于现有方法。 AI

影响 引入了一种新的跨光谱人脸图像转换方法,有望在不同光照条件下改进人脸识别系统。

排序理由 该集群描述了一篇发表在arXiv上的新研究论文,其中详细介绍了一个新颖的技术框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

MTVDiff框架通过多模态集成增强热红外到可见光人脸转换

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen ·

    MTVDiff:用于增强热红外到可见光人脸转换的多模态条件潜在扩散模型

    arXiv:2607.19886v1 Announce Type: new Abstract: Thermal-to-visible face translation presents fundamental challenges including geometric discontinuities, semantic attribute mismatches, and identity degradation. We propose MTVDiff, a novel multimodal latent diffusion framework that…