Researchers have developed a new framework called the Cross-modal Perception Alignment Adapter (CMPA) to improve No-Reference Image Quality Assessment (NR-IQA) by addressing limitations in current Large Vision-Language Models like CLIP. CMPA utilizes a Perception-Sensitive Feature Extractor (PFE) to isolate perceptual distortions from semantic information and a Cross-Modal Perception Alignment Injector (PAI) to align these features with quality-aware text. Additionally, a Residual-enhanced Perceptual Downscaling strategy compensates for information loss during downscaling using Just Noticeable Difference (JND) guided frequency re-injection. Evaluations show CMPA significantly outperforms existing methods in recovering perceptual signals. AI
IMPACT This framework could lead to more accurate and reliable image quality assessment tools, impacting fields that rely on visual data integrity.
RANK_REASON The cluster contains a research paper detailing a new technical framework for image quality assessment. [lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Cross-modal Perception Alignment Adapter (CMPA)
- Cross-Modal Perception Alignment Injector (PAI)
- Hugging Face
- Just Noticeable Difference (JND)
- Perception-Sensitive Feature Extractor (PFE)
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →