Umberto Cappellazzo
PulseAugur coverage of Umberto Cappellazzo — every cluster mentioning Umberto Cappellazzo across labs, papers, and developer communities, ranked by signal.
-
NAPE framework advances audio representation learning via next patch embedding prediction
Researchers have introduced NAPE (Next-Audio-Patch-Embedding prediction), a novel self-supervised learning framework for audio. This method utilizes causal Transformers to predict successive patch embeddings of a log-me…
-
New VIB-AVSR method enhances LLM-based speech recognition in noisy conditions
Researchers have introduced VIB-AVSR, a novel approach to enhance audio-visual speech recognition models. This method integrates Variational Information Bottleneck layers into the LLM backbone to improve robustness agai…
-
New framework decodes modality contributions in audio-visual speech recognition
Researchers have developed Dr. SHAP-AV, a framework utilizing Shapley values to analyze how audio-visual speech recognition models balance acoustic and visual information. Experiments across six models and varying noise…