Contrastive Language-Audio Pretraining
PulseAugur coverage of Contrastive Language-Audio Pretraining — every cluster mentioning Contrastive Language-Audio Pretraining across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI模型针对自闭症听觉过敏研究进行微调
一项博士研究项目正在探索针对非典型听力人群的音频情感识别,特别是关注自闭症患者的听觉过敏。该方法通过在具有神经典型听众情感反应的数据集上使用低秩适配(LoRA)对对比语言-音频预训练(CLAP)模型进行微调。此方法旨在从有限的标注数据中泛化情感反应,以应对评估个体过敏性的挑战。
-
AI项目使用音频对汽车故障进行分类
一个名为“使用对比语言-音频预训练分类机械故障”的项目已在Hacker News上分享。该项目旨在利用音频数据和预训练语言模型来诊断汽车问题。
-
新的RLHF框架使音频字幕与人类偏好保持一致
研究人员开发了一个新的音频字幕框架,该框架利用人类反馈强化学习(RLHF)来更好地使生成的字幕与人类偏好保持一致。该方法采用在成对偏好数据上训练的奖励模型,允许其在不需要昂贵的真实标注的情况下微调现有的字幕系统。人类评估表明,与传统的监督方法相比,该方法生成的字幕更受青睐,尤其是在基线模型表现不佳的情况下,并且取得了与监督方法相当的性能。
-
新型Omni-Embed-Audio模型利用LLM增强音频-文本检索
研究人员开发了Omni-Embed-Audio (OEA),一种新的面向检索的编码器,它利用多模态大型语言模型来改进音频-文本检索。与依赖字幕式查询的先前系统不同,OEA旨在处理更自然的搜索行为,包括问题、命令和否定查询。实验表明,OEA在文本到音频检索方面的性能与现有的最先进模型相当,而在文本到文本检索和区分听起来相似的音频片段的能力方面,其性能显著优于它们。