实体
PrefSQA
PrefSQA
PulseAugur coverage of PrefSQA — every cluster mentioning PrefSQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究揭示音频大模型对评估差异敏感
一篇新发表在arXiv上的研究论文,考察了大型音频语言模型(LALMs)在使用多项选择问答(MCQA)框架进行评估时的鲁棒性。研究人员发现,像Audio Flamingo 2、Audio Flamingo 3、Qwen2.5-Omni-7B-Instruct和Kimi-Audio-7B-Instruct等模型对问题和选项措辞的变化以及选项呈现顺序很敏感。为解决这些局限性,该研究提出了一种更鲁棒的LALMs评估协议和指标。
-
新研究探索超越MOS的高级语音质量评估方法
研究人员正在探索超越传统平均意见分(MOS)的语音质量评估新方法。一篇论文介绍了PrefSQA,它使用成对偏好预测来减少评分者变异性并提高可靠性,尤其是在高质量偏好数据集上。另一项研究调查了人类听者与MOS预测模型之间的差异,发现模型虽然能追踪声学退化,但常常忽略韵律错误并表现出说话者特征的偏差。第三篇论文提出NVMOS用于评估非语言发声的质量,并证明像Gemini这样的当前多模态大型语言模型在此任务上存在困难,且不能可靠地替代人类专家判断。