PulseAugur
实时 11:40:13
实体 PrefSQA

PrefSQA

PulseAugur coverage of PrefSQA — every cluster mentioning PrefSQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_104015 ·

    研究揭示音频大模型对评估差异敏感

    一篇新发表在arXiv上的研究论文,考察了大型音频语言模型(LALMs)在使用多项选择问答(MCQA)框架进行评估时的鲁棒性。研究人员发现,像Audio Flamingo 2、Audio Flamingo 3、Qwen2.5-Omni-7B-Instruct和Kimi-Audio-7B-Instruct等模型对问题和选项措辞的变化以及选项呈现顺序很敏感。为解决这些局限性,该研究提出了一种更鲁棒的LALMs评估协议和指标。

  2. RESEARCH · CL_93326 ·

    新研究探索超越MOS的高级语音质量评估方法

    研究人员正在探索超越传统平均意见分(MOS)的语音质量评估新方法。一篇论文介绍了PrefSQA,它使用成对偏好预测来减少评分者变异性并提高可靠性,尤其是在高质量偏好数据集上。另一项研究调查了人类听者与MOS预测模型之间的差异,发现模型虽然能追踪声学退化,但常常忽略韵律错误并表现出说话者特征的偏差。第三篇论文提出NVMOS用于评估非语言发声的质量,并证明像Gemini这样的当前多模态大型语言模型在此任务上存在困难,且不能可靠地替代人类专家判断。