研究人员推出了EmoSBench,一个旨在评估口语语言模型(SLMs)情商的新基准。该基准基于情商的四分支理论模型,包含十个子任务。初步测试表明,即使是像GPT-4o-Audio这样的先进模型,其表现也远低于人类基线,准确率仅为52.6%。为解决此问题,开发了一个名为EmoS的新评估模型,该模型利用监督微调和一种整合准确性和推理保真度的新颖奖励机制,达到了83.8%的准确率,并在现实场景中展现出强大的泛化能力。 AI
影响 为评估和改进口语人工智能系统的情商树立了新标准。
排序理由 该集群包含一篇学术论文,介绍了一个用于评估和改进AI模型的新基准和评估框架。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →