PulseAugur
实时 07:49:06
English(EN) M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

发布新的对话模型基准测试 M3-DuplexBench 和 Hy-MultiTurn

发布了两个新的基准测试 M3-DuplexBenchHy-MultiTurn,用于评估多轮对话模型的能力。M3-DuplexBench 专注于全双工语音对话系统,支持英语和日语,涵盖多个领域和对话场景。Hy-MultiTurn 专为中文对话理解设计,在约束记忆和指代消解等六个特定维度上评估模型在长对话中的表现。 AI

影响 这些基准测试将推动多轮对话系统的改进,促使模型更好地处理复杂的对话和多样的语言。

排序理由 两篇介绍用于评估对话模型的新型基准测试的学术论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

发布新的对话模型基准测试 M3-DuplexBench 和 Hy-MultiTurn

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Ryo Fukuda, Atsushi Ando, Hiroki Kanagawa, Takatomo Kano, Marc Delcroix, Naohiro Tawara, Yuya Chiba ·

    M3-DuplexBench:面向全双工语音对话模型的多轮、多语言、多领域基准测试

    arXiv:2607.29125v1 Announce Type: new Abstract: Full-duplex spoken dialogue systems (FDSDSs) can listen while speaking, enabling natural behaviors such as smooth turn-taking, backchannel handling, and user barge-in handling. However, fair comparisons in multi-turn conversations r…

  2. arXiv cs.CL TIER_1 English(EN) · Eileen Ye, Jiawen Tao, Yaoming Li, Chenxu Liu, Wenhan Yu, Yaxin Fan, Xiaokun Yuan, Mengzhou Wu, Yanbing Jiang, Maxm Pan ·

    Hy-MultiTurn:一个用于深度多轮对话理解的六维基准

    arXiv:2607.29196v1 Announce Type: new Abstract: Long-running multi-turn interactions with chatbots and agents are now common, and a correct response often depends on remembering earlier details, tracking later revisions, identifying intended objects or referents, and withholding …