PulseAugur
中
实时 19:19:18
实体 Fun-Audio-Chat

Fun-Audio-Chat

PulseAugur coverage of Fun-Audio-Chat — every cluster mentioning Fun-Audio-Chat across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_235378 ·

    新基准评估语音代理中的隐式指令遵循

    引入了一个新的基准 DuplexSpeechBench-IFEval (DSB-IFEval),用于评估全双工语音代理根据角色或个性隐式遵循指令的能力,而不是显式命令。该基准包含八个助手角色和五个条件协议的 1,038 个测试用例。结果表明,虽然 F-Actor 和 PersonaPlex 等模型对基于个性的指令敏感,但 GPT-Realtime 和 MiniCPM-o 等模型在个性内容方面表现出色,但在适应地板行为方面却遇到困难。一…

  2. TOOL · CL_65797 ·

    新的LaSR模型通过潜在推理改进语音识别

    研究人员推出了一种新的语音大语言模型训练范式LaSR,它增强了上下文感知能力。LaSR利用潜在推理来更好地理解说话者的意图和主题上下文,围绕声学特征进行思维链监督。这种方法旨在提高专业词汇的识别能力,同时不增加延迟,正如在新的Spoken Darwin-Science语料库上的初步实验所示。

  3. TOOL · CL_50892 ·

    Raon-Speech 发布 90 亿参数模型,用于语音理解与生成

    研究人员推出了 Raon-Speech,一个拥有 90 亿参数的语音语言模型,能够理解、回答和生成英语和韩语的语音。该模型在超过 138 万小时的精选语音和文本数据上进行训练,在以语音为中心的任务上表现优于同等规模的音频基础模型,同时保持了强大的文本问答能力。一个名为 Raon-SpeechChat 的扩展通过额外的对话数据训练,进一步增强了实时全双工对话能力,在轮次转换和中断敏感性方面表现出色。