PulseAugur
实时 13:10:15
实体 Speech-language models

Speech-language models

PulseAugur coverage of Speech-language models — every cluster mentioning Speech-language models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 6
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_141548 ·

    语音语言模型未能像人类一样理解声音象征

    一篇新的研究论文探讨了语音语言模型(SLMs)是否能理解声音象征,即人类将语音与尖锐或圆润等感知品质联系起来的能力。研究发现,包括开放权重模型在内的当前SLMs,无法准确复制基于实际语音录音的人类判断。模型未能识别驱动人类直觉的声学线索,如频谱倾斜,这表明需要改进语音表示以实现更好的感知对齐。

  2. TOOL · CL_123075 ·

    新的vLLM流水线统一音频生成与理解

    研究人员开发了一种利用vLLM统一音频理解和生成任务的新型推理流水线。该系统解决了高吞吐量多模态生成所面临的挑战,特别是对于采用复杂解码策略(如AR+NAR或多令牌预测)的语音语言模型。该流水线集成了片上声学解码器,用于端到端波形合成,并通过联合调度条件和无条件请求来优化无分类器引导,从而将吞吐量维持在非CFG吞吐量的约80%。

  3. RESEARCH · CL_109509 ·

    新的SpeechEQ基准测试评估语音模型中的AI情商

    研究人员推出SpeechEQ,一个旨在评估语音语言模型(SLM)情商的新框架。该框架包含一个包含2,265个对话的数据集和一个多轮评估协议,用于衡量口语情商(SEQ),其灵感来源于人类情商评估。使用SpeechEQ进行的实验揭示,当前的模态多样的模型在语用线索方面存在困难,表现出模态捷径、安全陷阱和上下文遗忘等问题,表明在实现真正具有情感意识的AI方面存在重大障碍。

  4. TOOL · CL_104745 ·

    研究发现:语音语言模型会隐式转录口语

    一篇新发表在arXiv上的研究论文探讨了交织式语音语言模型(SLMs)的内部工作机制。研究表明,即使这些模型没有经过显式的语音识别训练,也会经历一个隐式的转录阶段。在此阶段,中间层可以解码口语的文本表示,转录文本在相当一部分数据中作为首选候选。随后,模型在文本域中预测下一个词,之后可能返回到语音域,这揭示了SLMs内部语音和文本模态的交互方式,并可能指导未来的优化。

  5. TOOL · CL_84928 ·

    语音语言模型易受后门攻击

    研究人员分析了后门攻击如何在语音语言模型中传播。语音语言模型是包含多个相互连接组件的复杂系统。研究结果表明,后门可以传播到整个流程,使所有任务都面临风险。研究揭示了后门的存在或移除很大程度上取决于模型中被攻击的具体组件。此外,该研究挑战了在共享多任务嵌入中,中毒样本可以轻松与良性样本分离的假设,表明当前的过滤防御可能不足。

  6. RESEARCH · CL_82100 ·

    ParaBridge 方法改进了语音模型的副语言理解能力

    研究人员开发了 ParaBridge,一种新颖的 on-policy 自蒸馏方法,旨在提高语音语言模型将副语言线索纳入对话的能力。该技术训练模型更好地利用非词汇信息,如语气或背景噪音,以生成更恰当的响应。ParaBridge 在 VoxSafeBench 和 EchoMind 等基准测试中显著提高了性能,同时保持了通用的语言能力。