PulseAugur
中
实时 20:54:13
实体 Speech Large Language Models

Speech Large Language Models

PulseAugur coverage of Speech Large Language Models — every cluster mentioning Speech Large Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_247737 ·

    新的 LOGIC 框架改进了语音大模型的实体识别能力

    研究人员开发了一个名为 LOGIC(Logit-Space Integration for Contextual Biasing)的新框架,以改进语音大模型(Speech LLMs)处理新颖和领域特定实体的方式。与可能效率低下且达到上下文窗口限制的传统提示方法不同,LOGIC 直接在解码层运行。这种方法确保了恒定的时间复杂度,无论实体数量如何,从而显著降低了实体词错误率,同时没有大幅增加误报率,这一点已通过 Phi-4-MM 模型得到证明。

  2. TOOL · CL_247702 ·

    Nuha-Speech计划构建阿拉伯语语音大模型,拥有150万+问答样本

    研究人员推出了Nuha-Speech项目,旨在开发通用阿拉伯语语音大语言模型(speech-LLMs)。该计划通过创建一个包含超过150万个训练样本的大规模阿拉伯语语音问答(SQA)语料库,解决了阿拉伯语在多语言语音大模型中代表性不足的问题。该语料库被用于微调Qwen Omni模型变体,并设计了一个全面的评估框架,以在资源有限的情况下为阿拉伯语语音大模型建立基础性基础设施。

  3. TOOL · CL_193340 ·

    VoxZip框架将音频大模型键值缓存需求降低20倍

    研究人员开发了VoxZip,一个新颖的两阶段框架,旨在压缩语音大模型中长上下文音频推理的键值缓存。该方法使用自动语音识别(ASR)转录作为语义锚点来对齐和压缩音频令牌,然后采用动态过滤策略移除非必需令牌。在Qwen3-Omni上的评估表明,VoxZip可以在长上下文场景下实现20倍的键值缓存压缩,同时保持超过90%的未压缩基线性能;在4倍压缩下,它可将推理吞吐量提高1.9倍,并将内存开销降低3.3倍。

  4. TOOL · CL_48873 ·

    新的煤气灯攻击揭示语音大语言模型准确率下降24%

    研究人员开发了一种新的方法来测试基于语音的大语言模型(LLMs)对操纵性提示的脆弱性,称为“煤气灯攻击”。这些攻击采用五种策略——愤怒、认知颠覆、讽刺、隐含和专业否定——来评估LLMs如何响应误导性或压倒性的输入。在五个不同的语音和多模态LLMs上,这些攻击导致平均准确率下降24.3%,凸显了当前语音AI系统显著的行为脆弱性,并强调了对更强大、更值得信赖的技术的需求。