PulseAugur
实时 10:15:02
实体 Speech Large Language Models

Speech Large Language Models

PulseAugur coverage of Speech Large Language Models — every cluster mentioning Speech Large Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_193340 ·

    VoxZip框架将音频大模型键值缓存需求降低20倍

    研究人员开发了VoxZip,一个新颖的两阶段框架,旨在压缩语音大模型中长上下文音频推理的键值缓存。该方法使用自动语音识别(ASR)转录作为语义锚点来对齐和压缩音频令牌,然后采用动态过滤策略移除非必需令牌。在Qwen3-Omni上的评估表明,VoxZip可以在长上下文场景下实现20倍的键值缓存压缩,同时保持超过90%的未压缩基线性能;在4倍压缩下,它可将推理吞吐量提高1.9倍,并将内存开销降低3.3倍。

  2. TOOL · CL_48873 ·

    新的煤气灯攻击揭示语音大语言模型准确率下降24%

    研究人员开发了一种新的方法来测试基于语音的大语言模型(LLMs)对操纵性提示的脆弱性,称为“煤气灯攻击”。这些攻击采用五种策略——愤怒、认知颠覆、讽刺、隐含和专业否定——来评估LLMs如何响应误导性或压倒性的输入。在五个不同的语音和多模态LLMs上,这些攻击导致平均准确率下降24.3%,凸显了当前语音AI系统显著的行为脆弱性,并强调了对更强大、更值得信赖的技术的需求。