研究人员开发了一种名为 stride-k subsampling 的新方法,可以在无需额外训练的情况下减少 OpenAI 的 Whisper 模型处理的音频令牌数量。该技术涉及选择每 k 个令牌,并且发现 stride-2 配置可将音频令牌减少 75%,GFLOPs 减少 50% 以上,同时对大多数 ASR 基准测试的词错误率 (WER) 影响最小。该方法还显示出对基于 Whisper 的 SpeechLMs 的好处,将延迟最多减少 27.4%,而准确性仅略有下降。 AI
影响 降低音频处理模型的计算要求,可能降低推理成本和延迟。
排序理由 关于现有模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →