研究人员开发了 PhaseCoder,这是一种新颖的基于 Transformer 的编码器,旨在处理原始多通道音频和麦克风坐标,使多模态大语言模型能够理解空间音频信息。与之前的模型不同,PhaseCoder 对麦克风几何形状不敏感,可以在各种设备上部署。当使用 Gemma 3n 大语言模型进行微调时,PhaseCoder 会生成“空间音频令牌”,使大语言模型能够执行复杂اً的空间推理和定向转录任务。 AI
影响 这项开发可以通过使具身人工智能系统处理和推理各种设备上的空间音频,从而显著增强它们的功能。
排序理由 该集群包含一篇详细介绍新模型及其功能的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →