Gemma 3n
PulseAugur coverage of Gemma 3n — every cluster mentioning Gemma 3n across labs, papers, and developer communities, ranked by signal.
-
PhaseCoder 使大语言模型能够理解空间音频,不受麦克风设置的限制
研究人员开发了 PhaseCoder,这是一种新颖的基于 Transformer 的编码器,旨在处理原始多通道音频和麦克风坐标,使多模态大语言模型能够理解空间音频信息。与之前的模型不同,PhaseCoder 对麦克风几何形状不敏感,可以在各种设备上部署。当使用 Gemma 3n 大语言模型进行微调时,PhaseCoder 会生成“空间音频令牌”,使大语言模型能够执行复杂اً的空间推理和定向转录任务。
-
Google 的 Eloquent 听写应用因频繁转录错误而无法通过基准测试
一位用户在尝试对 Google 的新设备端听写应用 Eloquent 进行基准测试时,发现由于频繁的音频转录失败,该应用基本无法使用。尽管该应用在正常运行时准确率具有竞争力,但它经常返回不完整或根本没有转录内容,这让用户怀疑它表现得像一个聊天式 AI,有时会回应音频内容而不是转录它。用户还测试了 Google 的开源模型 Gemma 3n,该模型也出现了类似问题,这表明 Eloquent 可能隐藏了这些问题。
-
Gemma 3n 在开源生态系统中全面可用!
Google DeepMind 已全面发布 Gemma 3n,这是一款专为设备端应用设计的移动优先多模态模型。这种新架构支持图像、音频、视频和文本输入,以及文本输出,并针对效率进行了优化,提供有效参数为 2B 和 4B 的版本,模仿了传统 2B 和 4B 模型的内存占用。Gemma 3n 引入了 MatFormer 等新组件以提高灵活性,以及 Per Layer Embeddings 以提高内存效率,在多语言、数学、编码和推理方面取得…