PulseAugur
实时 04:29:39
实体 Gemma 3n

Gemma 3n

PulseAugur coverage of Gemma 3n — every cluster mentioning Gemma 3n across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_187339 ·

    PhaseCoder 使大语言模型能够理解空间音频,不受麦克风设置的限制

    研究人员开发了 PhaseCoder,这是一种新颖的基于 Transformer 的编码器,旨在处理原始多通道音频和麦克风坐标,使多模态大语言模型能够理解空间音频信息。与之前的模型不同,PhaseCoder 对麦克风几何形状不敏感,可以在各种设备上部署。当使用 Gemma 3n 大语言模型进行微调时,PhaseCoder 会生成“空间音频令牌”,使大语言模型能够执行复杂اً的空间推理和定向转录任务。

  2. TOOL · CL_84050 ·

    Google 的 Eloquent 听写应用因频繁转录错误而无法通过基准测试

    一位用户在尝试对 Google 的新设备端听写应用 Eloquent 进行基准测试时,发现由于频繁的音频转录失败,该应用基本无法使用。尽管该应用在正常运行时准确率具有竞争力,但它经常返回不完整或根本没有转录内容,这让用户怀疑它表现得像一个聊天式 AI,有时会回应音频内容而不是转录它。用户还测试了 Google 的开源模型 Gemma 3n,该模型也出现了类似问题,这表明 Eloquent 可能隐藏了这些问题。

  3. FRONTIER RELEASE · CL_01252 ·

    Gemma 3n 在开源生态系统中全面可用!

    Google DeepMind 已全面发布 Gemma 3n,这是一款专为设备端应用设计的移动优先多模态模型。这种新架构支持图像、音频、视频和文本输入,以及文本输出,并针对效率进行了优化,提供有效参数为 2B 和 4B 的版本,模仿了传统 2B 和 4B 模型的内存占用。Gemma 3n 引入了 MatFormer 等新组件以提高灵活性,以及 Per Layer Embeddings 以提高内存效率,在多语言、数学、编码和推理方面取得…