PulseAugur
中
实时 01:11:47
实体 google/gemma-4-E2B-it

google/gemma-4-E2B-it

PulseAugur coverage of google/gemma-4-E2B-it — every cluster mentioning google/gemma-4-E2B-it across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_215264 ·

    科大讯飞发布Domux,一款用于智能家居指令的开源边缘模型

    Domux是科大讯飞开发的一款新的开源模型,旨在理解智能家居指令。它通过将自然语言解析为结构化命令来工作,识别意图并填充必要的槽位。Domux基于紧凑的google/gemma-4-E2B-it模型构建,针对边缘部署进行了优化,支持语音和聊天助手在设备上进行处理,以减少延迟并增强隐私。

  2. TOOL · CL_192913 ·

    Google 的 TPU v6e-1 提供内存升级但成本更高

    一项技术分析显示,Google 新的 Cloud TPU v6e-1 (Trillium) 在性能上优于 v5e-1,但其更高的成本使其在某些工作负载下性价比不高。v6e-1 提供双倍内存和 3.6 倍的 KV 缓存容量,但价格是 v5e-1 的 2.25 倍。对于未能充分利用增加内存的工作负载,v6e-1 的每个输出 token 的成本仅略微降低,甚至更高。分析还强调了新硬件配置方面的问题,包括跨区域的可用性不一致以及 spot 和…

  3. TOOL · CL_190812 ·

    在单个Google Cloud TPU v5e芯片上自托管AI代理后端

    一份技术指南详细介绍了如何在单个Google Cloud TPU v5e芯片上自托管一个轻量级AI代理后端。该设置使用了Gemma 4-E2B模型和vLLM推理引擎,实现了每秒1,496个输出令牌的吞吐量。作者强调了实际实施步骤,包括配置TPU、通过Google Secret Manager安全管理Hugging Face令牌,以及应对特定区域的配置模型限制。文章提供了性能指标和成本估算,突出了在此单芯片配置上运行多个并发代理的可行性。