PulseAugur
中
实时 09:57:56
实体 TPU v6e

TPU v6e

PulseAugur coverage of TPU v6e — every cluster mentioning TPU v6e across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_282205 ·

    新的CutBCE方法优化推荐系统训练,减少内存使用并加速计算

    研究人员开发了一种名为CutBCE的新颖方法,用于优化大型词汇推荐系统中的二元交叉熵(BCE)损失。该方法解决了在海量商品目录上训练模型时出现的内存限制和内存溢出错误。CutBCE利用JAX和Pallas通过硬件加速,实现精确的融合重构和自定义向量-雅可比积(Vector-Jacobian Product)的片上计算,以避免在大带宽内存(High Bandwidth Memory)中存储大型张量。在TPU v5e/v6e和8芯片TPU…

  2. TOOL · CL_184271 ·

    Gemma 4 2B模型在单个TPU v5e芯片上部署,详细介绍成本和性能

    本文详细介绍了在单个Google Cloud TPU v5e芯片上部署Gemma 4 2B模型的过程,重点关注其作为DevOps/SRE助手的成本效益和性能。文章指出了TPU v5e和v6e之间的差异,并指出v5e在像Gemma 4 2B模型这样的带宽密集型工作负载方面提供了更好的性价比。该指南还解决了常见陷阱,例如gcloud命令的命名约定不正确以及配额可用性与实际配置容量之间的误导性。

  3. TOOL · CL_153811 ·

    Gemma 4-E2B 模型在单个 TPU v6e 芯片上高效服务

    Google Gemma 4-E2B 模型,一个拥有 20 亿参数的语言模型,已成功在单个 TPU v6e 芯片上实现服务,单用户吞吐量达到每秒 213 个 token,并扩展到约每秒 2,200 个 token 的并发流。此配置还准确处理了 OpenAI 风格的函数调用和基本视觉查询。然而,由于未实现的量化路径和与层归一化要求相关的加载器错误,加载 Gemma 4 模型量化版本的尝试失败了。

  4. RESEARCH · CL_80537 ·

    开源i1模型达到顶尖文生图性能

    研究人员开发了“i1”,一个拥有30亿参数的文生图扩散模型,其性能可与领先模型相媲美,并且完全开源。通过广泛的实验,研究团队确定了关键的设计选择和训练见解,例如数据集混合的均等权重以及更大的文本编码器适配器的优势。i1模型在公开可用的数据集上进行训练,其性能显著优于现有的开源模型,并提供了检查点、代码和数据处理流程,以促进未来的开放研究。