PulseAugur
实时 05:27:13
实体 optimum-neuron

optimum-neuron

PulseAugur coverage of optimum-neuron — every cluster mentioning optimum-neuron across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_148712 ·

    Gemma-4 模型已移植到 AWS Inferentia2 加速器

    作者成功将包括密集型和专家混合(MoE)变体在内的整个 Gemma-4 模型家族移植到 AWS Inferentia2 加速器上运行。这需要大量手动工作,因为供应商提供的工具(如 optimum-neuron 和 Neuron vLLM)不支持 Gemma-4 的特定架构,例如 KV 共享和 MoE。该过程需要自定义跟踪和编译管道,其中 31B 密集型模型和 26B-A4B MoE 模型带来了独特的扩展和架构挑战。

  2. TOOL · CL_140280 ·

    Google Gemma-4 模型已移植到 AWS Inferentia2 硬件

    本现场报告详细介绍了将 Google 的 Gemma-4 模型(2B、4B 和 12B 参数)成功移植到 AWS Inferentia2 硬件的过程。该过程克服了三个主要障碍:混合注意力头、现有框架(如 vLLM 和 optimum-neuron)的限制以及 Neuron 编译器的约束。通过直接追踪 Hugging Face 的前向传播并为 KV 共享和张量并行实现特定策略,作者实现了所有三种模型尺寸的连贯服务,其性能指标可与 CPU…