实体
optimum-neuron
optimum-neuron
PulseAugur coverage of optimum-neuron — every cluster mentioning optimum-neuron across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Gemma-4 模型已移植到 AWS Inferentia2 加速器
作者成功将包括密集型和专家混合(MoE)变体在内的整个 Gemma-4 模型家族移植到 AWS Inferentia2 加速器上运行。这需要大量手动工作,因为供应商提供的工具(如 optimum-neuron 和 Neuron vLLM)不支持 Gemma-4 的特定架构,例如 KV 共享和 MoE。该过程需要自定义跟踪和编译管道,其中 31B 密集型模型和 26B-A4B MoE 模型带来了独特的扩展和架构挑战。
-
Google Gemma-4 模型已移植到 AWS Inferentia2 硬件
本现场报告详细介绍了将 Google 的 Gemma-4 模型(2B、4B 和 12B 参数)成功移植到 AWS Inferentia2 硬件的过程。该过程克服了三个主要障碍:混合注意力头、现有框架(如 vLLM 和 optimum-neuron)的限制以及 Neuron 编译器的约束。通过直接追踪 Hugging Face 的前向传播并为 KV 共享和张量并行实现特定策略,作者实现了所有三种模型尺寸的连贯服务,其性能指标可与 CPU…