Pallas
PulseAugur coverage of Pallas — every cluster mentioning Pallas across labs, papers, and developer communities, ranked by signal.
-
大语言模型研究探索更快的推理、高效的训练和新颖的适应技术
多篇研究论文探讨了提高大语言模型(LLMs)效率和性能的方法。其中一篇论文介绍了 DSpark 技术,该技术通过使用轻量级草稿模型来预测 token,显著加快了 LLM 的推理速度,在 GPU 上实现了高达 3.2 倍的吞吐量提升,在设备上实现了 2.87 倍的提升。其他研究侧重于优化 LLM 的训练和适应,包括在监督微调(SFT)和强化学习(RL)之间分配标注预算的策略,以及开发参数高效微调方法,如 FCCA。此外,研究还探讨了跨不…
-
“不高兴”的兔狲幼崽在日本动物园首次亮相
五只以其永恒的“不高兴”表情而闻名的幼年兔狲已在日本神户动物王国开始公开展示。这些幼崽于五月出生,现已超过一公斤,并正在过渡到固体食物。该动物园旨在展示这些被认为是现存最古老的猫科物种之一、原产于中亚的动物的健康状况。
-
JAXBench 推出以优化 Google TPU 上的 AI 内核
一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。
-
Google 在 Ironwood TPU 上优化 Qwen 3.5-397B MoE,实现 4.7 倍加速
Google 优化了 Qwen 3.5-397B 混合专家(MoE)模型,使其能在其 Ironwood 张量处理单元(TPU)上运行。此优化利用 JAX 和 Pallas 实现,使 prefill 工作负载的速度提升了 4.7 倍。该开发解决了硬件分片限制的挑战,从而能更高效地部署大型模型。
-
Pallas DSL 助力 Google TPU 自定义内核优化
本指南介绍了 Pallas,一个基于 Python 的领域特定语言 (DSL),用于编写可为 Google 的张量处理单元 (TPU) 编译和优化的自定义内核。Pallas 旨在为开发人员提供对硬件操作的细粒度控制,使他们能够获得超越标准库的性能提升。本文档是了解 Pallas 功能及其在 TPU 上优化机器学习工作负载方面作用的入门资源。