PulseAugur
实时 12:48:18
实体 Pallas

Pallas

PulseAugur coverage of Pallas — every cluster mentioning Pallas across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_183287 ·

    大语言模型研究探索更快的推理、高效的训练和新颖的适应技术

    多篇研究论文探讨了提高大语言模型(LLMs)效率和性能的方法。其中一篇论文介绍了 DSpark 技术,该技术通过使用轻量级草稿模型来预测 token,显著加快了 LLM 的推理速度,在 GPU 上实现了高达 3.2 倍的吞吐量提升,在设备上实现了 2.87 倍的提升。其他研究侧重于优化 LLM 的训练和适应,包括在监督微调(SFT)和强化学习(RL)之间分配标注预算的策略,以及开发参数高效微调方法,如 FCCA。此外,研究还探讨了跨不…

  2. MEME · CL_165526 ·

    “不高兴”的兔狲幼崽在日本动物园首次亮相

    五只以其永恒的“不高兴”表情而闻名的幼年兔狲已在日本神户动物王国开始公开展示。这些幼崽于五月出生,现已超过一公斤,并正在过渡到固体食物。该动物园旨在展示这些被认为是现存最古老的猫科物种之一、原产于中亚的动物的健康状况。

  3. RESEARCH · CL_160646 ·

    JAXBench 推出以优化 Google TPU 上的 AI 内核

    一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。

  4. TOOL · CL_143941 ·

    Google 在 Ironwood TPU 上优化 Qwen 3.5-397B MoE,实现 4.7 倍加速

    Google 优化了 Qwen 3.5-397B 混合专家(MoE)模型,使其能在其 Ironwood 张量处理单元(TPU)上运行。此优化利用 JAX 和 Pallas 实现,使 prefill 工作负载的速度提升了 4.7 倍。该开发解决了硬件分片限制的挑战,从而能更高效地部署大型模型。

  5. TOOL · CL_57171 ·

    Pallas DSL 助力 Google TPU 自定义内核优化

    本指南介绍了 Pallas,一个基于 Python 的领域特定语言 (DSL),用于编写可为 Google 的张量处理单元 (TPU) 编译和优化的自定义内核。Pallas 旨在为开发人员提供对硬件操作的细粒度控制,使他们能够获得超越标准库的性能提升。本文档是了解 Pallas 功能及其在 TPU 上优化机器学习工作负载方面作用的入门资源。