Xla
PulseAugur coverage of Xla — every cluster mentioning Xla across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Google Cloud 在 TPU 上启用 vLLM 以支持 Qwen3 长上下文嵌入
Google Cloud 为优化嵌入推理的张量处理单元(TPU)引入了原生的 vLLM 支持,旨在用于生产检索系统。此次更新侧重于增强 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 等模型的长上下文和多模态嵌入,解决了内存压力和池化正确性等挑战。Google 的工程努力包括优化张量对齐、编译预热以及混合 StepPool 设计,以确保数学正确性和高性能,其中一种配置实现了超过 83,000 to…
-
Nova 编译器通过积极优化解锁深度学习性能
研究人员开发了 Nova,这是一款端到端的即时 (JIT) 编译器,旨在通过对硬件和内存进行精细控制来优化深度学习模型的性能。Nova 通过融合操作、优化内存层次结构以及调优到寄存器级别的执行来实现这一点,从而实现积极的全局图优化。评估显示,Nova 在特定任务上可媲美或超越 cuBLAS 和 XLA,在模型吞吐量方面优于 PyTorch 和 XLA,并且至关重要的是,它减小了内存占用,从而能够在消费级 GPU 上训练更大的模型,否则…
-
MoE模型因容量因子导致Token被静默丢弃
混合专家(MoE)模型的性能在生产环境中可能会因一个名为MoE容量因子的隐藏问题而下降。该因子为每个专家设定了一个固定大小的缓冲区,如果过多的Token被路由到同一个专家,一些Token就会被静默丢弃,绕过该专家的处理。MoE路由器的负载不平衡倾向加剧了这个问题,导致“富者愈富”的局面,某些专家持续过载。解决方案包括增加容量因子、使用MegaBlocks等专用内核,或采用DeepSeek-V3中使用的无辅助损失的平衡技术。
-
JAXBench 推出以优化 Google TPU 上的 AI 内核
一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。
-
新的CRAX基准测试加速了安全强化学习的评估
研究人员推出CRAX,这是一个旨在加速安全强化学习(RL)代理评估的新基准测试。CRAX使用MuJoCo XLA物理引擎构建,与基于CPU的基准测试相比,速度提升高达100倍,使其适用于机器人和自动驾驶等现实世界应用。该基准测试包含六个环境套件和三个特定代理任务,每个都有不同的难度级别。对六种流行的安全RL方法的初步评估表明,没有一种方法是普遍优越的,突显了性能和安全之间的权衡,并表明课程学习可以提高在更具挑战性场景中的性能。
-
Apple 详解其 Apple Intelligence 的设备端和服务器端基础模型
Apple 详细介绍了其为 Apple Intelligence 提供支持的新基础语言模型,包括一个约 30 亿参数的设备端模型和一个更大的服务器端模型。这些模型专为多语言和多模态任务设计,支持图像理解和工具执行。该公司强调其负责任的 AI 方法,通过 Private Cloud Compute 和设备端处理等创新来关注用户隐私,确保用户数据不被用于训练。
-
George Hotz的tiny corp推出1.5万美元AI电脑和基于RISC的tinygrad框架
George Hotz的公司tiny corp发布了tinybox,一款售价1.5万美元的个人AI电脑,专为本地模型训练和推理设计。tinybox拥有738 FP16 TFLOPS和144 GB GPU内存,能够直接运行65B LLaMA模型。Hotz通过tinygrad框架采用RISC理念以提高效率,并避免图灵完备内核,旨在通过专注于开发者体验和优化现成硬件来与NVIDIA等成熟厂商竞争。