PulseAugur
实时 21:25:04
实体 Xla

Xla

PulseAugur coverage of Xla — every cluster mentioning Xla across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. SIGNIFICANT · CL_221535 ·

    Google Cloud 在 TPU 上启用 vLLM 以支持 Qwen3 长上下文嵌入

    Google Cloud 为优化嵌入推理的张量处理单元(TPU)引入了原生的 vLLM 支持,旨在用于生产检索系统。此次更新侧重于增强 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 等模型的长上下文和多模态嵌入,解决了内存压力和池化正确性等挑战。Google 的工程努力包括优化张量对齐、编译预热以及混合 StepPool 设计,以确保数学正确性和高性能,其中一种配置实现了超过 83,000 to…

  2. TOOL · CL_180713 ·

    Nova 编译器通过积极优化解锁深度学习性能

    研究人员开发了 Nova,这是一款端到端的即时 (JIT) 编译器,旨在通过对硬件和内存进行精细控制来优化深度学习模型的性能。Nova 通过融合操作、优化内存层次结构以及调优到寄存器级别的执行来实现这一点,从而实现积极的全局图优化。评估显示,Nova 在特定任务上可媲美或超越 cuBLAS 和 XLA,在模型吞吐量方面优于 PyTorch 和 XLA,并且至关重要的是,它减小了内存占用,从而能够在消费级 GPU 上训练更大的模型,否则…

  3. TOOL · CL_162763 ·

    MoE模型因容量因子导致Token被静默丢弃

    混合专家(MoE)模型的性能在生产环境中可能会因一个名为MoE容量因子的隐藏问题而下降。该因子为每个专家设定了一个固定大小的缓冲区,如果过多的Token被路由到同一个专家,一些Token就会被静默丢弃,绕过该专家的处理。MoE路由器的负载不平衡倾向加剧了这个问题,导致“富者愈富”的局面,某些专家持续过载。解决方案包括增加容量因子、使用MegaBlocks等专用内核,或采用DeepSeek-V3中使用的无辅助损失的平衡技术。

  4. RESEARCH · CL_160646 ·

    JAXBench 推出以优化 Google TPU 上的 AI 内核

    一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。

  5. RESEARCH · CL_99568 ·

    新的CRAX基准测试加速了安全强化学习的评估

    研究人员推出CRAX,这是一个旨在加速安全强化学习(RL)代理评估的新基准测试。CRAX使用MuJoCo XLA物理引擎构建,与基于CPU的基准测试相比,速度提升高达100倍,使其适用于机器人和自动驾驶等现实世界应用。该基准测试包含六个环境套件和三个特定代理任务,每个都有不同的难度级别。对六种流行的安全RL方法的初步评估表明,没有一种方法是普遍优越的,突显了性能和安全之间的权衡,并表明课程学习可以提高在更具挑战性场景中的性能。

  6. RESEARCH · CL_17782 ·

    Apple 详解其 Apple Intelligence 的设备端和服务器端基础模型

    Apple 详细介绍了其为 Apple Intelligence 提供支持的新基础语言模型,包括一个约 30 亿参数的设备端模型和一个更大的服务器端模型。这些模型专为多语言和多模态任务设计,支持图像理解和工具执行。该公司强调其负责任的 AI 方法,通过 Private Cloud Compute 和设备端处理等创新来关注用户隐私,确保用户数据不被用于训练。

  7. SIGNIFICANT · CL_00880 ·

    George Hotz的tiny corp推出1.5万美元AI电脑和基于RISC的tinygrad框架

    George Hotz的公司tiny corp发布了tinybox,一款售价1.5万美元的个人AI电脑,专为本地模型训练和推理设计。tinybox拥有738 FP16 TFLOPS和144 GB GPU内存,能够直接运行65B LLaMA模型。Hotz通过tinygrad框架采用RISC理念以提高效率,并避免图灵完备内核,旨在通过专注于开发者体验和优化现成硬件来与NVIDIA等成熟厂商竞争。