Jax
PulseAugur coverage of Jax — every cluster mentioning Jax across labs, papers, and developer communities, ranked by signal.
- used by reinforcement learning 90%
- used by Fortran 90%
- used by graphics processing unit 70%
- used by NumPy 70%
- used by NVIDIA H100 70%
- used by vLLM 70%
- used by central processing unit 70%
- used by Orbax Distributed Checkpointing With Jax 70%
- used by Tunisia 70%
- used by Hugging Face Transformers 70%
- developed by reinforcement learning 70%
- used by robotics 70%
10 天有情绪数据
-
Gemma 4 E2B 部署问题凸显 TPU 服务堆栈的局限性
一位开发者在使用 Google Cloud TPU 的 vLLM 服务堆栈部署 Google 的 Gemma 4 E2B 模型(带有量化检查点)时遇到了问题。由于检查点格式与服务堆栈的功能之间存在差异,特别是关于量化方案和缺失的模型权重,int4 和去量化 QAT 变体都无法加载。开发者最终实现了一个自定义加载路径来解决这些问题,这凸显了 int4 和去量化检查点之间的选择很大程度上取决于可用的硬件内存,而不仅仅是检查点类型。
-
新研究揭示表格基础模型的惊人泛化能力
新研究探讨了表格基础模型(TFMs)惊人的泛化能力,表明即使在单个真实表格上进行自监督预训练,也能实现强大的迁移学习。研究表明,TFMs的有用性更多地取决于任务和特征的数量和质量,而不是实例的数量。一篇论文提出了GEAR,一个两阶段的蒸馏框架,用于从TFMs创建轻量级、高效的预测器以进行生产部署,显著降低了延迟和内存成本,同时保持了高性能。另一项分析检查了TFMs在生产环境中的实际应用,测试了Google的TabFM在企业任务中的表现。
-
Google 的 TPU v6e-1 提供内存升级但成本更高
一项技术分析显示,Google 新的 Cloud TPU v6e-1 (Trillium) 在性能上优于 v5e-1,但其更高的成本使其在某些工作负载下性价比不高。v6e-1 提供双倍内存和 3.6 倍的 KV 缓存容量,但价格是 v5e-1 的 2.25 倍。对于未能充分利用增加内存的工作负载,v6e-1 的每个输出 token 的成本仅略微降低,甚至更高。分析还强调了新硬件配置方面的问题,包括跨区域的可用性不一致以及 spot 和…
-
Google 在技术报告中详细介绍了 DiffusionGemma 文本到图像模型
Google 发布了一份技术报告,详细介绍了其新的文本到图像模型 DiffusionGemma。报告概述了模型的架构,该架构融入了 U-Net 和 LoRA+ 等元素,并讨论了使用 Jax、PyTorch 和 Tensorflow 等框架的性能。此次发布旨在提升图像生成能力,并可能应用于各种创意和技术领域。
-
新的JAX框架简化了张量网络核机开发
研究人员开发了“tnkm”,一个基于JAX的开源Python库,用于构建和训练张量网络核机(TNKM)。该框架通过将非线性特征表示与紧凑的低秩张量网络参数化相结合,旨在创建既有表现力又计算高效的非线性模型。该库为各种特征映射、张量网络架构和优化策略(包括交替最小二乘法和基于梯度的方法)提供了一个统一的接口。在非线性基准问题上的初步演示表明,TNKM模型在高效训练和紧凑参数化方面取得了具有竞争力的预测精度。
-
新的SoRoMoX框架实现了更快、可微分的软体机器人建模
研究人员开发了SoRoMoX,一个新设计的用于软体机器人建模的Python/JAX框架。该框架以其可微分和并行处理能力而著称,能够为高级应用实现更快、更高效的工作流程。SoRoMoX支持各种建模方法,并为面向控制的任务提供了关键组件,在速度和吞吐量方面显著优于现有替代方案。
-
在单个Google Cloud TPU v5e芯片上自托管AI代理后端
一份技术指南详细介绍了如何在单个Google Cloud TPU v5e芯片上自托管一个轻量级AI代理后端。该设置使用了Gemma 4-E2B模型和vLLM推理引擎,实现了每秒1,496个输出令牌的吞吐量。作者强调了实际实施步骤,包括配置TPU、通过Google Secret Manager安全管理Hugging Face令牌,以及应对特定区域的配置模型限制。文章提供了性能指标和成本估算,突出了在此单芯片配置上运行多个并发代理的可行性。
-
Fortran 转译器 FGPT 将遗留代码桥接到 JAX 和 NumPy
研究人员开发了 FGPT,这是一种新颖的转译器,旨在将遗留的 Fortran 代码转换为现代 Python 框架,如 JAX 和 NumPy。该工具旨在弥合不熟悉 Fortran 但需要利用其高性能计算能力的科学家的专业知识差距。FGPT 将 Fortran 转换为 GPU 适配或自动微分版本,为大规模科学应用保留语义保真度和数值精度。
-
TimesFM 2.5 凭借新功能增强时间序列预测能力
时间序列预测模型 TimesFM 2.5 已更新,加入了用于端到端工作流开发的先进功能。新版本支持回测、协变量集成、异常检测和可扩展部署。用户现在可以使用各种指标评估预测质量,并在不同场景下测试模型的鲁棒性,包括长周期预测和输入变化。
-
OpenAI 发布 Codex Security CLI;Open Dreamer 上线;Grok 4.5 推出印度定价
OpenAI 发布了 Codex Security CLI,这是一个本地 AI 代理,旨在自动检测并修复代码存储库中的漏洞。此外,独立研究人员发布了 Open Dreamer,这是 Dreamer 4 世界模型的开源实现,它使用 MAE 和 JAX 架构实时生成交互式 Minecraft 体验。另外,一款流行的 AI 代码编辑器的开发者正在为印度推出本地化定价方案,价格为 649 卢比,其中包括 Grok 4.5 模型的使用权和 UP…
-
PyTorch 旨在成为深度学习的参考语言
PyTorch 正被定位为深度学习的参考语言,超越了其作为框架的角色。这一转变旨在提供更统一、更具表现力的编程体验,整合增强其人工智能开发能力的功能。该项目寻求为现有的 Jax 和 Tensorflow 等框架提供一个强大的替代方案。
-
Open Dreamer:Dreamer 4 世界模型管道的 JAX/Flax 复现版发布
Reactor 的研究人员发布了 Open Dreamer,这是 Dreamer 4 世界模型管道的开源实现。该项目使用 JAX 和 Flax NNX 构建,包括一个因果视频分词器、一个动作条件化潜在动力学模型和一个完整的训练配方。该团队成功复现了 Dreamer 4 的能力,从 CoinRun 等简单任务扩展到 Minecraft 等复杂环境。
-
JAXBench 推出以优化 Google TPU 上的 AI 内核
一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。
-
Google 发布 Gemma 2 开放模型,挑战大型专有系统
Google 推出了其开源 AI 模型的新一代 Gemma 2,该模型采用了重新设计的架构并提高了效率。其 270 亿参数版本提供的性能可与规模大一倍的模型相媲美,并且可以在单个 GPU 上运行,使其成为自托管的经济高效选择。其 90 亿参数的小型模型在其尺寸级别中也优于 Llama 3 8B 等同类模型。这些模型现已在 Hugging Face 和 Google AI Studio 等平台上提供,为开发者在开源 AI 生态系统中提供…
-
Google 发布 Tunix 以加速 TPU 上的 Agentic RL
Google 推出了 Tunix,一个新推出的 JAX 原生库,旨在加速 Agentic 强化学习。Tunix 通过为多轮 Agent 实现异步 rollout 和解耦的生产者-消费者管道,旨在减少 Tensor Processing Units (TPUs) 的空闲时间。
-
新的PIV方法融合算法,以改进流体动力学控制
研究人员开发了一种新颖的方法,通过融合来自多个异构算法的估计来优化粒子图像测速(PIV)测量。这种基于共识的方法利用交替方向乘子法(ADMM),并结合了平滑性和不可压缩性等先验知识,以改进流体量化。该方法在密集逆搜索估计器上展示了高达20%的端点误差降低,并成功应用于主动流体控制装置,实现了显著的减阻或增阻。
-
新论文详细介绍了IKPLS在GPU上速度提升高达6倍
一篇新论文详细介绍了改进的核偏最小二乘法(IKPLS)算法的显著加速,该算法以其在PLS校准中的效率而闻名。该研究引入了计算X旋转和Y载荷的优化,从而在现代硬件上实现了并行化改进。使用NumPy在CPU上和JAX在GPU上的基准测试表明,特定计算步骤的速度提升高达两个数量级,而完整拟合的速度提升约为2倍至6倍。这些增强功能已在开源Python包`ikpls`中实现。
-
新的2600万参数模型可本地处理工具调用
一款名为Cactus Needle、拥有2600万参数的新模型已被开发出来,可以在本地处理工具调用功能,而无需依赖基于云的尖端模型。这个小型模型压缩后约为16.2MB,可以高效地处理自然语言请求、选择合适的工具并提取结构化输出。其设计允许在本地执行,即使在仅CPU的系统上也能运行,从而可能降低不需要复杂推理的代理操作的延迟和成本。
-
Google 在 Ironwood TPU 上优化 Qwen 3.5-397B MoE,实现 4.7 倍加速
Google 优化了 Qwen 3.5-397B 混合专家(MoE)模型,使其能在其 Ironwood 张量处理单元(TPU)上运行。此优化利用 JAX 和 Pallas 实现,使 prefill 工作负载的速度提升了 4.7 倍。该开发解决了硬件分片限制的挑战,从而能更高效地部署大型模型。
-
NetForge RL:发布新的网络防御仿真环境
研究人员推出了 NetForge RL,这是一个新的多智能体仿真环境,旨在网络防御场景中训练强化学习智能体。该环境具有程序化生成的网络、使用自我对抗的自适应对手,以及具有噪声和部分观察的防御者。NetForge RL 支持持续动作和固定形状的观察,将动作映射到 MITRE ATT&CK 框架,并包含五个具有难度设置的预定义场景。