PulseAugur
实时 07:02:46
实体 Jax

Jax

PulseAugur coverage of Jax — every cluster mentioning Jax across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 82
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 51
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/5 页 · 共 82 条
  1. TOOL · CL_209230 ·

    Gemma 4 E2B 部署问题凸显 TPU 服务堆栈的局限性

    一位开发者在使用 Google Cloud TPU 的 vLLM 服务堆栈部署 Google 的 Gemma 4 E2B 模型(带有量化检查点)时遇到了问题。由于检查点格式与服务堆栈的功能之间存在差异,特别是关于量化方案和缺失的模型权重,int4 和去量化 QAT 变体都无法加载。开发者最终实现了一个自定义加载路径来解决这些问题,这凸显了 int4 和去量化检查点之间的选择很大程度上取决于可用的硬件内存,而不仅仅是检查点类型。

  2. RESEARCH · CL_203068 ·

    新研究揭示表格基础模型的惊人泛化能力

    新研究探讨了表格基础模型(TFMs)惊人的泛化能力,表明即使在单个真实表格上进行自监督预训练,也能实现强大的迁移学习。研究表明,TFMs的有用性更多地取决于任务和特征的数量和质量,而不是实例的数量。一篇论文提出了GEAR,一个两阶段的蒸馏框架,用于从TFMs创建轻量级、高效的预测器以进行生产部署,显著降低了延迟和内存成本,同时保持了高性能。另一项分析检查了TFMs在生产环境中的实际应用,测试了Google的TabFM在企业任务中的表现。

  3. TOOL · CL_192913 ·

    Google 的 TPU v6e-1 提供内存升级但成本更高

    一项技术分析显示,Google 新的 Cloud TPU v6e-1 (Trillium) 在性能上优于 v5e-1,但其更高的成本使其在某些工作负载下性价比不高。v6e-1 提供双倍内存和 3.6 倍的 KV 缓存容量,但价格是 v5e-1 的 2.25 倍。对于未能充分利用增加内存的工作负载,v6e-1 的每个输出 token 的成本仅略微降低,甚至更高。分析还强调了新硬件配置方面的问题,包括跨区域的可用性不一致以及 spot 和…

  4. TOOL · CL_192497 ·

    Google 在技术报告中详细介绍了 DiffusionGemma 文本到图像模型

    Google 发布了一份技术报告,详细介绍了其新的文本到图像模型 DiffusionGemma。报告概述了模型的架构,该架构融入了 U-Net 和 LoRA+ 等元素,并讨论了使用 Jax、PyTorch 和 Tensorflow 等框架的性能。此次发布旨在提升图像生成能力,并可能应用于各种创意和技术领域。

  5. TOOL · CL_191375 ·

    新的JAX框架简化了张量网络核机开发

    研究人员开发了“tnkm”,一个基于JAX的开源Python库,用于构建和训练张量网络核机(TNKM)。该框架通过将非线性特征表示与紧凑的低秩张量网络参数化相结合,旨在创建既有表现力又计算高效的非线性模型。该库为各种特征映射、张量网络架构和优化策略(包括交替最小二乘法和基于梯度的方​​法)提供了一个统一的接口。在非线性基准问题上的初步演示表明,TNKM模型在高效训练和紧凑参数化方面取得了具有竞争力的预测精度。

  6. TOOL · CL_191179 ·

    新的SoRoMoX框架实现了更快、可微分的软体机器人建模

    研究人员开发了SoRoMoX,一个新设计的用于软体机器人建模的Python/JAX框架。该框架以其可微分和并行处理能力而著称,能够为高级应用实现更快、更高效的工作流程。SoRoMoX支持各种建模方法,并为面向控制的任务提供了关键组件,在速度和吞吐量方面显著优于现有替代方案。

  7. TOOL · CL_190812 ·

    在单个Google Cloud TPU v5e芯片上自托管AI代理后端

    一份技术指南详细介绍了如何在单个Google Cloud TPU v5e芯片上自托管一个轻量级AI代理后端。该设置使用了Gemma 4-E2B模型和vLLM推理引擎,实现了每秒1,496个输出令牌的吞吐量。作者强调了实际实施步骤,包括配置TPU、通过Google Secret Manager安全管理Hugging Face令牌,以及应对特定区域的配置模型限制。文章提供了性能指标和成本估算,突出了在此单芯片配置上运行多个并发代理的可行性。

  8. TOOL · CL_180539 ·

    Fortran 转译器 FGPT 将遗留代码桥接到 JAX 和 NumPy

    研究人员开发了 FGPT,这是一种新颖的转译器,旨在将遗留的 Fortran 代码转换为现代 Python 框架,如 JAX 和 NumPy。该工具旨在弥合不熟悉 Fortran 但需要利用其高性能计算能力的科学家的专业知识差距。FGPT 将 Fortran 转换为 GPU 适配或自动微分版本,为大规模科学应用保留语义保真度和数值精度。

  9. TOOL · CL_177014 ·

    TimesFM 2.5 凭借新功能增强时间序列预测能力

    时间序列预测模型 TimesFM 2.5 已更新,加入了用于端到端工作流开发的先进功能。新版本支持回测、协变量集成、异常检测和可扩展部署。用户现在可以使用各种指标评估预测质量,并在不同场景下测试模型的鲁棒性,包括长周期预测和输入变化。

  10. TOOL · CL_170599 ·

    OpenAI 发布 Codex Security CLI;Open Dreamer 上线;Grok 4.5 推出印度定价

    OpenAI 发布了 Codex Security CLI,这是一个本地 AI 代理,旨在自动检测并修复代码存储库中的漏洞。此外,独立研究人员发布了 Open Dreamer,这是 Dreamer 4 世界模型的开源实现,它使用 MAE 和 JAX 架构实时生成交互式 Minecraft 体验。另外,一款流行的 AI 代码编辑器的开发者正在为印度推出本地化定价方案,价格为 649 卢比,其中包括 Grok 4.5 模型的使用权和 UP…

  11. TOOL · CL_167015 ·

    PyTorch 旨在成为深度学习的参考语言

    PyTorch 正被定位为深度学习的参考语言,超越了其作为框架的角色。这一转变旨在提供更统一、更具表现力的编程体验,整合增强其人工智能开发能力的功能。该项目寻求为现有的 Jax 和 Tensorflow 等框架提供一个强大的替代方案。

  12. TOOL · CL_163322 ·

    Open Dreamer:Dreamer 4 世界模型管道的 JAX/Flax 复现版发布

    Reactor 的研究人员发布了 Open Dreamer,这是 Dreamer 4 世界模型管道的开源实现。该项目使用 JAX 和 Flax NNX 构建,包括一个因果视频分词器、一个动作条件化潜在动力学模型和一个完整的训练配方。该团队成功复现了 Dreamer 4 的能力,从 CoinRun 等简单任务扩展到 Minecraft 等复杂环境。

  13. RESEARCH · CL_160646 ·

    JAXBench 推出以优化 Google TPU 上的 AI 内核

    一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。

  14. SIGNIFICANT · CL_157632 ·

    Google 发布 Gemma 2 开放模型,挑战大型专有系统

    Google 推出了其开源 AI 模型的新一代 Gemma 2,该模型采用了重新设计的架构并提高了效率。其 270 亿参数版本提供的性能可与规模大一倍的模型相媲美,并且可以在单个 GPU 上运行,使其成为自托管的经济高效选择。其 90 亿参数的小型模型在其尺寸级别中也优于 Llama 3 8B 等同类模型。这些模型现已在 Hugging Face 和 Google AI Studio 等平台上提供,为开发者在开源 AI 生态系统中提供…

  15. TOOL · CL_156849 ·

    Google 发布 Tunix 以加速 TPU 上的 Agentic RL

    Google 推出了 Tunix,一个新推出的 JAX 原生库,旨在加速 Agentic 强化学习。Tunix 通过为多轮 Agent 实现异步 rollout 和解耦的生产者-消费者管道,旨在减少 Tensor Processing Units (TPUs) 的空闲时间。

  16. TOOL · CL_154712 ·

    新的PIV方法融合算法,以改进流体动力学控制

    研究人员开发了一种新颖的方法,通过融合来自多个异构算法的估计来优化粒子图像测速(PIV)测量。这种基于共识的方法利用交替方向乘子法(ADMM),并结合了平滑性和不可压缩性等先验知识,以改进流体量化。该方法在密集逆搜索估计器上展示了高达20%的端点误差降低,并成功应用于主动流体控制装置,实现了显著的减阻或增阻。

  17. TOOL · CL_152002 ·

    新论文详细介绍了IKPLS在GPU上速度提升高达6倍

    一篇新论文详细介绍了改进的核偏最小二乘法(IKPLS)算法的显著加速,该算法以其在PLS校准中的效率而闻名。该研究引入了计算X旋转和Y载荷的优化,从而在现代硬件上实现了并行化改进。使用NumPy在CPU上和JAX在GPU上的基准测试表明,特定计算步骤的速度提升高达两个数量级,而完整拟合的速度提升约为2倍至6倍。这些增强功能已在开源Python包`ikpls`中实现。

  18. TOOL · CL_149241 ·

    新的2600万参数模型可本地处理工具调用

    一款名为Cactus Needle、拥有2600万参数的新模型已被开发出来,可以在本地处理工具调用功能,而无需依赖基于云的尖端模型。这个小型模型压缩后约为16.2MB,可以高效地处理自然语言请求、选择合适的工具并提取结构化输出。其设计允许在本地执行,即使在仅CPU的系统上也能运行,从而可能降低不需要复杂推理的代理操作的延迟和成本。

  19. TOOL · CL_143941 ·

    Google 在 Ironwood TPU 上优化 Qwen 3.5-397B MoE,实现 4.7 倍加速

    Google 优化了 Qwen 3.5-397B 混合专家(MoE)模型,使其能在其 Ironwood 张量处理单元(TPU)上运行。此优化利用 JAX 和 Pallas 实现,使 prefill 工作负载的速度提升了 4.7 倍。该开发解决了硬件分片限制的挑战,从而能更高效地部署大型模型。

  20. TOOL · CL_143843 ·

    NetForge RL:发布新的网络防御仿真环境

    研究人员推出了 NetForge RL,这是一个新的多智能体仿真环境,旨在网络防御场景中训练强化学习智能体。该环境具有程序化生成的网络、使用自我对抗的自适应对手,以及具有噪声和部分观察的防御者。NetForge RL 支持持续动作和固定形状的观察,将动作映射到 MITRE ATT&CK 框架,并包含五个具有难度设置的预定义场景。