double-precision floating-point format
PulseAugur coverage of double-precision floating-point format — every cluster mentioning double-precision floating-point format across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Morloc 编译器从单一来源生成 CLI、MCP 和 API
Morloc 编译器是一款旨在从单一函数源生成多种接口的工具,例如命令行接口 (CLI)、用于 AI 代理的 MCP 以及应用程序编程接口 (API)。它利用强类型、多语言编译方法来管理序列化,并在 Rust 和 Python 等不同编程语言之间传播文档提示。这允许一致的代码生成,并通过从核心函数集中自动派生各种视图来减少样板代码,Mandelbrot 集的示例渲染证明了这一点。
-
稀疏 MoE 模型因数值状态追踪差异而表现出行为分歧
一篇新的 arXiv 论文详细介绍了不同的数值状态追踪方法如何在稀疏专家混合(MoE)模型中导致行为分歧,即使在数学上是等效的。研究人员发现,在 DeepSeek-V4 Flash 中改变聚合语义,同时保持 MoE 状态冻结,会导致不同的执行路径和输出延续。研究强调,相同的 token 并不能保证相同的自回归状态,因为分歧可能在生成过程的后期出现。这些发现表明,操作数转换、累加器精度和归约顺序是 MoE 运行时和硬件数值兼容性协议的关键组成部分。
-
中国首个万卡国产AI超算集群上线
中国在郑州推出了首个万卡AI超算集群——曙光8000(登峰)。该集群完全采用国产组件构建,专为大模型训练和科学计算任务设计,采用“超智融合”架构支持全精度计算。该项目由曙光公司开发,旨在优化国内计算资源配置,提高利用率,并计划将其整合到国家算力网络中,服务于科研机构和产业。
-
新FFT方法利用FP8张量核心实现高精度GPU计算
一篇新的研究论文提出了一种使用NVIDIA Blackwell Ultra (B300) GPU计算快速傅里叶变换 (FFT) 的高效方法。Ozaki-Bailey FFT技术利用FP8张量核心进行密集矩阵乘法,并通过Garner重构方法实现FP64精度。该方法旨在使B300 GPU能够胜任完整的FP64 FFT工作负载,从而可能为内存密集型应用带来显著的性能提升。
-
Supermicro 推出适用于融合式 HPC 和 AI 的 NVIDIA Vera Rubin NVL4 蓝图
Supermicro 推出了 NVIDIA Vera Rubin NVL4 数据中心构建模块系统的蓝图。此新产品提供原生双精度浮点性能,满足融合式高性能计算和 AI 基础设施的需求。
-
FP8 配合重建方案可匹配 HPC 中的 FP64 精度
一篇新研究论文挑战了长期以来认为双精度 (FP64) 硬件对高性能计算 (HPC) 至关重要的观点。作者提出,使用 FP8 张量核心,结合 Ozaki Scheme II 等特定重建方案,可以达到完整的 FP64 精度。这种方法有望在下一代 GPU 上显著提升性能,可能使许多科学计算任务的本地 FP64 芯片过时。