PulseAugur
实时 11:14:59
实体 single-precision floating-point format

single-precision floating-point format

PulseAugur coverage of single-precision floating-point format — every cluster mentioning single-precision floating-point format across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. RESEARCH · CL_206963 ·

    Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU

    Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…

  2. TOOL · CL_205920 ·

    LLMs可以预测失败风险,但难以预测哪种协作协议更有利

    研究人员开发了一种方法,使大型语言模型(LLMs)能够预测多智能体推理任务中的失败风险,这有助于优化计算资源分配。虽然LLMs可以有效预测一般失败风险,但它们难以确定哪种具体的协作协议最有益。该研究使用了4181个数学问题的基准测试,发现置信度分数可以帮助初步升级决策,但针对特定协议的成本感知路由仍然是一个开放的挑战。

  3. RESEARCH · CL_203623 ·

    北京大学和 StepFun 发布 TensorCast 以加速 LLM 推理 · 跟踪 2 个来源

    北京大学和 StepFun 的研究人员开发了 TensorCast,这是一种新的可编程张量管理层,旨在优化大型语言模型基础设施。该系统旨在显著减少模型生成其第一个 token 所需的时间,在高并发代理场景中显示出高达 93.2% 的改进。此外,TensorCast 可将模型实例的启动时间加速高达 228.6 倍,解决了 LLM 部署中的关键性能瓶颈。

  4. TOOL · CL_198507 ·

    llama.cpp PR 通过向量化 F16-F32 转换提升提示处理速度

    对 llama.cpp 项目的一个拉取请求(PR)引入了 Flash Attention V-Cache 的 F16 到 F32 的向量化转换。此优化利用了硬件 F16C 内在函数,显著提升了性能。具体来说,对于 qwen3:4b 等较小模型,提示处理速度提高了 17-31%。

  5. RESEARCH · CL_195859 ·

    AI模型通过量化和剪枝实现小型化以提高效率

    量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。

  6. TOOL · CL_180693 ·

    新的QK-Guard方法可防止AI模型中低精度注意力塌陷

    研究人员发现,Transformer模型(如GPT-2)中的低精度注意力机制存在一个关键漏洞,可能导致训练突然崩溃。他们发现,来自各种来源的错误会汇聚到一个共享的查询-键(QK)通道,引起频谱失控。提出的解决方案QK-Guard通过在共享位置实施无参数的QK归一化来干预,从而有效防止崩溃,且不影响训练稳定性。

  7. TOOL · CL_167545 ·

    LLM 生成的 ARCH HDL 可验证浮点类型

    研究人员为 ARCH 硬件描述语言开发并验证了浮点数据类型,该类型专为语言模型生成而设计。该系统确保了可综合的 SystemVerilog、SMT-LIB 和 Lean 4 证明模型在比较、转换和算术运算等运算符之间的一致性。对较简单的运算符进行了详尽的验证,而复杂的基于乘法的运算则根据四舍五入到最近偶数的规范证明了其正确性,并针对性能和流水线化进行了优化。

  8. TOOL · CL_161334 ·

    研究发现:LLM参数平均存储3.6比特信息

    在ICML 2026上发表的一篇新论文,由来自Meta、Google DeepMind、康奈尔大学和NVIDIA的研究人员共同撰写,量化了大型语言模型参数的信息存储容量。研究发现,使用bfloat16格式的Transformer模型中的每个参数大约可以存储3.6比特的信息。这项研究还阐明了“双重下降”现象,并对数据隐私产生了影响,表明虽然平均训练数据不太可能被记住,但罕见或敏感信息存在显著泄露的风险。

  9. TOOL · CL_154476 ·

    边缘AI加速器被重新用于加速设备端模型自适应

    研究人员开发了一种新颖的设备端模型自适应方法,通过重新利用边缘AI推理加速器Hailo-8L进行训练过程中的特征提取。这种异构流水线将预训练的骨干网络量化为INT8以供加速器使用,同时在主机CPU上微调轻量级的分类头。这种方法显著缩短了训练时间,降低了能耗,并实现了对资源受限设备的现场高效更新。

  10. TOOL · CL_144078 ·

    开发者发布工具以可视化和分析 safetensors 模型量化

    一位开发者创建了两个 Python 工具来可视化和分析 safetensors 文件,这些文件通常用于存储 AI 模型。第一个工具 `model_explorer.py` 以树状格式显示 safetensors 文件的结构,详细说明层大小、数据类型和量化方法,如 NVFP4 和 INT4。第二个工具 `quant_explorer.py` 将基础模型与其量化版本进行比较,将层分类为已量化、保持原始精度或降级,并识别这些分类的模式。开发…

  11. COMMENTARY · CL_129682 ·

    Reddit 讨论模型量化对性能的影响

    Reddit 上的一场讨论探讨了模型量化对性能的影响。用户正在询问,将模型的精度从 FP32 降低到 FP8 等是否会导致显著的信息丢失及其能力的急剧下降。本次对话旨在理解应用量化技术时模型大小/速度与准确性之间的权衡。

  12. TOOL · CL_126445 ·

    ComfyUI 迎来 Starnodes 模型转换器,实现更快的模型转换

    ComfyUI 发布了一个名为 Starnodes Model Converter 的新模型转换节点。该工具旨在快速转换各种模型格式,包括 FP32, FP16, FP8, Int8 和 AIO Checkpoints。它提供 FP32, FP16, FP8, Int8, CONVROT 和 NVFP4 格式的输出,并内置了许多模型的质量配置文件。该转换器可在 GitHub 上获取。

  13. RESEARCH · CL_97851 ·

    SwitchBraidNet架构为低功耗部署提供轻量级混合BCI

    研究人员开发了SwitchBraidNet,一种用于混合脑机接口(BCI)的新型轻量级架构,集成了运动想象和稳态视觉诱发电位。该紧凑模型专为低功耗嵌入式系统设计,采用双路径时间编织进行特征提取,并采用自适应空间开关进行电极门控。在OpenBMI数据集上进行测试,SwitchBraidNet在包括INT8在内的各种数值精度下均展示了效率和性能,最小占用空间仅为3.03 KB。

  14. RESEARCH · CL_97809 ·

    混合精度 CA-SGD 加速 GPU 训练

    研究人员开发了一种用于 GPU 上的广义线性模型的混合精度通信规避 SGD (CA-SGD) 方法。该方法旨在通过将通信分摊到多个迭代中来减少分布式训练中的通信瓶颈。该方法利用现代 GPU 的矩阵硬件和较低精度格式来加速计算并缩小数据传输,与标准的 FP32 SGD 相比实现了显著的加速。

  15. TOOL · CL_76049 ·

    MarginGate论文确保BF16格式下LLM解码的可复现性

    一篇新论文介绍了一种名为MarginGate的方法,用于确保大型语言模型(LLM)在即使使用更快的BF16格式时也能实现可复现的解码。这解决了批次请求顺序可能导致相同提示产生不同Token的细微错误。MarginGate通过选择性地重新检查易受数值不准确影响的低边距解码步骤来实现可复现性,从而与始终使用更精确的FP32验证相比,最大限度地减少了性能开销。

  16. TOOL · CL_55200 ·

    AI生成的CUDA内核导致深度学习训练中出现静默错误

    旨在加速深度学习计算的AI生成的CUDA内核,已被发现会引入微妙且难以检测的错误。这些内核通过了NVIDIA的SOL-ExecBench基准测试,但在实际训练场景中却出现了问题,导致诸如损失发散等故障。问题源于嵌入梯度bf16累积中的精度错误,这些错误会被AdamW等某些优化器或特定数据集所掩盖,从而难以诊断。

  17. TOOL · CL_20689 ·

    LLM 研究日记 #3:PyTorch 张量、浮点类型和训练基础设施

    这篇 LLM 研究日记重点介绍了用于训练大型语言模型的 PyTorch 基础知识。它详细介绍了张量基础知识,探讨了 FP32、BF16 和 FP8 等各种浮点数据类型以提高效率和稳定性。该条目还涵盖了使用“einops”进行清晰的张量运算、计算成本(FLOPs)的计算方法以及使用自定义优化器和正确初始化进行模型构建的实际方面。

  18. RESEARCH · CL_15546 ·

    EdgeLPR论文探讨了激光雷达地点识别中神经网络精度与性能的权衡

    研究人员开发了EdgeLPR,一种在边缘设备上进行高效激光雷达地点识别的方法。该方法利用鸟瞰图表示,为自动导航启用轻量级图像网络。实验在不同量化级别(FP32、FP16、INT8)下评估了性能,结果表明FP16在降低成本的同时提供了与FP32相当的精度,而INT8可能导致依赖于架构的性能下降。

  19. RESEARCH · CL_14350 ·

    目标检测模型的量化和输入退化鲁棒性表现不一

    一项新研究调查了训练后量化(PTQ)在面对噪声和模糊等现实世界输入退化时,对YOLO目标检测模型鲁棒性的影响。研究人员评估了包括静态INT8在内的各种精度格式,并提出了一种感知退化的校准策略。虽然静态INT8提供了显著的加速,但提出的校准方法并未在大多数模型和退化情况下持续提高鲁棒性,尽管在特定噪声条件下对大型模型观察到了一些好处。

  20. RESEARCH · CL_06527 ·

    新方法QFlash和ELSA提升Vision Transformer的注意力效率

    研究人员开发了两种新方法来提高vision transformer中注意力机制的效率。QFlash专注于为FlashAttention实现纯整数运算,在某些模型上实现了显著的加速和能耗降低,而没有精度损失。另一方面,ELSA重新构建了注意力机制,以在实数运算中保留精确的softmax语义,在各种平台和精度上提供硬件无关的性能提升和内存减少。