PulseAugur
实时 03:08:28
实体 half-precision floating-point format

half-precision floating-point format

PulseAugur coverage of half-precision floating-point format — every cluster mentioning half-precision floating-point format across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 43
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 24
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/3 页 · 共 43 条
  1. TOOL · CL_209875 ·

    Llama 3.2:1b 量化级别显示可预测的内存扩展但响应质量相似

    对 Llama 3.2:1b 模型量化级别的比较显示,内存使用量随比特宽度可预测地扩展,Q4、Q8 和 FP16 变体分别消耗约 0.94 GB、1.24 GB 和 2.57 GB。然而,响应质量并未随着精度的提高而显著提高;FP16 完整模型生成的用于创建幻灯片的 AI 工具列表与 Q4 版本一样充斥着不相关的建议。这表明,虽然量化是管理内存的可靠方法,但它对要求不高的任务的答案质量影响可能很小。

  2. RESEARCH · CL_206963 ·

    Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU

    Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…

  3. RESEARCH · CL_203623 ·

    北京大学和 StepFun 发布 TensorCast 以加速 LLM 推理 · 跟踪 2 个来源

    北京大学和 StepFun 的研究人员开发了 TensorCast,这是一种新的可编程张量管理层,旨在优化大型语言模型基础设施。该系统旨在显著减少模型生成其第一个 token 所需的时间,在高并发代理场景中显示出高达 93.2% 的改进。此外,TensorCast 可将模型实例的启动时间加速高达 228.6 倍,解决了 LLM 部署中的关键性能瓶颈。

  4. RESEARCH · CL_195859 ·

    AI模型通过量化和剪枝实现小型化以提高效率

    量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。

  5. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  6. TOOL · CL_192541 ·

    量化大语言模型面临“对齐崩溃”,安全防护措施被消除

    训练后量化(PTQ)大语言模型(LLMs)可能导致一种称为“对齐崩溃”的现象,即在模型被压缩到较低比特宽度(例如4位或8位)时,像RLHF和DPO这样的安全防护措施会被悄无声息地消除。这种退化在标准的性能基准测试中无法被检测到,导致模型即使在全精度状态下通过了安全评估,仍然容易受到有害提示的影响。为解决此问题,研究人员建议在压缩过程中采用选择性混合精度技术、向量量化和对比对齐优化来保持模型的安全性。

  7. TOOL · CL_182471 ·

    AI模型或将用仅加法硬件取代矩阵乘法

    研究人员正在探索将AI模型中的传统矩阵乘法转变为简单的仅加法运算,旨在克服内存带宽瓶颈。这种方法通过使用极低比特的权重表示,例如三元或1比特值,可以使庞大的万亿参数模型在消费级CPU上高效运行。虽然当前的训练后量化等方法可以实现压缩,但可能会降低准确性。未来在于原生训练这些低比特架构,尽管仍需解决处理激活值异常和防止表示崩溃等挑战。

  8. TOOL · CL_182079 ·

    由于训练后压缩,LLM审计会遗漏90%的安全漏洞

    一项新的分析表明,大型语言模型(LLM)的标准审计实践未能检测到模型压缩后出现的重大安全漏洞。为了部署而将全精度模型压缩到较低的比特宽度,这是一种常见的成本节约措施,可能导致“对齐崩溃”,即像RLHF和DPO这样的安全护栏被悄无声息地擦除。这种退化没有被典型的性能基准所捕获,导致已部署的模型尽管通过了初步的安全评估,但仍然容易受到有害提示的影响。

  9. TOOL · CL_178662 ·

    AirLLM 通过逐层推理使 70B 模型在 4GB GPU 上运行 · 跟踪 8 个来源

    开源项目 AirLLM 已获得显著关注,在 GitHub 上获得了超过 27,000 颗星。其核心创新在于允许大型语言模型(特别是 700 亿参数模型)在单块 4GB GPU 上运行。这是通过一种逐层推理技术实现的,该技术仅将当前活动的层加载到 GPU 内存中,其余部分则驻留在磁盘上。虽然这使得在消费级硬件上运行大型模型成为可能,但其推理速度与传统方法相比会显著变慢。

  10. TOOL · CL_175486 ·

    INT4 仅权重量化:解码加速、Prefill 停滞解析

    仅权重 INT4 量化虽然能有效减少内存流量并加速 LLM 推理的解码阶段,但并不能改善 Prefill 阶段。这是因为 Prefill 是计算密集型的,即它受限于 GPU 的处理能力而非内存带宽。INT4 权重所需的解量化过程会增加开销,抵消了 Prefill 阶段的任何潜在收益。对于计算密集型场景,建议的替代方案是量化激活或接受 INT4 以获得容量优势。

  11. TOOL · CL_162621 ·

    指南详述如何通过 Google Colab 将 Stable Diffusion 模型转换为 INT8

    一位 Reddit 用户提供了一份详细的分步指南,介绍如何使用 Google Colab 将 Stable Diffusion 模型从半精度浮点格式 (fp16) 转换为 8 位整数格式 (int8)。该过程包括上传 fp16 模型,安装 `convert_to_quant` 和 `triton` 等必要库,然后执行命令行转换脚本。该指南指定了缩放模式、卷积旋转、组大小和层排除的参数,为不同模型提供了灵活性。

  12. TOOL · CL_160761 ·

    新框架支持RISC-V上的Float16片上AI训练

    研究人员开发了一个开源框架,支持在资源受限的RISC-V单核处理器上使用float16精度进行AI模型的片上训练。该方法利用了Zfh和Zvfh等标准RISC-V扩展,可在对模型性能影响最小的情况下将内存占用减小约50%。该框架还具备层冻结功能,以支持迁移学习和微调场景,并基于AIfES嵌入式系统框架构建。

  13. RESEARCH · CL_158795 ·

    StrokeSeg2 框架简化临床 AI 部署

    研究人员开发了 StrokeSeg2,这是一个轻量级、模块化的 C++/Qt 框架,旨在使基于深度学习的脑病灶分割在临床研究中更易于访问。该框架通过知识蒸馏进行架构压缩和使用 ONNX Runtime 进行推理优化,将 nnU-Net 等资源密集型管道改编为可移植应用程序。这种方法显著减小了模型的大小和能耗,使其能够在没有外部依赖的情况下部署在标准的临床工作站上。

  14. TOOL · CL_154414 ·

    新方法提升AI计算张量核的错误检测能力

    研究人员开发了一种新的方法来校准张量核中的混合精度容差,张量核对于机器学习计算至关重要。这种面向算子的方法分析了云GPU运行中的逐元素误差分布,以建立更严格、有实证依据的绝对容差。当应用于LLM风格的错误变体时,该方法将错误检测召回率显著提高了9个百分点以上,识别出200多个额外错误。

  15. TOOL · CL_153020 ·

    PagedWeight 将 MoE 服务内存减少 72%,精度达到 FP16

    一篇新的预印本介绍了一种名为 PagedWeight 的技术,该技术可在运行时动态量化专家混合(MoE)模型权重。据报道,该方法可将 GPU 内存使用量减少 72%,同时将人工智能推理任务的吞吐量提高 1.94 倍。该方法旨在提高服务大型 MoE 模型 的效率。

  16. TOOL · CL_152007 ·

    PagedWeight 通过动态量化改进 MoE LLM 服务

    一种名为 PagedWeight 的新方法已被开发出来,以提高服务混合专家(MoE)大型语言模型的效率。该方法在运行时动态量化 MoE 模型权重,将其精度与 KV 缓存的内存需求进行平衡。PagedWeight 旨在优化模型精度、内存消耗和吞吐量之间的权衡,与现有的量化基线相比,显示出显著的 GPU 内存节省和吞吐量改进。

  17. SIGNIFICANT · CL_143192 ·

    PrismML 发布 Bonsai 27B,使 Qwen3.6-27B 可在笔记本电脑和手机上运行

    PrismML 发布了 Bonsai 27B,这是 Qwen3.6-27B 的高度压缩版本,有 1 位和三元变体。这些模型旨在在笔记本电脑和手机等消费级硬件上运行,其中 1 位版本仅需 3.9GB,三元版本需要 5.9GB。尽管经过了激进的压缩,三元模型仍保留了原始 FP16 模型约 94.6% 的性能,而 1 位版本则保留了 89.5%,使其适用于需要大上下文窗口和高效内存使用的应用程序。

  18. RESEARCH · CL_141209 ·

    AI 模型服务加速分解:运行时收益占主导,量化提供微小提升 · 跟踪 2 个来源

    一篇新的研究论文详细介绍了一种分解 AI 模型服务中加速的方法,将收益与运行时、内核优化和量化分开。该研究在四块 NVIDIA RTX A5000 GPU 上进行,发现运行时改进约占总加速的三分之二。量化在测试模型中提供的收益较小,最多为 1.5%,但显著增加了支持的并发用户数量。研究还探讨了最佳实例配置,表明工作负载和模型大小决定了分片还是多个独立实例更有效。

  19. RESEARCH · CL_141120 ·

    新的解码监控器改进了量化推理模型

    研究人员开发了一种名为 Calibrated e-CUSUM Decoding 的新解码监控器,旨在提高量化推理模型的可靠性。研究表明,使用 token log-probability 的传统方法不足以检测生成失败。所提出的方法结合了警报分数和序列检测器来识别不可靠的轨迹,在提高准确性和减少 DeepSeek-R1-Distill-Qwen-1.5B 等模型的退化信号方面显示出潜力。

  20. TOOL · CL_130951 ·

    Krea 2 用户报告 fp16 配置导致黑图

    Krea 2 图像生成模型的用户在使用半精度浮点数(fp16)格式时遇到了问题。具体来说,使用 bf16 配合 fp16 累加会导致生成黑图,这表明该配置可能存在兼容性或实现问题。社区正在寻求关于是否会发布 Krea 2 的 fp16 模型来解决这些问题的信息。