PulseAugur
中
实时 05:45:00
实体 half-precision floating-point format

half-precision floating-point format

PulseAugur coverage of half-precision floating-point format — every cluster mentioning half-precision floating-point format across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
52
90 天内 52
发布 · 30天
0
90 天内 0
论文 · 30天
27
90 天内 27
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/3 页 · 共 56 条
  1. TOOL · CL_283706 ·

    通过提示工程和后处理,Whisper 听写准确性得到提升

    作者详细介绍了他们如何提高 Whisper 语音转文本模型在个人听写中的准确性。他们发现许多看似的错误并非听错,而是填充词、口头更正或数字格式化的问题,这些可以通过简单的后处理步骤来解决。此外,使用句子形式的初始提示,而不是术语列表,显著提高了对 Kubernetes 和 PostgreSQL 等特定技术术语的识别能力。

  2. COMMENTARY · CL_277141 ·

    讨论了AI在从起草电子邮件到模型微调等任务中的便利性

    强调了AI的便利性,举例包括起草电子邮件、调试代码和制定营销策略。讨论还涉及微调一个7B模型所需的内存,并指出其在半精度浮点格式下的尺寸。

  3. TOOL · CL_269454 ·

    新的大语言模型服务系统通过双精度优化KV缓存内存

    研究人员开发了DPS,一个双精度大语言模型服务系统,它动态调整模型精度以优化KV缓存内存。通过在KV缓存需求高的时期切换到模型的低精度变体,DPS可以将未使用的权重内存重新用于KV缓存块。这种基于半统一内存(SUM)的方法,在保持FP16级别精度的同时,将持续吞吐量提高了3.3倍,有效pass@1提高了41个百分点。

  4. TOOL · CL_257129 ·

    新的校验和方法增强了边缘设备上CNN的故障检测能力

    研究人员开发了一种名为Carry-Through Checksum的新型轻量级故障检测技术,用于边缘应用中的卷积神经网络(CNN)。该方法将校验和嵌入到卷积层中,在整个推理过程中计算和传播校验和,从而以最小的开销实现端到端的错误检测。实验表明,该技术在FP32中可检测到超过95%的关键故障,在FP16中可检测到超过86%的关键故障,而用于缓解的重新执行仅增加了嵌入式GPU上很小的运行时开销。

  5. TOOL · CL_247628 ·

    Qwen3-8B模型已扩展用于超低比特语言处理

    研究人员已成功将训练后三元化技术扩展到Qwen3-8B语言模型,旨在降低存储和内存需求。该研究进行了全面的评估,包括复现门、能力分析和直接打包执行。在三个语料库上,该8B模型达到了1.361倍的困惑度比,并在零样本任务上保持了64.6%的准确率,证明了其对激进离散化的鲁棒性。

  6. TOOL · CL_247327 ·

    嵌入表精度是减小LLM规模的关键

    一项近期实验探索了量化对Transformer模型的影响,发现嵌入表占模型参数的很大一部分(72%)。研究发现,独立量化嵌入表,特别是使用逐行缩放,可以在性能损失极小的情况下大幅减少字节数。这种方法可以将模型尺寸减小6.2倍,同时通过将释放的字节重新分配给计数表和缓存来维持甚至提高系统级性能。

  7. TOOL · CL_233519 ·

    新方法提升2位LLM权重解码效率

    研究人员开发了一种新颖的2位LLM权重多壳解码方法,旨在提高效率和质量。所提出的方法包括离线扩展到GPU布局以及一个融合的解量化加矩阵向量乘内核,以最小化warp发散。该方法与各种位精确布局进行了测试,在恒定带宽下展示了在大小和速度方面的性能提升,并与FP16等更高精度格式相比显示出有竞争力的结果。

  8. TOOL · CL_228652 ·

    LinkedIn 推出新的用于语义搜索的 GPU 检索

    研究人员在 LinkedIn 上开发了一种新的语义搜索检索框架,旨在提高用户个人资料建议的相关性。该系统将嵌入分割为八个类别监督段,从而能够更精确地匹配用户查询和相关个人资料。该方法采用 FP8 和 FP16 精度的两阶段 GPU 架构实现,显著提高了检索效率和准确性。在 A/B 测试中,新框架分别在探索性和导航性查询的 Precision@10 和 Precision@1 方面取得了显著改进。

  9. TOOL · CL_227055 ·

    新研究揭示了量化触发的LLM后门

    一篇新研究论文详细介绍了一种大型语言模型(LLM)中的安全漏洞,即后门可以通过训练后量化触发。该研究通过量化行为等价类(QBECs)形式化了这个问题,证明了通过源精度检查的模型在压缩为INT8或4位等格式后会表现出恶意行为。研究显示了显著的对抗性影响,例如机器翻译中的高损坏率和内容分析中的意识形态转变,凸显了在可信边缘AI的行为认证中包含最终部署配置的必要性。

  10. TOOL · CL_221209 ·

    新框架增强了双曲空间中的注意力检索

    研究人员开发了HCC+,一个用于改进双曲空间中注意力检索的理论框架。该新方法解决了现有技术在有限精度表示下注意力权重保持方面缺乏确定性保证的问题。HCC+利用庞加莱球的特性,对注意力偏差和总变差距离提供了理论保证,同时实现了显著的存储空间减少。

  11. TOOL · CL_219062 ·

    AQLoRA 为大语言模型提供更快的量化微调

    研究人员开发了 AQLoRA,一种用于大语言模型更快量化微调的新方法。该技术优化了内存节省和训练速度之间的平衡,这是现有 QLoRA 方法的一个已知限制。AQLoRA 通过自适应地量化模型权重来实现这一点,允许某些层跳过反量化过程,从而在不显著损失准确性的情况下加快训练速度。

  12. TOOL · CL_218701 ·

    指南解释本地部署大语言模型所需的VRAM

    在本地运行大语言模型需要仔细管理VRAM,因为模型大小和量化会显著影响内存使用。虽然没有精确的公式,但可以通过考虑模型的参数数量、权重的比特宽度(例如FP16、INT8、INT4)以及激活和临时缓冲区的开销来估算VRAM需求。Ollama、GPTQ和bitsandbytes等工具可以促进量化,从而减小内存占用。例如,一个量化到INT8的130亿参数模型可能需要大约18 GB的VRAM,这个数字可以使用nvidia-smi等工具进行检查。

  13. RESEARCH · CL_214906 ·

    开发者创建可在 CPU 上运行的超轻量级大语言模型

    一位开发者创建了一个自定义的量化大语言模型 SHADOW-250M-Instruct,拥有 2.5 亿个参数,在 300 亿词元上训练。该模型专为极致效率而设计,部署大小仅为 60 MB,且内存占用极少,使其无需 GPU 即可在标准笔记本电脑 CPU 上运行。它具有独特的长上下文机制,可将旧信息压缩到磁盘,以及新颖的词汇系统,使其能够访问多达 1 亿词元的历史记录,尽管它主要针对检索而非在扩展上下文中进行深度推理进行训练。

  14. TOOL · CL_209875 ·

    Llama 3.2:1b 量化级别显示可预测的内存扩展但响应质量相似

    对 Llama 3.2:1b 模型量化级别的比较显示,内存使用量随比特宽度可预测地扩展,Q4、Q8 和 FP16 变体分别消耗约 0.94 GB、1.24 GB 和 2.57 GB。然而,响应质量并未随着精度的提高而显著提高;FP16 完整模型生成的用于创建幻灯片的 AI 工具列表与 Q4 版本一样充斥着不相关的建议。这表明,虽然量化是管理内存的可靠方法,但它对要求不高的任务的答案质量影响可能很小。

  15. RESEARCH · CL_206963 ·

    Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU

    Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…

  16. RESEARCH · CL_203623 ·

    北京大学和 StepFun 发布 TensorCast 以加速 LLM 推理 · 跟踪 2 个来源

    北京大学和 StepFun 的研究人员开发了 TensorCast,这是一种新的可编程张量管理层,旨在优化大型语言模型基础设施。该系统旨在显著减少模型生成其第一个 token 所需的时间,在高并发代理场景中显示出高达 93.2% 的改进。此外,TensorCast 可将模型实例的启动时间加速高达 228.6 倍,解决了 LLM 部署中的关键性能瓶颈。

  17. RESEARCH · CL_195859 ·

    AI模型通过量化和剪枝实现小型化以提高效率

    量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。

  18. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  19. TOOL · CL_192541 ·

    量化大语言模型面临“对齐崩溃”,安全防护措施被消除

    训练后量化(PTQ)大语言模型(LLMs)可能导致一种称为“对齐崩溃”的现象,即在模型被压缩到较低比特宽度(例如4位或8位)时,像RLHF和DPO这样的安全防护措施会被悄无声息地消除。这种退化在标准的性能基准测试中无法被检测到,导致模型即使在全精度状态下通过了安全评估,仍然容易受到有害提示的影响。为解决此问题,研究人员建议在压缩过程中采用选择性混合精度技术、向量量化和对比对齐优化来保持模型的安全性。

  20. TOOL · CL_182471 ·

    AI模型或将用仅加法硬件取代矩阵乘法

    研究人员正在探索将AI模型中的传统矩阵乘法转变为简单的仅加法运算,旨在克服内存带宽瓶颈。这种方法通过使用极低比特的权重表示,例如三元或1比特值,可以使庞大的万亿参数模型在消费级CPU上高效运行。虽然当前的训练后量化等方法可以实现压缩,但可能会降低准确性。未来在于原生训练这些低比特架构,尽管仍需解决处理激活值异常和防止表示崩溃等挑战。