PulseAugur
实时 13:32:21
实体 W4A4

W4A4

PulseAugur coverage of W4A4 — every cluster mentioning W4A4 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_211588 ·

    LLM量化:不止是比特缩减

    大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。

  2. RESEARCH · CL_203811 ·

    新的QUASAR方法在低比特量化中提升LLM准确性

    两篇新研究论文介绍了QUASAR,一种用于提高量化大语言模型准确性的新方法。第一篇论文侧重于一种无需训练的训练后量化方法,该方法解决了残差补偿中的数值稳定性问题,并在Vision Transformer Base模型上取得了优异的成果。第二篇论文将QUASAR作为一种感知量化训练技术,通过将感知重构纳入训练循环来降低损失下限,在Qwen3和Llama-3.1等模型上显著提高了准确性和KL散度。

  3. TOOL · CL_151988 ·

    新的QUADS技术稳定MoE LLM的NVFP4强化学习

    研究人员开发了一种名为QUADS的新技术,通过使用NVFP4低精度格式来稳定混合专家(MoE)大语言模型的强化学习(RL)。他们发现,激活误差而非权重误差是MoE模型FP4 RL不稳定的主要原因。QUADS通过在训练器端实现不对称量化感知训练,并在回滚端实现残差激活补偿来解决此问题,达到了BF16级别的准确率并提高了吞吐量。

  4. TOOL · CL_145908 ·

    新的COD-TDQ方法提高了量化Transformer在目标检测中的性能

    研究人员开发了一种名为COD-TDQ的新方法,用于在采用激进的训练后W4A4量化时,提高基于Transformer的模型在伪装目标检测(COD)方面的性能。他们发现,COD任务中的重尾背景Token会扩大激活范围,导致关键边界线索丢失。COD-TDQ通过使用Direct-Sum Token-Group抑制范围主导,并使用Dual-Constraint Range Projection来维持有界的步长-离散比和零箱质量来解决这个问题。与…

  5. TOOL · CL_137538 ·

    RTX Pro 4500 GPU 使用新的 PrismaQuant LLM 量化方法进行测试

    Reddit 的 r/LocalLLaMA 子版块的一位用户分享了他们在 RTX Pro 4500 GPU 上测试大型语言模型新量化方法的经验。他们遇到了一个特定的 Sakamakismile 模型的问题,出现了工具调用错误和思考循环。为了解决这个问题,他们探索了 PrismaQuant,这是一种在 Nvidia 的 DGX Spark 论坛上讨论的新量化技术,它优化了线性层,以在给定的比特深度下获得更好的模型性能。用户强调 Pris…

  6. TOOL · CL_135475 ·

    Int4 w4a4 量化因极小的质量损失而受到赞扬

    一位 Reddit 用户分享了他们使用 Int4 w4a4(一种 AI 模型量化方法)的经验,并表示它“太棒了”。他们展示了两张图片,一张是用 Int4 生成的,另一张是用 Int8 生成的,并指出它们之间的视觉差异很小。这表明 Int4 w4a4 在模型尺寸或计算需求方面提供了显著的降低,而输出质量几乎没有或完全没有可感知的损失。

  7. RESEARCH · CL_119662 ·

    新的GoodQ方法使用生成模型进行零样本目标检测器量化

    研究人员开发了GoodQ,一种用于零样本量化感知训练(ZSQ-OD)的新流程,该流程利用现成的生成模型来创建训练数据集。该方法解决了目标检测模型合成数据固有的密集图像信息、类别分布不平衡和伪标签噪声等挑战。GoodQ采用信息密集型提示、内在分布感知选择和教师引导自适应降噪技术,在W4A4等低比特量化场景下以及扩展到W3A3等极端比特宽度下取得了最先进的性能。