PulseAugur
中
实时 15:54:27
实体 Int4

Int4

PulseAugur coverage of Int4 — every cluster mentioning Int4 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
44
90 天内 44
发布 · 30天
0
90 天内 0
论文 · 30天
21
90 天内 21
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_281263 ·

    FlipGate 工具衡量量化 LLM 中每个答案的翻转情况

    一款名为 FlipGate 的新工具已被开发出来,用于评估量化大语言模型(LLM)的每个答案的一致性,超越了传统的准确性指标。FlipGate 衡量量化模型与基线相比,将正确答案错误化的频率,从而为可接受的变异建立一个“噪声基底”。这种方法旨在识别可能被整体准确性分数掩盖的回归问题,确保生产系统的可靠性更高。

  2. TOOL · CL_279308 ·

    Qwen 3.5 LLM 使用 eBay 挖矿硬件在 FPGA 上实现

    一位用户使用 INT4 量化技术,在现场可编程门阵列 (FPGA) 上实现了 Qwen 3.5 大型语言模型。该项目利用相对廉价的 eBay 挖矿硬件,特别是 SQRL FK33 和 Jungle Cat 板卡,来实现 LLM 推理。对 Qwen 3.5 9B 模型的初步测试表明,在 75MHz 下的推理速度约为 2 tokens/秒,并预计 27B 模型在多卡设置和优化 RTL 下将实现显著更高的性能。

  3. TOOL · CL_274348 ·

    Unsloth 发布 Beta 版,支持命令面板和更快的 Laya 决策

    Unsloth 发布了 0.1.902-beta 版本,引入了可通过 Cmd/Ctrl+P 访问的命令面板,并增强了桌面 UI/UX,以实现更快的导航和更清晰的错误消息。此更新将 Laya 决策模型的速度提高了 4.1 倍,并通过保持 INT4 和 MXFP4 检查点打包来提高 LoRA 训练期间的内存效率。此外,该版本还扩展了对托管决策 API 提供商的支持,并为图像和视频模型处理引入了新功能。

  4. TOOL · CL_268915 ·

    新研究详细介绍了循环 Transformer 中的量化失败

    研究人员在循环 Transformer 的训练后量化 (PTQ) 中识别出两种关键的失败模式,这些 Transformer 在递归步骤中重用权重。第一种称为“反馈暴露”,当量化层在没有恒等路径的情况下扰乱递归状态时发生,导致错误放大。第二种“校准盲目性”源于量化方法,这些方法基于初始激活值进行计算,而忽略了递归中的后续状态。在 Huginn-3.5B 和 Mamba 等模型上的实验证明了这些问题,而跨递归步骤累积 Hessian 的解…

  5. TOOL · CL_268871 ·

    新研究质疑量化下 AI 可解释性迁移指标

    arXiv 上的一篇新论文质疑了使用余弦相似度来衡量量化下可解释性伪影迁移有效性的有效性。作者认为,报告的统计数据缺乏正确解释所需的噪声基底信息。他们提出了一种测量此噪声基底的方法,并在 Qwen2.5-1.5B-Instruct 上进行了演示,发现在 INT4 量化下,可解释性伪影的方向实际上会旋转,这一发现被标准的报告实践所掩盖。该论文还强调,尺度不变统计量无法区分迁移的决策变量的平移和衰减,并建议了替代的报告建议。

  6. RESEARCH · CL_267282 ·

    新研究探索通过射频广播和稀疏性技术实现高效LLM推理

    研究人员正在开发新颖的方法来提高大型语言模型(LLM)推理的效率。一种方法AIR-LLM提出通过射频广播LLM权重,使边缘设备无需存储权重即可进行推理,从而显著降低能耗和通信时长。其他研究则侧重于通过稀疏性技术优化推理,例如SparseEngine和TopK-Guided,它们通过选择性地处理模型的一部分来降低内存和计算成本。此外,正在开发MINCE和evalstats等新框架,通过缩小数据集和提高LLM评判分数统计分析的可靠性来简化LLM评估。

  7. MEME · CL_256558 ·

    寻求用于本地 LLM 部署的 GPU 租赁建议

    一位用户在 r/LocalLLaMA 子版块上寻求 GPU 租赁建议,以支持私有化部署 38 亿至 270 亿参数的模型,并特别询问了 int4 和 int8 量化选项。

  8. RESEARCH · CL_257048 ·

    研究论文质疑后训练量化对文本嵌入器的有效性

    一篇新发表在arXiv上的研究论文,探讨了后训练量化(PTQ)技术在文本嵌入器上的有效性。研究发现,PTQ的常用启发式方法,例如保护嵌入表和根据模块敏感度分配比特,并不能可靠地迁移到检索嵌入器上。该研究在各种比特宽度和组大小下对模型进行量化,揭示了在较低比特宽度下,模块敏感度变得依赖于嵌入器家族,并且一个简单的重建代理在选择需要保护的张量方面不太可靠。

  9. TOOL · CL_247327 ·

    嵌入表精度是减小LLM规模的关键

    一项近期实验探索了量化对Transformer模型的影响,发现嵌入表占模型参数的很大一部分(72%)。研究发现,独立量化嵌入表,特别是使用逐行缩放,可以在性能损失极小的情况下大幅减少字节数。这种方法可以将模型尺寸减小6.2倍,同时通过将释放的字节重新分配给计数表和缓存来维持甚至提高系统级性能。

  10. TOOL · CL_241493 ·

    用户寻求帮助将 Qwen Image 2511 模型量化为 INT4

    一位 Reddit 用户正在寻求帮助,将 Qwen Image 2511 模型量化为 INT4 精度。虽然 INT8 量化成功,但用户在尝试 INT4 时遇到了模型不稳定的问题,特别是对于 ConvRot 变体。由于硬件限制(用户使用的是 RTX 4050 显卡),目标是实现 INT4 量化。

  11. TOOL · CL_229145 ·

    研究发现:KV缓存量化会降低RAG系统的忠诚度

    arXiv上的一篇新研究论文调查了KV缓存量化对检索增强生成(RAG)系统的影响。研究发现,虽然INT8量化对忠诚度的影响很小,但INT4量化会显著降低忠诚度,即使对于事实正确的答案也是如此。这种降低通常会被标准的准确性指标所忽略,并且在检索噪声较大或上下文窗口较大时会加剧,这凸显了在部署压缩缓存之前进行专门忠诚度审计的必要性。

  12. TOOL · CL_227089 ·

    DAMP新技术大幅降低LLM内存使用并提升速度

    研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…

  13. TOOL · CL_218701 ·

    指南解释本地部署大语言模型所需的VRAM

    在本地运行大语言模型需要仔细管理VRAM,因为模型大小和量化会显著影响内存使用。虽然没有精确的公式,但可以通过考虑模型的参数数量、权重的比特宽度(例如FP16、INT8、INT4)以及激活和临时缓冲区的开销来估算VRAM需求。Ollama、GPTQ和bitsandbytes等工具可以促进量化,从而减小内存占用。例如,一个量化到INT8的130亿参数模型可能需要大约18 GB的VRAM,这个数字可以使用nvidia-smi等工具进行检查。

  14. TOOL · CL_214167 ·

    统一 INT4 量化在真实梯度张量上优于 NVFP4

    一项比较梯度张量量化方案的研究发现,在真实世界训练数据上,统一 INT4 量化方案优于 NVIDIA 的 NVFP4 量化方案。研究表明,在量化前通常应用的随机 Hadamard 旋转能有效处理异常值,使得类似浮点数的间隔所提供的动态范围变得不那么关键。因此,一种更简单、均匀间隔的 INT4 量化方案被证明在梯度训练中更有效。

  15. TOOL · CL_211588 ·

    LLM量化:不止是比特缩减

    大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。

  16. TOOL · CL_199992 ·

    新流水线通过NAS和量化优化边缘AI硬件

    研究人员开发了一种新颖的三阶段流水线,用于优化边缘AI部署的神经网络架构,重点关注神经架构搜索(NAS)与训练后量化(PTQ)的相互作用。该流水线包括一个与硬件无关的代理前端、一个带过滤的量化桥梁以及一个用于硬件映射的进化后端。一项实证研究分析了INT4 PTQ如何影响NAS帕累托空间,发现FP32零样本代理在覆盖帕累托空间方面可能优于专用的INT4训练代理。

  17. RESEARCH · CL_195859 ·

    AI模型通过量化和剪枝实现小型化以提高效率

    量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。

  18. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  19. COMMENTARY · CL_179455 ·

    开发者提出专用LLM架构用于实时字幕

    一位名叫Lyra的开发者推测,通用大型语言模型在字幕翻译等专业任务上效率低下。通过实验,Lyra发现一个80亿参数的小模型,即使没有压缩,在关键字幕错误方面也比一个270亿参数的大模型表现更差。这表明模型容量,而非压缩,是瓶颈。Lyra提出,一个为字幕限制而设计的专用架构或“载体”,可以产生专业质量的实时翻译,解决当前AI和人工翻译在速度和准确性方面的局限性。

  20. TOOL · CL_181504 ·

    MiniMax H3 模型已量化,可在消费级 GPU 上本地推理

    Hugging Face 上的 Abiray 存储库提供了 MiniMax H3 模型的量化版本,针对消费级 GPU 上的本地推理进行了优化。这些集合包括用于扩散模型和文本编码器的各种格式,如 INT4、INT8 和 NVFP4,可满足从 16GB 到 24GB 及以上不同的 VRAM 容量。GGUF 版本提供了进一步的量化选项,以及用于多模态输入、高达 2K 的输出分辨率和音频生成的详细规格。