PulseAugur
中
实时 01:02:18
实体 Int8

Int8

PulseAugur coverage of Int8 — every cluster mentioning Int8 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
83
90 天内 83
发布 · 30天
0
90 天内 0
论文 · 30天
35
90 天内 35
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/5 页 · 共 90 条
  1. RESEARCH · CL_282923 ·

    新的量化方法提升大型语言模型效率和速度

    研究人员开发了新的混合精度量化方法,以提高大型语言模型(LLM)生成的效率。AlignQuant是一种训练后量化技术,它通过使用二维权重块作为精度分配、存储和执行的通用单元,使精度选择与GPU架构对齐。StagQ提出了一种多精度权重格式,使用2位分组仿射基数,并带有额外的精炼平面,为表示不佳的权重提供稀疏侧记录。这两种方法都旨在减小模型尺寸并提高生成速度,同时在各种LLM和硬件上保持模型质量。

  2. TOOL · CL_275318 ·

    新的矩阵乘法方法确保了大型语言模型的前缀不变性

    研究人员开发了低精度设置下快速矩阵乘法的新方法,特别解决了语言模型中的前缀不变性问题。标准的快速矩阵乘法技术会通过混合标记行来引入错误,从而损害前缀不变性——这是多项选择任务中准确计算似然得分的关键属性。研究表明,即使在看似准确的FP8实现中,OpenBookQA等基准测试中的模型答案也可能发生重大变化。为了解决这个问题,他们提出了经过认证的实现,保证与规定的整数运算符的比特级相等性,确保实现的选择不会改变得分的似然性,从而使决策纯粹基于成本。

  3. TOOL · CL_268871 ·

    新研究质疑量化下 AI 可解释性迁移指标

    arXiv 上的一篇新论文质疑了使用余弦相似度来衡量量化下可解释性伪影迁移有效性的有效性。作者认为,报告的统计数据缺乏正确解释所需的噪声基底信息。他们提出了一种测量此噪声基底的方法,并在 Qwen2.5-1.5B-Instruct 上进行了演示,发现在 INT4 量化下,可解释性伪影的方向实际上会旋转,这一发现被标准的报告实践所掩盖。该论文还强调,尺度不变统计量无法区分迁移的决策变量的平移和衰减,并建议了替代的报告建议。

  4. TOOL · CL_257113 ·

    INT8 量化可移植性研究揭示硬件间的不一致性

    一项新研究挑战了 INT8 量化在不同硬件平台之间可普遍用于人工智能推理的假设。研究人员发现,INT8 的加速效果在很大程度上取决于特定的 CPU 指令集,某些硬件甚至出现了性能下降而非加速。此外,INT8 的输出在不同平台之间并不一致,当量化比例不是硬件原生支持时,会导致准确性下降。研究得出结论,对于确定性和准确性至关重要的嵌入式和汽车应用而言,“一次量化,随处部署”的方法并不可靠。

  5. MEME · CL_256558 ·

    寻求用于本地 LLM 部署的 GPU 租赁建议

    一位用户在 r/LocalLLaMA 子版块上寻求 GPU 租赁建议,以支持私有化部署 38 亿至 270 亿参数的模型,并特别询问了 int4 和 int8 量化选项。

  6. RESEARCH · CL_254304 ·

    新研究揭示了针对 LLM 代理的强效后门攻击方法

    两篇新研究论文探讨了大语言模型 (LLM) 代理的漏洞,重点关注后门攻击。第一篇论文 AGENTQ 介绍了一种创建攻击的方法,即使在量化(LLM 代理的常见部署步骤)后也有效。该方法在保持代理的良性功能的同时,确保量化模型中触发恶意行为,攻击成功率高达 100%。第二篇论文 SAILS 解决了后门攻击中毒数据选择的问题,证明了中毒样本的选择对攻击成功率有显著影响。SAILS 学习选择更有效的毒药集,提高了攻击成功率,并可迁移到各种 L…

  7. TOOL · CL_249769 ·

    INT8 量化使 TinyML 心电图模型缩小 60%

    一项实验探索了 INT8 量化对用于心律失常检测的 TinyML 模型的影响。通过将数值精度从 32 位浮点 (FP32) 降低到 8 位整数 (INT8),模型尺寸显著减小。这种压缩使得模型尺寸从 87.5 KB 减少到 34.6 KB,缩小了约 60%,同时实验旨在评估在不可接受的权衡出现之前,性能可以牺牲多少。

  8. TOOL · CL_247327 ·

    嵌入表精度是减小LLM规模的关键

    一项近期实验探索了量化对Transformer模型的影响,发现嵌入表占模型参数的很大一部分(72%)。研究发现,独立量化嵌入表,特别是使用逐行缩放,可以在性能损失极小的情况下大幅减少字节数。这种方法可以将模型尺寸减小6.2倍,同时通过将释放的字节重新分配给计数表和缓存来维持甚至提高系统级性能。

  9. COMMENTARY · CL_242239 ·

    开发者发现关键的 LLM 配置标志是无效代码

    一位开发者发现,一个被广泛分享的环境变量 `GGML_CUDA_FORCE_MMQ=1`,本意是优化 Pascal GPU(如 Tesla P40)的性能,实际上是无效代码。这个变量在社区指南中经常被引用,被认为可以通过 dp4a 指令启用 INT8 矩阵乘法,但底层的 `llama.cpp` 代码在 Pascal GPU 上无条件选择了 MMQ 内核。开发者强调了通过阅读源代码来验证配置标志的重要性,因为仅凭基准测试无法揭示该变量与…

  10. TOOL · CL_241178 ·

    Ultralytics 发布 YOLO26 v8.4.143,支持 INT8 量化

    Ultralytics 发布了其 YOLO26 模型 8.4.143 版本,该版本现已包含 INT8 量化感知训练。此次更新还改进了部署和评估流程,并全面更新了其文档和集成。

  11. TOOL · CL_233533 ·

    新的FORGE方法实现了面向微控制器上纯整数视觉模型的测试时自适应

    研究人员开发了FORGE,这是一种新颖的正向测试时自适应方法,专门为在微控制器上运行的纯整数视觉模型设计。该方法通过仅使用前向传播估计来重新归一化折叠的卷积层,解决了在没有通常所需的反向传播机制的情况下将模型适应现实世界分布偏移的挑战。FORGE展示了显著的准确性提升,恢复了基于梯度的方法的大部分优势,并且足够高效,可以以最小的能源和时间成本部署在ESP32-S3等微控制器上。

  12. COMMENTARY · CL_231189 ·

    LLM爱好者质疑为何在RTX 3090支持下,INT8 W8A8模型采用率不高

    Reddit上的一项讨论探讨了为什么INT8 W8A8模型在LLM爱好者中不那么普遍,尽管RTX 3090是一款流行的GPU,拥有原生INT8张量核心,可以提供性能优势。用户推测了这一趋势背后的原因,质疑为何FP8或更小的量化格式通常更受欢迎。

  13. TOOL · CL_233722 ·

    新框架进化出适应性算术电路以提高AI效率

    研究人员开发了CircuitsDNA,一个新颖的进化框架,旨在自动创建能够动态调整其精度的算术电路以提高效率。该系统集成了多阈值可验证性、资源受限搜索和自适应突变,以探索广泛的电路设计。在28纳米CMOS中的实验表明,8位乘法器的面积-功耗积显著降低,在INT8 DNN工作负载上节省高达56%,同时相对于FP32的精度损失最小。

  14. RESEARCH · CL_229268 ·

    新研究探索用于高效AI模型部署的量化技术

    两篇新研究论文探讨了优化大型语言模型(LLMs)和边缘视觉模型以在资源受限硬件上部署的方法。第一篇论文是对量化感知训练(QAT)的调查,回顾了用于减小LLM内存占用和计算需求的理论基础和实现格局。第二篇论文介绍了SCULPT,一种训练时方法,通过抑制量化不兼容的激活分布并学习可部署的裁剪边界,增强了边缘视觉模型训练后的量化就绪性。

  15. TOOL · CL_229145 ·

    研究发现:KV缓存量化会降低RAG系统的忠诚度

    arXiv上的一篇新研究论文调查了KV缓存量化对检索增强生成(RAG)系统的影响。研究发现,虽然INT8量化对忠诚度的影响很小,但INT4量化会显著降低忠诚度,即使对于事实正确的答案也是如此。这种降低通常会被标准的准确性指标所忽略,并且在检索噪声较大或上下文窗口较大时会加剧,这凸显了在部署压缩缓存之前进行专门忠诚度审计的必要性。

  16. TOOL · CL_227089 ·

    DAMP新技术大幅降低LLM内存使用并提升速度

    研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…

  17. TOOL · CL_227055 ·

    新研究揭示了量化触发的LLM后门

    一篇新研究论文详细介绍了一种大型语言模型(LLM)中的安全漏洞,即后门可以通过训练后量化触发。该研究通过量化行为等价类(QBECs)形式化了这个问题,证明了通过源精度检查的模型在压缩为INT8或4位等格式后会表现出恶意行为。研究显示了显著的对抗性影响,例如机器翻译中的高损坏率和内容分析中的意识形态转变,凸显了在可信边缘AI的行为认证中包含最终部署配置的必要性。

  18. TOOL · CL_225435 ·

    新的 ComfyUI 节点支持 SAM3 模型 INT8 量化,节省存储空间

    一位开发者创建了支持 SAM3 和 SAM3.1 模型 ConvRot INT8 量化的 ComfyUI 节点。通过将模型权重保持在 8 位精度,此优化显著减少了存储空间和 VRAM 使用量。该解决方案包括一个加载器节点和一个检测器节点,它们利用具有在线激活旋转的高速 INT8 内核,同时还为未对齐的层提供自动回退保护。

  19. TOOL · CL_224503 ·

    Sage Attention 2.2:BF16 对比 INT8 Convrot 性能比较

    在 Sage Attention 2.2 模型中,对两种数值精度格式 bfloat16 和 INT8 进行了比较。评估侧重于它们在 ConvRot(一种特定类型的卷积)上的性能,使用了 25 个步骤和 res_multistep 设置。结果通过未压缩的视频质量比较呈现,需要下载才能进行全面评估。

  20. MEME · CL_222384 ·

    StableDiffusion 用户将 Minimax 模型质量与 pruned 和 Int8 变体进行比较

    一位 Reddit 用户正在询问 StableDiffusion 生态系统中 Minimax 模型与其他版本(特别是 pruned 和 Int8 变体)之间的质量差异。讨论旨在了解这些不同模型配置的性能和输出质量。