Int8
PulseAugur coverage of Int8 — every cluster mentioning Int8 across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
Nexus 系统通过新颖的 KV 缓存拼接增强代理 LLM 的效率
研究人员开发了 Nexus 系统,旨在通过优化代理大型语言模型 (LLM) 处理工具模式和 KV 缓存的方式来提高其效率。Nexus 将工具路由与模式预填充解耦,使用语义查找缓冲区来选择工具,即使在工具数量很多的情况下也能保持高准确性。此外,它还采用了一种深度自适应方法,将 KV 缓存块拼接(splicing)到实时上下文中,修复由旋转位置嵌入相位漂移引起的注意力损坏,以确保输出保真度。
-
MiniMax-H3 模型针对 ComfyUI 进行了优化,支持 INT8 量化
一位用户发布了 MiniMax-H3 Pruned Ref-Delta Fused r1024 模型针对 ComfyUI 的优化版本。这些版本包含 INT8 量化以提高效率,并特别注意将某些权重保留为 BF16,以避免在完全 INT8 转换时遇到的内存分配失败。由于混合精度,INT8 版本更大,但成功完成了完全量化模型无法完成的复杂工作流。
-
Stable Diffusion 通过新的稀疏注意力后端获得速度提升
一种名为稀疏注意力的 Stable Diffusion 注意力机制的新后端已被开发出来,它提供了性能改进和更低的 VRAM 使用量。通过 ComfyUI 的自定义节点可用的此优化,通过实现协同内存内剪枝和片上重计算,旨在将生成速度提高 5-20%。稀疏注意力的有效性和质量影响取决于其在扩散过程中的应用,早期步骤影响提示遵循度,后期步骤影响时间伪影。
-
CAS Flux推出OmniMate AI数字员工,服务线下场景
CAS Flux推出了OmniMate,这是一款旨在增强线下服务场景的移动AI数字员工。该解决方案利用本地边缘智能,解决了服务大厅和展厅等实体场所面临的高人力成本、服务标准不一致以及高峰时段人员不足等挑战。OmniMate可作为多功能数字员工,能够胜任AI大堂经理、培训导师、客户获取主持人、会议助理等多种角色,同时通过其设备端处理能力确保数据隐私和低延迟。
-
Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU
Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…
-
阿里巴巴发布Qwen3.8-2.4T模型,Flag OS实现多芯片适配
阿里巴巴已开源其迄今为止最大、最强大的模型Qwen3.8-2.4T-A95B,该模型采用拥有2.4万亿参数的庞大MoE架构,其中包含950亿激活参数。此次发布伴随着Flag OS社区在九种不同AI芯片架构上实现了该模型的Day 0多芯片适配,这些芯片包括阿里巴巴T-Head、Nvidia及其他厂商的产品。Flag OS平台能够将前沿模型快速适配到多样化硬件上,显著缩短模型发布到多芯片可用所需的时间,并通过优化和量化技术延长现有AI计算资源的效用。
-
Nvidia Jetson DLA 核心在实时流水线中实现近乎零开销的分类
研究人员开发了一种新颖的五步方法,用于在 NVIDIA Jetson DLA 核心上部署分类模型,克服了严格的算子约束和量化不兼容性带来的挑战。该方法通过允许在 GPU 上并行执行检测模型,在 DLA 上并行执行分类模型,从而在实时检测流水线中实现近乎零的开销。该方法已在双头人员属性分类器上得到验证,证明了在不增加额外成本的情况下显著提高了性能。
-
AI模型通过量化和剪枝实现小型化以提高效率
量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。
-
手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速
一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…
-
MiniMax-H3 模型在本地使用六种优化栈进行基准测试
一位 Reddit 用户对 MiniMax-H3 模型进行了本地基准测试,在 INT8 构建上评估了六种不同的优化栈。MiniMax-H3 模型能够在单次前向传播中生成视频和 32 kHz 立体声音频,其完整权重总计 385 GB。基准测试涉及 28 个提示,生成了 168 个视频片段,所有这些都在单个 5090 GPU 上处理。用户已将结果和所有 168 个视频片段及其计时发布在一个专门的网页上,允许对片段质量进行盲选投票。
-
图像生成量化方法 H3 Int8 ConvRot 和 W4A8_mixed 产生相同的结果
对两种用于图像生成模型的量化方法 H3 Int8 ConvRot 和 W4A8_mixed 进行了比较。分析显示,在使用相同的种子、提示和分辨率时,两种方法产生了相同的结果。这表明在这些特定条件下,量化技术不会在输出中引入可察觉的差异。
-
阿里巴巴发布 Qwen3.8-27B 模型;AI 助力 GPU 移植;LLM 基础设施详解
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个拥有 270 亿参数的密集模型,可容纳在单个 GPU 上,并支持 100 万 token 的上下文窗口,在 vLLM 中实现了 Day-0 集成。同时,研究正在探索 AI 辅助的 GPU 移植技术,用于遗留科学应用程序,展示了显著的速度提升和数值验证。此外,还详细介绍了 LLM 的 GPU 基础设施的更广泛格局,涵盖了硬件选项和优化技术,如连续批处理和层流式处理,以最大…
-
Comfy添加Int8 ConvRot VAE支持,支持Minimax H3视频VAE转换
Kijai已在Comfy框架内引入了对Int8 ConvRot VAE的支持。此次更新包括Minimax H3视频VAE的转换,转换后的模型可在Hugging Face上获取。
-
开发者提出专用LLM架构用于实时字幕
一位名叫Lyra的开发者推测,通用大型语言模型在字幕翻译等专业任务上效率低下。通过实验,Lyra发现一个80亿参数的小模型,即使没有压缩,在关键字幕错误方面也比一个270亿参数的大模型表现更差。这表明模型容量,而非压缩,是瓶颈。Lyra提出,一个为字幕限制而设计的专用架构或“载体”,可以产生专业质量的实时翻译,解决当前AI和人工翻译在速度和准确性方面的局限性。
-
MiniMax-H3 和 H3 Healthcare 发布量化版 Qwen3-VL-32B-Heretic 模型
Qwen3-VL-32B-Heretic 模型的新量化版本现已发布,专门针对 MiniMax-H3 和 H3 Healthcare 的 Three Hop Index 文本编码器进行了优化。这些版本包括 NVFP4 量化和 INT8 ConvRot 变体,旨在适配内存较低的 GPU,例如单张 16 GB 显卡,从而提高高级视频生成的可用性。此次发布还提供了一个可选的提示增强尾部,以获得更详细的输出,并附有详细的安装和运行时验证说明。
-
MiniMax H3 模型已量化,可在消费级 GPU 上本地推理
Hugging Face 上的 Abiray 存储库提供了 MiniMax H3 模型的量化版本,针对消费级 GPU 上的本地推理进行了优化。这些集合包括用于扩散模型和文本编码器的各种格式,如 INT4、INT8 和 NVFP4,可满足从 16GB 到 24GB 及以上不同的 VRAM 容量。GGUF 版本提供了进一步的量化选项,以及用于多模态输入、高达 2K 的输出分辨率和音频生成的详细规格。
-
MiniMax H3 文本编码器发布,量化后可在 16GB GPU 上运行
MiniMax H3 文本编码器已量化至 NVFP4 发布,其大小显著小于原始的 26.4 GB,现在可以安装在单个 16 GB 显卡上。该模型使用 Qwen3-VL-32B 作为其文本编码器,并采用分体式 Transformer 架构。讨论表明,虽然较小的量化版本很常见,但它们可能会影响提示的准确性,而 FP8 混合版本提供了更好的平衡。
-
研究探讨小型文本到SQL模型的LoRA和量化权衡
arXiv上的一项新研究调查了在参数高效微调(PEFT)方法(如LoRA)和低比特量化之间进行文本到SQL任务的权衡,该任务针对一个小型、6000万参数的模型。研究发现,秩为16的LoRA可以在训练极少量参数并减少GPU内存使用量的同时,恢复显著的准确性。LoRA秩超过16后,准确性没有进一步提升。研究还表明,使用INT8和NF4量化的QLoRA在显著降低内存成本的情况下实现了相当的准确性,为内存受限的部署提供了一个可行的选择。
-
研究发现LoRA秩16是小型模型文本到SQL的最佳选择
一项针对6000万参数T5-small模型的研究,探讨了LoRA秩、目标模块和量化在文本到SQL任务上的权衡。研究发现,LoRA秩16可以在训练少于1%的参数并减少31%的峰值GPU内存的情况下恢复显著的准确性。秩超过16后,准确性没有进一步提高。研究还表明,使用INT8和NF4量化的QLoRA在显著降低内存成本的同时提供了相当的准确性,为内存受限的应用提供了一个可行的选择。
-
TRELLIS.2 INT8 ConvRot 模型通过 ComfyUI 在 AMD RX 7900 XTX 上原生运行
一位开发者发布了一个补丁套件,使 TRELLIS.2 INT8 ConvRot 模型能够通过 ComfyUI 在 AMD RX 7900 XTX GPU 上原生运行。该实现利用了融合的 Triton 内核以提高性能,与之前的方法相比,在某些操作中速度提高了 3.08 倍。该版本包含一个现成的 1024 工作流,并支持各种检查点路由选项,尽管纹理导出仍在开发中。