PulseAugur
中
实时 05:44:18
实体 Fp8

Fp8

PulseAugur coverage of Fp8 — every cluster mentioning Fp8 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
77
90 天内 77
发布 · 30天
0
90 天内 0
论文 · 30天
25
90 天内 25
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/5 页 · 共 86 条
  1. COMMENTARY · CL_282242 ·

    FP8量化成本节省因模型输出问题而产生误导

    一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。

  2. TOOL · CL_275318 ·

    新的矩阵乘法方法确保了大型语言模型的前缀不变性

    研究人员开发了低精度设置下快速矩阵乘法的新方法,特别解决了语言模型中的前缀不变性问题。标准的快速矩阵乘法技术会通过混合标记行来引入错误,从而损害前缀不变性——这是多项选择任务中准确计算似然得分的关键属性。研究表明,即使在看似准确的FP8实现中,OpenBookQA等基准测试中的模型答案也可能发生重大变化。为了解决这个问题,他们提出了经过认证的实现,保证与规定的整数运算符的比特级相等性,确保实现的选择不会改变得分的似然性,从而使决策纯粹基于成本。

  3. RESEARCH · CL_259129 ·

    LLM推理优化研究详解成本-质量-延迟权衡 · 跟踪2个来源

    两篇新研究论文探讨了大型语言模型(LLM)推理优化技术的权衡,重点关注成本、质量和延迟。第一篇论文《推理工程帕累托图集》(The Inference Engineering Pareto Atlas)分析了不同GPU上Qwen2.5-7B-Instruct的各种配置,发现组合优化方法比单独使用更有效。该论文强调,FP8权重在准确性和延迟之间提供了良好的平衡,而朴素的FP8 KV缓存则是有害的。第二篇论文《一种用于衡量推理优化如何影响输…

  4. TOOL · CL_256316 ·

    NVIDIA 发布 cuDNN Graph API,用于优化 AI 计算图

    NVIDIA 推出了 cuDNN Graph API,这是其 cuDNN Frontend 中的一项新功能,允许开发者将计算定义为操作图。该 API 使 cuDNN 能够自动选择和优化这些图的执行引擎,并结合融合、自动调优和计划重用等技术。本教程通过构建和执行融合卷积、探索不同配置下的自动调优,以及集成 FP8 支持和 CUDA 图捕获等功能,演示了如何使用此 API,并与 PyTorch 的结果进行了验证。

  5. TOOL · CL_254034 ·

    7名博士生利用数百个AI代理从零开始训练7B大语言模型

    北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。

  6. TOOL · CL_252110 ·

    新的注意力量化加速表格基础模型

    研究人员为表格基础模型开发了一种新的注意力量化策略,以提高推理性能。该方法侧重于将查询、键和值量化为 FP8,并利用显式的 FP8 矩阵乘法指令。一项关键发现是,必须在训练和测试数据之间对齐量化误差,以防止精度下降。开发的 Triton 内核在标准 16 位内核上实现了高达 1.7 倍的加速,同时在 TabPFN-v3 和 TabICLv2 等模型在基准数据集上的表现没有显著的精度损失。

  7. RESEARCH · CL_254129 ·

    开源ZGCM-1模型在数学和智能体搜索方面实现高效率

    研究人员推出ZGCM-1,一个为数学推理和智能体搜索设计的7B参数基础模型。该模型利用了一种高效的训练方法,结合了交错注意力等架构创新、稳定的FP8 Muon优化器以及渐进式课程学习。ZGCM-1在特定任务上展现出与更大规模前沿模型相媲美的性能,并在训练时间上提供了显著的效率提升。

  8. TOOL · CL_247090 ·

    Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens

    Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…

  9. SIGNIFICANT · CL_242611 ·

    NVIDIA 为 Blackwell 系统发布 GLM-5.3-Flash 和 Qwen3.8-27B

    NVIDIA 发布了两款针对其 Blackwell 系统优化的新模型:GLM-5.3-Flash 和 Qwen3.8-27B。GLM-5.3-Flash 是一个 320B 参数的 MoE 模型,拥有 18B 激活参数,支持多模态任务和 1M 上下文窗口,并采用 MIT 许可证发布。Qwen3.8-27B 是一个 27B 参数的模型,提供 NVFP4/FP8 量化版本,在代理和多模态任务上实现了接近 BF16 的精度,拥有 262K 上…

  10. TOOL · CL_242571 ·

    StableDiffusion 用户比较 FLUX.2-Dev 中的文本编码器精度

    Reddit 的 r/StableDiffusion 子版块上一位用户分享了他们使用 FLUX.2-Dev 测试文本编码器精度对图像生成影响的经验。他们比较了 bfloat16 (bf16) 和 8 位浮点 (fp8) 精度,并指出了模型大小和 VRAM 使用方面的显著差异。与近期取得的进展相比,该用户质疑 FLUX.2-Dev 庞大的占用空间和有限的社区支持是否仍然具有相关性。

  11. RESEARCH · CL_235593 ·

    新的 FlashAttention-4 方法在 Blackwell 硬件上提升了 FP4 性能

    研究人员开发了一种名为 Direct-P 的新方法,用于优化 FlashAttention-4 在 Blackwell 的 4 位浮点 (FP4) 张量核心上的性能,解决了由 softmax 转换和片上依赖引起的性能瓶颈。对于非因果推理,Direct-P 将分数直接映射到 FP4 概率,在 NVIDIA GB200 硬件上实现了高达 bfloat16 2.13 倍的吞吐量。因果训练路径通过 FP8 梯度操作数重建概率,将 80 亿参数…

  12. TOOL · CL_231186 ·

    Qwen3.8 27B模型通过新的MXFP4优化达到280 tok/s

    一位开发者通过在双R9700 GPU上实现MXFP4内核,显著提升了Qwen3.8 27B模型的性能。据报道,这项利用W4A8量化的优化已经超越了FP8的性能,并将硬件推向了极限。该开发者已开源其工作,促进了社区协作和该领域的进一步发展。

  13. TOOL · CL_228715 ·

    A.X K2 语言模型发布,拥有 6880 亿参数并专注于智能体应用

    一份新的技术报告介绍了 A.X K2,一个拥有 6880 亿参数的混合专家(MoE)语言模型,专为智能体应用而设计。尽管其训练的 token 数量少于其前身 A.X K1,但由于 token 效率的提高和更高质量的训练数据集,A.X K2 在各种基准测试中表现出显著的改进。该模型采用了稀疏门控注意力(SGA)等创新技术,以实现高效的长上下文处理,并采用了门控归一化(GN)技术以实现稳定的大规模训练,在 RULER 和数学任务等基准测试…

  14. TOOL · CL_228652 ·

    LinkedIn 推出新的用于语义搜索的 GPU 检索

    研究人员在 LinkedIn 上开发了一种新的语义搜索检索框架,旨在提高用户个人资料建议的相关性。该系统将嵌入分割为八个类别监督段,从而能够更精确地匹配用户查询和相关个人资料。该方法采用 FP8 和 FP16 精度的两阶段 GPU 架构实现,显著提高了检索效率和准确性。在 A/B 测试中,新框架分别在探索性和导航性查询的 Precision@10 和 Precision@1 方面取得了显著改进。

  15. FRONTIER RELEASE · CL_227419 ·

    DeepSeek 发布首个多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp

    DeepSeek 发布了其首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,该模型将视觉能力集成到其 V4-Flash 架构中。该新模型在多模态代理任务上提供了增强的性能,同时保持了可比的纯文本能力。它在 Hugging Face 上以 MIT 许可提供,支持 FP8 和 8 位量化,以降低本地推理的硬件要求。

  16. SIGNIFICANT · CL_220944 ·

    阿里巴巴 Qwen 团队宣布支持新架构,集成 TokenSpeed

    阿里巴巴 Qwen 团队宣布支持其新架构,包括 GDN + QSA、N-gram 嵌入和 FP8 精度。此支持由 lightseekorg 提供,后者为 TokenSpeed 提供了首日集成。公告还预告了 Qwen 4 即将进行的优化。

  17. SIGNIFICANT · CL_219953 ·

    Qwen3.8-Flash-Next-FP8 VLM 拥有 125B 参数和 Gated DeltaNet

    Qwen3.8-Flash-Next-FP8 是一个拥有 1250 亿参数的 VLM,它使用了 60 亿激活 MoE 单元和 Gated DeltaNet 架构。此 FP8 版本分布在 131 个 safetensors 分片中,并支持思考模式和代理控制等高级功能。

  18. TOOL · CL_218697 ·

    SGLang 错误导致 FP8 lm_head 模型无限重复

    SGLang 提交 5375babb 之前的版本中存在一个错误,在使用 FP8 lm_head 配置(例如 unsloth/Qwen3.8-27B-NVFP4)的模型时,会导致无限重复和空响应。此问题源于 SGLang 错误地处理 lm_head 组件,导致 logit 排名损坏。该问题在服务器启动时不会显现,唯一的迹象是在服务器加载日志中出现特定警告。该修复已于 2026 年 8 月 19 日合并到 SGLang 的主分支,但尚未包…

  19. RESEARCH · CL_217752 ·

    新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能

    研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…

  20. TOOL · CL_212932 ·

    Stable Diffusion 通过新的稀疏注意力后端获得速度提升

    一种名为稀疏注意力的 Stable Diffusion 注意力机制的新后端已被开发出来,它提供了性能改进和更低的 VRAM 使用量。通过 ComfyUI 的自定义节点可用的此优化,通过实现协同内存内剪枝和片上重计算,旨在将生成速度提高 5-20%。稀疏注意力的有效性和质量影响取决于其在扩散过程中的应用,早期步骤影响提示遵循度,后期步骤影响时间伪影。