PulseAugur
中
实时 22:15:11
实体 bfloat16

bfloat16

PulseAugur coverage of bfloat16 — every cluster mentioning bfloat16 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
95
90 天内 95
发布 · 30天
0
90 天内 0
论文 · 30天
45
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/6 页 · 共 102 条
  1. TOOL · CL_286820 ·

    新研究揭示文本分类器中的服务上下文非确定性

    一篇新发表在arXiv上的研究调查了文本分类器中的非确定性,发现即使模型和输入文本保持不变,批次大小、硬件和推理引擎等因素也会改变预测结果。研究人员发现,虽然标签可能不会改变,但预测的概率质量会发生显著变化,尤其是在bfloat16精度下。研究强调,与判别式分类器相比,全生成式分类器更容易受到这些变化的影响,并提出了可复现文本分类的具体缓解策略。

  2. COMMENTARY · CL_282242 ·

    FP8量化成本节省因模型输出问题而产生误导

    一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。

  3. RESEARCH · CL_284559 ·

    TRACE框架为混合专家语言模型的FP4量化提供更快速度

    研究人员开发了TRACE,一种用于混合专家(MoE)语言模型使用FP4精度进行量化感知训练的新型框架。该方法通过使用滚动(rollout)侧的量化结果来指导训练侧的舍入决策,直接减小了训练和滚动路径之间的差异。TRACE还采用了一种高效的量化信息缓存方案,减少了存储和通信开销。评估表明,TRACE在滚动生成方面实现了高达5.4倍的速度提升,性能与BF16滚动相当。

  4. RESEARCH · CL_284443 ·

    NeMo-DCR 将万亿参数模型更新速度提升 35 倍

    研究人员开发了 NeMo-DCR,一种用于在智能体强化学习中高效更新万亿参数模型的新颖方法。该技术仅发送更改的权重,实现了训练和回放集群之间的比特精确同步。NeMo-DCR 将模型重构所需的时间从一个多小时大大缩短到几分钟,使大规模智能体强化学习更加实用。

  5. RESEARCH · CL_282923 ·

    新的量化方法提升大型语言模型效率和速度

    研究人员开发了新的混合精度量化方法,以提高大型语言模型(LLM)生成的效率。AlignQuant是一种训练后量化技术,它通过使用二维权重块作为精度分配、存储和执行的通用单元,使精度选择与GPU架构对齐。StagQ提出了一种多精度权重格式,使用2位分组仿射基数,并带有额外的精炼平面,为表示不佳的权重提供稀疏侧记录。这两种方法都旨在减小模型尺寸并提高生成速度,同时在各种LLM和硬件上保持模型质量。

  6. TOOL · CL_279805 ·

    llama.cpp 项目发布预发布更新,包含性能优化

    llama.cpp 项目发布了多个预发布更新,包括对 MoE expert 的 GPU 缓存管理改进、针对 Apple Silicon 的各种量化类型的优化,以及对 Metal fusion 操作的修复。这些更新还解决了 temperature-zero chains 的采样逻辑,并引入了新的词汇 token。这些发布涵盖了 macOS、iOS、Linux、Android 和 Windows 等广泛平台,并针对 Apple Silic…

  7. TOOL · CL_277186 ·

    新的FP4融合技术加速LLM预训练,性能优于bfloat16

    研究人员开发了一种名为“面向格式的融合”(format-aware fusion)的新技术,利用四位浮点数(FP4)精度来加速大型语言模型的预训练。该方法优化了量化生产者和消费者的交互,与标准的bfloat16和Transformer Engine方法相比,实现了显著的速度提升。在Llama-3-family 8B预训练上的评估表明,优化的FP4路径可以实现更高的tokens/s/GPU,同时保持具有竞争力的甚至有所改善的训练损失终点…

  8. TOOL · CL_276502 ·

    Google's Gemma 4 models repacked for enhanced performance on single TPU v5e

    一份技术指南详细介绍了如何重新打包Google的量化感知训练(QAT)Gemma 4模型,以提高在单个Google Cloud TPU v5e芯片上的性能。重新打包后的模型,特别是12B参数版本,与bfloat16版本相比,在吞吐量和准确性方面具有竞争力,其中12B模型成为能装入该芯片的最大模型。这种优化允许在单个TPU v5e上部署各种大小的Gemma 4模型,从E2B到26B,为高效部署这些模型提供了一种实用的方法。

  9. TOOL · CL_275318 ·

    新的矩阵乘法方法确保了大型语言模型的前缀不变性

    研究人员开发了低精度设置下快速矩阵乘法的新方法,特别解决了语言模型中的前缀不变性问题。标准的快速矩阵乘法技术会通过混合标记行来引入错误,从而损害前缀不变性——这是多项选择任务中准确计算似然得分的关键属性。研究表明,即使在看似准确的FP8实现中,OpenBookQA等基准测试中的模型答案也可能发生重大变化。为了解决这个问题,他们提出了经过认证的实现,保证与规定的整数运算符的比特级相等性,确保实现的选择不会改变得分的似然性,从而使决策纯粹基于成本。

  10. TOOL · CL_268915 ·

    新研究详细介绍了循环 Transformer 中的量化失败

    研究人员在循环 Transformer 的训练后量化 (PTQ) 中识别出两种关键的失败模式,这些 Transformer 在递归步骤中重用权重。第一种称为“反馈暴露”,当量化层在没有恒等路径的情况下扰乱递归状态时发生,导致错误放大。第二种“校准盲目性”源于量化方法,这些方法基于初始激活值进行计算,而忽略了递归中的后续状态。在 Huginn-3.5B 和 Mamba 等模型上的实验证明了这些问题,而跨递归步骤累积 Hessian 的解…

  11. RESEARCH · CL_267282 ·

    新研究探索通过射频广播和稀疏性技术实现高效LLM推理

    研究人员正在开发新颖的方法来提高大型语言模型(LLM)推理的效率。一种方法AIR-LLM提出通过射频广播LLM权重,使边缘设备无需存储权重即可进行推理,从而显著降低能耗和通信时长。其他研究则侧重于通过稀疏性技术优化推理,例如SparseEngine和TopK-Guided,它们通过选择性地处理模型的一部分来降低内存和计算成本。此外,正在开发MINCE和evalstats等新框架,通过缩小数据集和提高LLM评判分数统计分析的可靠性来简化LLM评估。

  12. RESEARCH · CL_268155 ·

    新研究探索LLM的高级量化技术 · 已追踪10个来源

    多篇研究论文介绍了量化大型语言模型(LLMs)的新技术,以减少其计算和内存占用。这些方法旨在提高效率,同时不显著牺牲性能。方法包括激活量化的优化旋转、面向量化感知训练的最小范数优化,以及用于部署对齐的量化感知蒸馏框架。其他研究侧重于超低复杂度反量化、重新思考优化损失尺度以及量化的联合交替细化,所有这些都有助于使LLMs更易于访问和更高效。

  13. TOOL · CL_257643 ·

    AI模型定价在OpenRouter上差异巨大,最高相差14倍

    对OpenRouter平台的新分析显示,相同的AI模型存在显著的价格差异,根据提供服务的供应商不同,成本最高可达14倍。这些价格差异源于模型精度(例如fp4 vs. bfloat16)、供应商正常运行时间保证以及数据驻留政策等因素,而这些因素仅凭模型名称无法清晰体现。研究还强调了延迟测量和韩语输出质量方面的问题,并指出标准基准测试无法预测在细微语言任务上的表现。

  14. TOOL · CL_254034 ·

    7名博士生利用数百个AI代理从零开始训练7B大语言模型

    北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。

  15. RESEARCH · CL_254347 ·

    新的投机式解码方法提高了LLM推理速度 · 跟踪7个来源

    研究人员正在推进大型语言模型的投机式解码技术,以提高推理速度。两篇新的arXiv论文,ECHO和LoopSpec,分别引入了分层和流水线方法来优化草稿候选生成和验证。ECHO使用早期层奖励logits进行快速草稿探索,而LoopSpec则利用循环Transformer中的中间状态进行流水线草稿生成。另一篇关于Orthrus的论文质疑了投机式解码的“无损”声明,强调了数值精度对输出一致性的影响,而另一项关于Carryover Draft…

  16. SIGNIFICANT · CL_248600 ·

    Cohere 发布 218B MoE 翻译模型,North Small Translate

    Cohere 悄然发布了 North Small Translate,这是一款拥有 2180 亿参数的混合专家(MoE)模型,专为机器翻译而设计。该稀疏模型每个 token 有 250 亿活跃参数,支持 50 种语言,并为翻译质量树立了新标杆,在 WMT26 上取得了 83.60 的分数。该模型的权重可在 Hugging Face 上用于研究和非商业用途,而生产部署则通过 Cohere 的 Model Vault 进行。此次发布标志着…

  17. TOOL · CL_247253 ·

    RunningHub通过开源优化将MiniMax H3视频模型加速12倍

    RunningHub开发了一种名为H3 Lightning的开源优化技术,显著加速了MiniMax H3人工智能视频生成模型。该新方法可将视频生成速度提高高达12倍,将生成一个5秒视频的时间从近6分钟缩短到多GPU设置下的28.7秒。该优化通过减少计算步骤、使用SageAttention2和Cache-DiT等技术改进核心计算,并优化多GPU通信来实现,同时保持BF16精度并针对常见的企业硬件配置。

  18. TOOL · CL_244950 ·

    新框架实现 LLM 的真正 1 位量化

    研究人员开发了一个名为 All for 1-Bit (AF1) 的新颖框架,以实现大型语言模型 (LLM) 的真正 1 位训练后量化。AF1 通过结合零空间感知二值分解 (NABF) 和分层 Shapley 分配 (HiSA) 来解决现有二值化方法超出标称 1 位存储目标的问题。在 LLaMA、Qwen 和 Gemma 等模型上的实验表明,AF1 在困惑度和准确性方面显著优于其他基于二值化的 PTQ 方法,同时与 bfloat16 相…

  19. TOOL · CL_242571 ·

    StableDiffusion 用户比较 FLUX.2-Dev 中的文本编码器精度

    Reddit 的 r/StableDiffusion 子版块上一位用户分享了他们使用 FLUX.2-Dev 测试文本编码器精度对图像生成影响的经验。他们比较了 bfloat16 (bf16) 和 8 位浮点 (fp8) 精度,并指出了模型大小和 VRAM 使用方面的显著差异。与近期取得的进展相比,该用户质疑 FLUX.2-Dev 庞大的占用空间和有限的社区支持是否仍然具有相关性。

  20. TOOL · CL_242361 ·

    Cohere 发布采用“巨型内核”架构的新 LLM 服务系统

    Cohere 推出了一个围绕“巨型内核”架构构建的新 LLM 服务系统,该系统将整个 LLM 解码步骤融合到一次内核启动中。这项创新旨在最大限度地提高 GPU 利用率并提高性能。该系统名为 North Mini Code,据报道在某些基准测试中比 vLLM 的性能快 1.58 倍,并且是完全开源的。