FLASH
PulseAugur coverage of FLASH — every cluster mentioning FLASH across labs, papers, and developer communities, ranked by signal.
- developed DSpark 90%
- used by DSpark 70%
- used by Multi Token Prediction 70%
- instance of Multi Token Prediction 70%
- competes with DSpark 70%
- instance of Flash Lite Model 70%
- uses Multi Token Prediction 70%
- competes with HCL Domino 50%
- competes with Eagle3 50%
- used by Eagle3 50%
- competes with Multi Token Prediction 50%
- developed Gotit.pub 50%
10 天有情绪数据
-
LM Studio通过DFlash、DSpark和MTP优化本地AI推理
LM Studio是一款免费的本地运行大型语言模型的应用程序,现已宣布对推理速度进行优化。此次更新包括对DFlash、DSpark和多令牌预测(MTP)技术的支持,旨在提高AI模型在用户硬件上的处理速度。
-
新研究量化了区块草稿AI中的模型差距
一篇新研究论文引入了“信息底线”的概念,以更好地评估区块草稿模型,这些模型在早期标记最终确定之前同时提出多个标记。研究发现,即使是表现最好的模型,如Qwen3-4B,也存在限制其接受率的信息底线。仅实现一个标记就显著降低了这一底线,表明了短距离条件的重要性。研究还强调了一个巨大的“模型差距”,即当前的草稿模型表现远低于其理论底线,这表明其提案质量有改进的空间。
-
TANGO模型引入了新颖的门控算子用于语言建模
研究人员推出了一种新颖的语言建模架构TANGO,该架构通过非线性门控算子聚合令牌信息。该方法用单个跨令牌门控残差更新取代了标准的Transformer组件。其变体WANGO通过处理最近的窗口并使用旧数据的前缀统计信息,提供了线性复杂度。尽管TANGO的操作次数较高,但TANGO和WANGO在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试上的表现均优于其他模型。
-
开发者证明单次LLM基准测试运行毫无意义
一位开发者在构建一个名为NexaVerify的多LLM安全审计工具时发现,单次基准测试运行不足以获得可靠的结果。对同一安全审计运行12次后,显示出显著的差异,其中一个LLM配置的F1分数在0.29到0.54之间剧烈波动。虽然像Llama这样单个表现良好的LLM比共识管道获得了更高的平均F1分数,但管道在稳定性、更广泛的漏洞覆盖范围和审计目的的可追溯性方面提供了关键优势。
-
GRAFT 框架通过新的评分和预算分配提升 DLM 预测解码
研究人员推出 GRAFT,一个旨在增强扩散语言模型(DLM)中预测解码的新框架。GRAFT 采用目标蒸馏边评分(TDES)从目标模型轨迹中学习父子兼容性偏好,确保草稿树中更准确的边选择。此外,它利用状态感知预算分配(SABA)根据解码状态动态调整树预算,平衡草稿增益与验证成本。该方法已证明能显著提速,比自回归方法快 2.13 倍至 6.36 倍,且开销极小。
-
新研究探索用于大型语言模型推测性解码的并行草稿
两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。
-
Muse Glimmer 支持在消费级 GPU 上进行本地 AI 编码代理开发
Muse Glimmer 是一款新的开源工具,支持在本地开发 AI 编码代理。它利用了 llama.cpp、DFlash 推测解码和 Raspberry Pi 等技术。该工具设计用于在消费级 GPU(如 RTX 3090)上运行,使个人电脑也能实现代理式 AI。
-
社区讨论 Qwen 3.8-27B 模型技术细节
Reddit 的 r/LocalLLaMA 社区正在讨论即将发布的 Qwen 3.8-27B 模型的技术规格。用户们正在争论该模型将采用多令牌预测 (MTP) 还是 DFlash 头部,其中一位用户指出,采用 MTP 的 3.6 27B 版本在其系统上实现了大约 8 tokens/秒的性能。尽管与更大模型相比可能存在性能限制,但对新发布的期待显而易见。
-
Muse Glimmer 30B 模型针对 24GB GPU 和 256K 上下文进行了优化
一位开发者成功优化了 Muse Glimmer 30B 模型,使其能够在单个 24GB GPU 上以 256K 的上下文窗口运行。这项利用 DFlash 技术的优化显著提高了性能,在 DFlash 代码生成方面达到了 84.64 tokens/sec,在混合代理工作方面达到了 38.34 tokens/sec。开发者指出,最快或最低困惑度的量化并未产生最佳结果,这表明在使用推测解码时,令牌吞吐量受到可预测性的影响。
-
DFlash 技术通过推测性解码重新定义了 LLM 吞吐量指标
一种名为 DFlash 的新技术,已集成到 llama.cpp 框架中,它显著改变了大型语言模型每秒词元数的衡量方式。通过使用一个轻量级的草稿模型并行提出候选词元,并使用一个昂贵的自回归模型进行验证,DFlash 可以将验证成本分摊到多个词元上。这种方法在 Meta Muse Glimmer 30B 模型上进行编码任务时实现了 4.50 倍的加速,达到了每秒 80.87 个词元,尽管在散文和推理等混合工作负载上的性能有所下降。
-
NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源
NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark …
-
Muse Glimmer 30B 在 vLLM 上实现投机式解码需要 6 个补丁
一位用户详细介绍了在 vLLM 上使用 Muse Glimmer 30B 模型启用投机式解码所需的六个补丁。这些补丁解决了与模型命名、词汇表大小和滑动窗口的配置默认值、张量重命名以及对模型包装器结构的假设相关的问题。用户还发现单 GPU 设置的默认序列数量存在配置问题,需要进行调整以防止错误。
-
新方法通过推测解码加速大语言模型推理 · 跟踪 7 个来源
研究人员正在开发新的方法,通过推测解码来加速大语言模型(LLM)的推理速度。DARTree 和 SPADE 是两种此类方法,其中 DARTree 专注于基于树的推测解码,以提高接受长度和加速效果,而 SPADE 则将推测解码集成到边缘和云设备中,以降低成本和延迟。其他相关工作包括 MemSpec,它针对内存受限的边缘设备优化自适应推测解码,以及 Goose,它使用各向异性推测树来提高效率。这些进展旨在使大语言模型的部署更加实用和经济高效。
-
Muse-Glimmer 30B 借助 DFlash 推测解码实现 287 t/s
Muse-Glimmer 30B 模型与 DFlash 推测解码结合后,在实际编码任务中取得了令人印象深刻的性能指标。该模型在配备 llama.cpp 的单个 RTX 5090 GPU 上运行,生成速度高达每秒 287 个 token,在 IDE 补全方面的平均速度约为每秒 173 个 token。提示处理也显示出强劲的性能,大约 5.35 秒内处理了 14.3k 个 token,草稿接受率平均为 82.3%,表明了高效的多 token 接受率。
-
Glimmer LLM 在 5090 GPU 上实现 233.4 tps,达到 256k 上下文
一款名为 Glimmer 的新模型展示了令人印象深刻的性能,在配备 Dflash 的 5090 GPU 上实现了 233.4 tps。用户报告称,Glimmer 可以在 24GB VRAM 上轻松达到 256k 的上下文窗口,这是 Qwen 等模型难以实现的壮举。这一发展在本地 LLM 社区中引起了极大的兴奋。
-
Meta 的 Muse Glimmer 30B 模型将强大的 AI 代理引入消费级 GPU
Meta 发布了 Muse Glimmer,一个拥有 300 亿参数的开放权重模型,针对本地 AI 代理工作流进行了优化,能够运行在单个消费级 GPU 上。该模型以 Apache 2.0 许可发布,在代理基准测试中表现出竞争力,并专为始终在线、设备端运行而设计,减少了对云基础设施的依赖。NVIDIA 已就其硬件上的 Muse Glimmer 部署提供指导,强调了其在隐私敏感应用和降低运营成本方面的潜力。
-
Meta发布开源多模态模型Muse Glimmer
Meta发布了Muse Glimmer,一个开源、多模态、代理式的大型语言模型。该模型拥有300亿参数架构,包括一个20亿参数的视觉编码器和一个280亿参数的文本解码器。Muse Glimmer支持本地部署,并与transformers、llama.cpp和vLLM等各种库集成,提供零日支持。
-
Reddit 用户称 Anthropic 的 Opus 模型毫无价值
一位 Reddit 用户对 Anthropic 的 Opus 模型表示强烈不满,认为它“毫无价值”,甚至不如 DeepSeek 的 FLASH 模型。该用户是一位订阅者,已向 Anthropic 的 Dario Amodei 申请退款。
-
AI基础设施演进,整合存储以支持LLM推理
AI基础设施的格局正从仅关注GPU计算转向更一体化的方法,涉及计算、网络、内存和存储。这种演变是由具有长上下文和复杂推理能力的大型语言模型(LLMs)的需求驱动的,其中KV缓存和MoE专家权重等数据的有效管理变得至关重要。Moonshot AI及其Mooncake系统和NVIDIA及其CMX平台等公司正在引领这一趋势,将推理状态视为一等资源,并优化存储以实时参与token生成。
-
在巴巴多斯报纸上训练的AI模型在本地语境识别方面显示出潜力
研究人员正在探索领域自适应预训练,以提高音频模型在特定地区的准确性,并以巴巴多斯为例。通过在大量巴巴多斯报纸档案语料库上训练Qwen3-Omni模型,目标是让模型能够理解本地语境,例如标准模型经常识别错误的地点名称、机构和文化活动。虽然初步结果显示在提高本地实体知识探测得分方面有希望,但对实际音频转录准确性的影响仍在调查中。