实体
FANCD2
FANCD2
PulseAugur coverage of FANCD2 — every cluster mentioning FANCD2 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新型 FP4 注意力内核将 B300 性能提升 1.69 倍
为 B300 开发了一套新的 FP4 注意力内核,与 FA4 相比,速度最高可提升 1.69 倍。此项进展旨在提高本地大型语言模型的性能。
-
Jet-Long 方法在无需重新训练的情况下提升了 LLM 的长上下文性能
研究人员推出了一种名为 Jet-Long 的新方法,可以在无需重新训练的情况下扩展大型语言模型的上下文窗口。这种无需微调、零样本的方法可以动态调整重缩放因子,以平衡短上下文的保真度和长上下文的外插性。Jet-Long 集成了包含-排除注意力合并和即时 RoPE 校正,从而在 NVIDIA H100 等硬件上实现了最小的推理开销和更高的吞吐量。
-
新的推测解码方法提高了 LLM 推理速度和安全性
研究人员正在开发先进的推测解码技术,以加速大型语言模型推理。HyperDFlash 针对 DeepSeek-V4 的多超连接架构优化了解码,提高了草稿的准确性和速度。Dustin 通过识别关键标记并减少重新计算来专注于高效的长上下文生成。同时,TAIS 对推测解码的输出进行安全性不变性筛选,发现在温度为零时没有分歧。JetSpec 和 RLM-Cascade 通过结合草稿策略并在响应级别应用推测解码来实现高性价比的 API 服务,提供…