H200 GPU
PulseAugur coverage of H200 GPU — every cluster mentioning H200 GPU across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的LCLM架构将LLM上下文压缩16倍,提高效率
研究人员开发了潜在上下文语言模型(LCLM),该模型在输入文本到达解码器之前将其压缩16倍,从而显著降低了内存和计算成本。这种由多所大学和国家实验室团队开发的新颖方法在长上下文基准测试中保持了高精度,并且优于现有的压缩方法。LCLM架构使用一个较小的编码器来创建压缩的“摘要向量”,并使用一个较大的解码器来处理这些向量,为处理大上下文提供了更有效的方式,特别适用于RAG系统和代理。
-
Perplexity 发布 Q2D-Web 基准,用于评估代理式 RAG 系统中的检索性能
Perplexity 推出了 Q2D-Web,这是一个新的基准和排行榜,旨在评估代理式 RAG 系统中的检索性能。该基准使用了包含 1.9 亿个网页文档和超过 69,000 个代理重构查询的大型语料库,涵盖十种语言。初步评估显示,Perplexity 自家的 pplx-embed-v1-4b 模型在网页排名和综合召回率方面处于领先地位,而 Nemotron-3-Embed-8B 在引用检索方面表现出色。
-
新的SSRR损失提升神经音频编解码器的可懂度和速度
一篇新的研究论文介绍了一种用于神经音频编解码器的自监督表征重构(SSRR)损失,旨在提高可懂度和降低延迟。该方法加速了训练,使得在H200 GPU等硬件上只需更少的步骤即可取得有竞争力的结果。SSRR损失通过重构从编解码器输出中提取的自监督表征来提高语音可懂度,从而在基于Transformer的编解码器中实现零前瞻的实时部署。采用此方法的JHCodec在LibriSpeech test-clean数据集上实现了优于其他方法的词错误率和…
-
新方法大幅降低LLM蒸馏成本并延长上下文长度
Multiverse Computing的一篇新论文介绍了两种提高大型语言模型知识蒸馏效率的方法。第一种方法是离线蒸馏,它缓存教师模型的Top-K Logits,在单个H200 GPU上将训练时间缩短29%,吞吐量提高41%。第二项贡献是融合分块KL损失,该方法分块处理序列,使峰值内存使用量与序列长度呈线性关系,并能以四倍的上下文长度进行训练。这些技术共同降低了内存需求,并使大规模蒸馏更加经济实惠。
-
MegaSlide-DiT 使单 GPU 能够适配大型视频扩散模型
研究人员开发了 MegaSlide-DiT,这是一个能够在一块高端 GPU 上适配大型视频扩散模型的系统。这是通过将模型权重和优化器状态保留在主机 RAM 中,并将仅必要的碎片流式传输到 GPU 来实现的。此外,该系统用线性复杂度的 3D 可变形滑动注意力(3D-DSA)算子取代了计算成本高昂的二次注意力,该算子能够自适应运动。
-
中国合成钻石行业将为AI芯片散热提供解决方案
AI芯片日益增长的热需求,其散热功率现已超过1000W,为中国合成钻石行业带来了巨大的机遇。由于其优于铜的导热性能,合成钻石是理想的散热解决方案。中国已生产全球95%的合成钻石,有望成为这一新兴市场的关键供应商,NVIDIA等公司已将基于钻石的材料集成到其GPU中。