PulseAugur
实时 10:31:44
实体 A100 GPUs

A100 GPUs

PulseAugur coverage of A100 GPUs — every cluster mentioning A100 GPUs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_196038 ·

    Astrolabe系统通过随机预测引导调度优化大语言模型服务

    研究人员开发了Astrolabe,一个旨在优化大语言模型(LLM)服务的新型调度系统。该系统采用随机预测引导的方法,在无需昂贵的基于迁移的重新平衡的情况下,平衡多个LLM实例之间的负载。Astrolabe结合了响应长度估计、延迟预测和power-of-two-choices调度策略,以增强负载平衡并降低延迟。实验表明,Astrolabe可以匹配或超越现有基线的性能,显著降低平均和P99的首个token时间和端到端延迟,同时还减少了预测…

  2. RESEARCH · CL_167726 ·

    新的 TemporalSinkhorn 方法加速最优传输计算

    研究人员开发了 TemporalSinkhorn,一种用于动态熵最优传输问题的新型并行时间执行方法,特别有利于 Flow Matching 等生成模型应用。该方法允许在不影响输出精度的情况下对未来候选及其修复进行批处理,并利用经过认证的安全前缀和打包更新来实现效率。在 A100 和 RTX 4060 GPU 上的基准测试表明,在某些配置下,时间执行比顺序方法快 1.15 倍至 1.47 倍,在 Flow Matching 小批量流上速…

  3. TOOL · CL_155646 ·

    Meta AI 模型助力劳伦斯伯克利实验室的 Genesis Mission 项目

    Meta 的 AI 模型,包括 Segment Anything Model 和基于 PyTorch 构建的模型,正在劳伦斯伯克利国家实验室的 Genesis Mission 的初始项目中得到利用。这些项目专注于计算生物学、药物发现和材料科学等领域,利用 Meta 的 AI 能力来推进科学研究。该计划突显了先进 AI 工具在复杂科学事业中的应用。

  4. RESEARCH · CL_139531 ·

    新框架通过减少弱模型中的噪声来增强 LLM 训练

    研究人员开发了一个名为对比弱到强泛化(ConG)的新框架,以改进大型语言模型的训练。ConG 解决了现有弱到强泛化方法中的局限性,这些方法可能受到弱模型中噪声和偏差的阻碍。通过利用隐式奖励和对比解码,ConG 生成了更高质量的样本,从而实现了更可靠的能力转移和更强的鲁棒性。这种方法在各种模型家族中都显示出了一致的改进,为推进 LLM 训练提供了一条有前途的途径。

  5. RESEARCH · CL_128417 ·

    新研究探索可控泛化失败和LLM的高效RL蒸馏

    研究人员正在探索改进语言模型泛化和推理能力的新方法。一篇论文提出了一种构建模型的技术,通过在条件策略的混合物上进行训练来展示可控的泛化失败,这有助于进行对齐压力测试。另一项研究引入了直接策略内蒸馏(Direct-OPD)作为一种更有效的方式,将强化学习的收益从小型模型转移到大型模型,无需昂贵的奖励建模或在大型模型上进行直接RL。该方法已显示出显著的改进,例如在AIME 2024基准测试中提升了Qwen3-1.7B的性能。

  6. TOOL · CL_120020 ·

    LINE MAN Wongnai 将 AI 服务器成本削减 9 倍,应用速度提升 4 倍

    LINE MAN Wongnai 已将其 AI 服务器成本显著降低了 9 倍,并将应用程序速度提高了 4 倍。这是通过其 MLOps 方法的战略性转变、优化资源利用率和采用更高效的硬件来实现的。该公司利用 Kubernetes 和 Docker 等技术,以及 AWS 等云服务来有效管理其基础设施。

  7. RESEARCH · CL_97809 ·

    混合精度 CA-SGD 加速 GPU 训练

    研究人员开发了一种用于 GPU 上的广义线性模型的混合精度通信规避 SGD (CA-SGD) 方法。该方法旨在通过将通信分摊到多个迭代中来减少分布式训练中的通信瓶颈。该方法利用现代 GPU 的矩阵硬件和较低精度格式来加速计算并缩小数据传输,与标准的 FP32 SGD 相比实现了显著的加速。

  8. TOOL · CL_44971 ·

    FlashSinkhorn求解器加速GPU上的最优输运

    研究人员开发了FlashSinkhorn,一种新的GPU加速熵最优输运(EOT)求解器,可显著减少内存输入输出操作。通过重写稳定对数域Sinkhorn更新以模仿Transformer注意力中的归一化过程,FlashSinkhorn实现了融合内核,将数据流经片上SRAM。这种方法在A100 GPU上执行点云OT等任务时,与现有方法相比,前向传播速度提高了32倍,端到端速度提高了161倍。

  9. RESEARCH · CL_29834 ·

    尽管有美国出口管制,英伟达芯片仍被走私到中国和俄罗斯

    美国当局正在调查多起先进的英伟达 GPU 和其他半导体技术被非法走私到中国和俄罗斯的案件,以规避出口管制。这些行动涉及复杂的计划,包括使用虚假前置公司和加密通信,以将受限芯片转移用于从人工智能开发到军事应用等各种目的。尽管 Applied Materials 和 Cadence Design Systems 等公司面临巨额罚款和执法行动,但此类技术的非法流动仍在继续,对国家安全构成挑战。