PulseAugur
实时 06:27:15
实体 DeepSeek 70B

DeepSeek 70B

PulseAugur coverage of DeepSeek 70B — every cluster mentioning DeepSeek 70B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. COMMENTARY · CL_241680 ·

    通过优化数据传输效率降低GPU计算租赁成本

    本文讨论了优化GPU计算租赁中的数据传输效率,这是降低AI工作负载成本和提高性能的关键因素。文章强调,GPU计算通常按小时计费,数据加载瓶颈成为一项重大的隐藏成本。文章提出了三种优化策略:通过从传统的网络文件系统(NFS)迁移到NVMe-oF全闪存阵列来增强存储架构;利用RDMA等网络协议绕过CPU和操作系统开销;以及实施缓存分层,将频繁访问的数据移近GPU。

  2. COMMENTARY · CL_241249 ·

    云计算成本优化:按需与动态扩展策略

    AI工作负载的云计算成本优化涉及按需分配与动态扩展之间的战略选择,具体取决于工作负载模式和服务水平协议(SLA)。按需分配最适合稳定、对延迟敏感的生产任务,而动态扩展则更适用于需求波动的推理工作负载。GPU实例在Amazon Web Services、Microsoft Azure和Google Cloud等提供商之间的定价,以及模型加载时间等因素,显著影响最佳策略。例如,在华为Ascend等平台上更快的模型加载可以提高动态扩展策略对…

  3. TOOL · CL_212516 ·

    LLM 存储延迟容忍度随 GPU 利用率阶梯式变化

    LLM 推理的存储延迟容忍度并非随 GPU 利用率线性下降,而是以阶梯状方式变化。在较高的 GPU 利用率水平(约 90%)下,计算队列饱和,存储延迟成为关键瓶颈。这需要稳定、低延迟的存储响应,而不仅仅是高带宽,以避免 GPU 空闲时间并维持有效的计算。例如,使用 Mingxin FX100 和 480B 模型,增加并发性显著提高了首次令牌生成时间,凸显了存储性能在高利用率 AI 工作负载中的重要性。

  4. TOOL · CL_212517 ·

    明玢FX100存储加速AI推理,助力国产替代

    明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…

  5. COMMENTARY · CL_194250 ·

    计算租赁合同需要为AI工作负载添加特定条款

    本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。

  6. RESEARCH · CL_194252 ·

    LLM计算成本优化取决于动态扩展和SLA指标

    优化LLM计算租赁成本需要关注动态扩展策略而非静态按需分配,尤其是在处理长上下文推理时。关键在于确保存储层能够支持弹性扩展的读取带宽需求,正如明溪科技的测试所示。除了单价,诸如首个Token时间(TTFT)、稳态吞吐量和长尾稳定性等关键服务水平协议(SLA)指标对于准确确定所需GPU数量和避免隐藏成本至关重要。

  7. TOOL · CL_187642 ·

    压缩感知不适用于大语言模型推理存储压缩

    由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。

  8. TOOL · CL_183926 ·

    明玕FX100存储解决方案加速视频推理,降低延迟

    明玕的FX100存储解决方案解决了实时视频推理中的延迟瓶颈,这些瓶颈通常由存储和数据路径限制引起,而非GPU计算能力。该系统采用分层KV缓存方法,将热数据放在GPU HBM中,温数据放在本地NVMe上,冷数据放在NVMe-oF阵列上。该策略显著提高了吞吐量,并减少了长上下文工作负载的首次令牌生成时间(TTFT),吞吐量提升高达40%,TTFT提升32%。

  9. TOOL · CL_179717 ·

    AI推理卡将数据库查询延迟降低高达32%

    一项新研究强调了国内AI推理加速卡(特别是明心FX100)如何显著提高实时数据库查询性能。通过优化存储访问路径和缩短模型加载时间,这些卡可以将首个token延迟降低高达32%,模型加载时间缩短高达9倍。这些改进在AMD MI308X和华为Ascend 910B平台上均得到验证,表明AI驱动的实时数据库中的瓶颈正从计算转向存储访问,尤其是在处理大型模型时。