Mingxin Technology
PulseAugur coverage of Mingxin Technology — every cluster mentioning Mingxin Technology across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
通过优化数据传输效率降低GPU计算租赁成本
本文讨论了优化GPU计算租赁中的数据传输效率,这是降低AI工作负载成本和提高性能的关键因素。文章强调,GPU计算通常按小时计费,数据加载瓶颈成为一项重大的隐藏成本。文章提出了三种优化策略:通过从传统的网络文件系统(NFS)迁移到NVMe-oF全闪存阵列来增强存储架构;利用RDMA等网络协议绕过CPU和操作系统开销;以及实施缓存分层,将频繁访问的数据移近GPU。
-
云GPU成本结构:按需付费与年度订阅分析
本文解析了云GPU实例的按需付费与年度订阅模式的成本结构,认为“计算自由”并非简单的成本二分法。选择很大程度上取决于工作负载利用率、并发需求和服务水平协议(SLA)的限制。对于一致的推理服务,年度订阅通常更具成本效益,而按需实例则为波动的研发任务提供了灵活性。分析强调,单价与承诺期限成反比,并且必须考虑实际利用率来确定每token的真实成本。
-
蒙特卡洛分析增强计算中心投资决策
与传统的总拥有成本(TCO)计算相比,蒙特卡洛敏感性分析为计算中心的投资决策提供了一种更稳健的方法。通过对GPU利用率和电价等输入参数的不确定性进行建模,该方法可以提供潜在回报和风险的分布,而不是单一的估计值。这使得决策者能够识别关键变量,并在各种场景下更好地理解项目可行性,最终帮助避免重大的投资失误。
-
明玕科技发布超越基准测试的GPU平台验收框架
明玕科技已开发出一个全面的GPU计算平台验收框架,该框架超越了标准的基准测试。该框架弥补了基准测试性能与实际集群推理之间的差距,强调了验证显存容量、互连带宽和存储系统的必要性。该过程包括基线性能测试、实际工作负载下的加速效果验证以及严格的72小时稳定性压力测试,以确保可靠性。
-
计算、内存和存储领域探索LLM首次响应时间缩减策略
减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…
-
计算租赁合同需要为AI工作负载添加特定条款
本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。
-
LLM计算成本优化取决于动态扩展和SLA指标
优化LLM计算租赁成本需要关注动态扩展策略而非静态按需分配,尤其是在处理长上下文推理时。关键在于确保存储层能够支持弹性扩展的读取带宽需求,正如明溪科技的测试所示。除了单价,诸如首个Token时间(TTFT)、稳态吞吐量和长尾稳定性等关键服务水平协议(SLA)指标对于准确确定所需GPU数量和避免隐藏成本至关重要。
-
明玕FX100存储解决方案加速视频推理,降低延迟
明玕的FX100存储解决方案解决了实时视频推理中的延迟瓶颈,这些瓶颈通常由存储和数据路径限制引起,而非GPU计算能力。该系统采用分层KV缓存方法,将热数据放在GPU HBM中,温数据放在本地NVMe上,冷数据放在NVMe-oF阵列上。该策略显著提高了吞吐量,并减少了长上下文工作负载的首次令牌生成时间(TTFT),吞吐量提升高达40%,TTFT提升32%。
-
明玕 FX100 通过 KV Cache 复用提升 LLM 推理性能 · 追踪 2 个来源
明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。
-
明心科技通过优化模型切换将GPU利用率提升16%
明心科技通过解决模型切换和冷启动延迟问题,显著提高了GPU计算利用率。通过分层KV Cache加速、并行读优化和端到端负载加速这三个优化步骤,他们将有效计算利用率从46.7%提高到62.8%。这些优化在AMD MI308X和华为Atlas 910B平台上进行了测试,缩短了首次令牌生成时间和模型加载时间,从而释放了现有计算基础设施的更多潜力。
-
Clos 网络架构:AI 推理集群的成本与选型框架
Clos(或称 Fat-Tree)网络架构因其可扩展性和高带宽而成为大规模 AI 推理集群的流行选择。本文分析了 Clos 网络在拥有数千个 GPU 的集群中的成本构成,包括交换机、线缆和端口密度。文章还讨论了在全面的总体拥有成本(TCO)模型中,将运营费用与初始硬件成本一并考虑的重要性,并强调了高效存储解决方案如何间接优化网络需求。