Mingxin FX100
PulseAugur coverage of Mingxin FX100 — every cluster mentioning Mingxin FX100 across labs, papers, and developer communities, ranked by signal.
-
LLM 存储延迟容忍度随 GPU 利用率阶梯式变化
LLM 推理的存储延迟容忍度并非随 GPU 利用率线性下降,而是以阶梯状方式变化。在较高的 GPU 利用率水平(约 90%)下,计算队列饱和,存储延迟成为关键瓶颈。这需要稳定、低延迟的存储响应,而不仅仅是高带宽,以避免 GPU 空闲时间并维持有效的计算。例如,使用 Mingxin FX100 和 480B 模型,增加并发性显著提高了首次令牌生成时间,凸显了存储性能在高利用率 AI 工作负载中的重要性。
-
明玢FX100存储加速AI推理,助力国产替代
明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…
-
MaaS 单元经济学:折扣和延迟侵蚀净收入
模型即服务 (MaaS) 的真实成本并非由标价决定,而是由折扣和效率低下后的净收入决定,其中折扣链和存储延迟是关键因素。存储延迟,尤其是在长上下文推理中,会显著降低 GPU 利用率高达 30%,影响吞吐量并增加净成本。优化 MaaS 单元经济学需要将重点从简单地购买更便宜的 GPU 转移到最大化现有硬件的吞吐量,并考虑计算、存储和网络性能的相互作用。
-
计算中心盈利能力取决于利用率,而非容量
计算中心的盈利能力取决于利用率,而非已安装容量,30%的利用率可能使单位计算成本翻倍,而60%的利用率则不会。本文为决策者提供了一个衡量总体拥有成本(TCO)的框架,包括卡时成本、电力、设施摊销、网络、存储和人员配置。以明欣FX100的性能提升为例的存储加速,可以显著提高有效吞吐量并减少空闲时间,从而提高利用率和盈利能力。
-
人工智能推理需要高效的 GPU 管理,以避免显存耗尽和碎片化
管理人工智能工作负载的 GPU 资源,特别是生成媒体和大型语言模型推理,由于其高内存和计算需求,带来了重大挑战。与传统的 Web 应用程序不同,这些任务很容易耗尽 GPU 显存,导致无法恢复的错误和作业失败。为了缓解这种情况,使用作业队列和消息代理(如 BullMQ 和 Redis)的异步架构模式对于将任务摄取与执行解耦至关重要。高效的内存管理,如 PagedAttention,以及将 KV 缓存卸载到外部存储,对于减少 GPU 空闲…
-
明玕科技发布超越基准测试的GPU平台验收框架
明玕科技已开发出一个全面的GPU计算平台验收框架,该框架超越了标准的基准测试。该框架弥补了基准测试性能与实际集群推理之间的差距,强调了验证显存容量、互连带宽和存储系统的必要性。该过程包括基线性能测试、实际工作负载下的加速效果验证以及严格的72小时稳定性压力测试,以确保可靠性。
-
压缩感知不适用于大语言模型推理存储压缩
由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。
-
KV Cache预取大幅降低LLM推理延迟
一种新的KV Cache数据预取策略已被开发出来,显著降低了大模型推理期间的存储延迟。该方法在明心FX100上使用480B模型进行了测试,推理吞吐量提高了40%,首个token的生成时间缩短了32%。该策略涉及在计算单元需要KV Cache块之前,将其从存储加载到更快的内存层级,这是随着上下文窗口扩展并超出GPU高带宽内存(HBM)容量而进行的关键优化。与KV Cache数据未命中时重新计算相比,这种方法提供了8.6倍到20倍的显著加速。
-
明玕 FX100 通过 KV Cache 复用提升 LLM 推理性能 · 追踪 2 个来源
明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。
-
AI推理卡将数据库查询延迟降低高达32%
一项新研究强调了国内AI推理加速卡(特别是明心FX100)如何显著提高实时数据库查询性能。通过优化存储访问路径和缩短模型加载时间,这些卡可以将首个token延迟降低高达32%,模型加载时间缩短高达9倍。这些改进在AMD MI308X和华为Ascend 910B平台上均得到验证,表明AI驱动的实时数据库中的瓶颈正从计算转向存储访问,尤其是在处理大型模型时。
-
KV 缓存分层可提升 LLM 推理速度并降低成本
一种管理大型语言模型推理中 KV 缓存的新方法建议将其视为暖存储层内的高频访问子集,而不是传统的冷热层。这种策略,对于 Qwen3-Coder-480B-FP8 等长上下文模型尤其重要,涉及使用专用的加速层,例如 Mingxin FX100 NVMe-oF 阵列。实测结果表明,这种分层可以将吞吐量提高高达 40%,并将首次令牌延迟时间缩短 30% 以上,从而解决了 LLM 推理中的一个关键瓶颈。
-
明心科技通过优化模型切换将GPU利用率提升16%
明心科技通过解决模型切换和冷启动延迟问题,显著提高了GPU计算利用率。通过分层KV Cache加速、并行读优化和端到端负载加速这三个优化步骤,他们将有效计算利用率从46.7%提高到62.8%。这些优化在AMD MI308X和华为Atlas 910B平台上进行了测试,缩短了首次令牌生成时间和模型加载时间,从而释放了现有计算基础设施的更多潜力。