实体
AIPerf
AIPerf
PulseAugur coverage of AIPerf — every cluster mentioning AIPerf across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
GLM-5.2 Fast 显示出比 GLM-5.2 更显著的速度提升
最近的一项基准测试表明,通过 AIHubMix 提供的 GLM-5.2 Fast 在性能上比标准的 GLM-5.2 模型有了显著的改进。在聊天、编码和数学任务中,GLM-5.2 Fast 的每用户吞吐量提高了 83-94%,系统吞吐量提高了 53-77%。此外,它将令牌间延迟降低了 41-46%,中位数端到端请求延迟降低了 38.5-42.5%,使其特别适合实时应用程序和代理工作流。
-
AMD 为 Nvidia 的 LLM 基准测试项目做出贡献
AMD 已为 Nvidia 的 AIPerf 项目做出贡献,该项目是 Nvidia Dynamo 专注于大型语言模型工作负载基准测试的一个子仓库。此次合作标志着跨供应商在 AI 性能评估方面迈出了重要一步。
-
NVIDIA AIPerf 揭示了超越基本指标的大语言模型性能瓶颈
一篇博文详细介绍了如何使用 NVIDIA 的 AIPerf 工具来发现大语言模型部署中隐藏的性能问题。对本地模型的初步测试显示了出色的基线性能,但增加并发量后,首个 token 时间(TTFT)急剧增加,99% 的请求未能达到 500 毫秒的服务水平目标(SLO)。分析强调,瓶颈不在于模型的 token 间延迟(ITL),后者保持稳定,而在于请求排队和预填充阶段,这表明需要架构解决方案,如更好的队列管理或水平扩展。