研究人员开发了M2K,一个旨在提高大型语言模型(LLM)推理系统中使用的CUDA内核可靠性的新框架。M2K解决了LLM和CUDA内核之间接口隐式且指定不当的问题,这常常导致内存错误。该框架使该接口显式化,从而能够自动检测这些错误。在评估中,M2K以较低的误报率成功识别了LLM推理系统中181个先前未知的错误。 AI
影响 通过检测底层GPU计算中的关键内存错误,提高了LLM推理的可靠性和安全性。
排序理由 该集群包含一篇学术论文,详细介绍了用于LLM推理的CUDA内核验证的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →