一项新研究论文强调了公共库中可用的大语言模型(LLM)制品完整性方面存在严重问题。研究发现,Ollama 和 Hugging Face 上部分社区库的官方制品中有 1.6% 存在沉默缺陷,这意味着它们在表面上统计正常的情况下无法执行任何任务。这些缺陷是通过严格的测试过程识别出来的,该过程包括多个推理后端以及与独立转换的比较,揭示出一些模型在 CUDA 等特定硬件上会显著降级,但在 Metal 等其他硬件上却能正常运行。研究人员已发布了他们的测试工具 `quantcheck` 和审计数据集,以帮助提高 LLM 分发的可靠性。 AI
影响 强调了改进 LLM 制品验证以确保可靠性并防止已部署模型出现沉默故障的关键需求。
排序理由 学术论文,详细介绍了一种测试 LLM 制品的新方法,并报告了缺陷的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →