佐治亚理工学院和斯坦福大学的最新研究表明,大型语言模型可能表现出预测不稳定性。虽然总体准确率得分可能保持很高,但当模型接收到不相关或无意义的上下文时,单个答案可能会发生显著变化。这表明大型语言模型的性能可能存在隐藏的脆弱性,而标准评估指标未能捕捉到这一点。 AI
影响 凸显了大型语言模型输出中潜在的隐藏不稳定性,表明当前的评估方法可能无法完全捕捉模型的鲁棒性。
排序理由 该集群包含来自学术机构的研究论文。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →