研究人员开发了HindsightBench,一种新的协议,用于审计大型语言模型是否存在“参数滞后”(parametric hindsight),即模型倾向于将未来结果的知识泄露到历史决策任务中。这种黑盒方法无需回测或访问模型内部即可进行成本效益高的审计。当应用于15个模型时,HindsightBench显示日期触发的反射与训练代数相关,而非模型规模,并且较新的模型更强烈地表现出这种特征。该协议还发现,有效的知识截止日期差异很大,并且可能早于报告的日期,模型服务配置也会影响审计的稳定性。 AI
影响 这种新的审计协议可以帮助开发人员识别和减轻LLM中与未来知识泄露相关的偏见。
排序理由 该集群包含一篇研究论文,详细介绍了一种审计LLM的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →