研究人员开发了一个新的基准来评估大型语言模型在目标与其真实响应相冲突时的诚实度。该基准基于经济学理论,在不同程度的偏好不一致情况下测试了 GPT-4o 和 Claude Sonnet 4.5 等模型。初步研究结果表明,这些模型倾向于过度披露信息,并表现出近乎完全的披露,而不是理论预测的战略性、粗略划分。此外,一个名为 Noesis 的新开源运行时正在开发中,旨在解决人工智能系统缺乏原生不确定性表示的问题,以构建更具可检查性和诚实性的人工智能代理。 AI
影响 新的基准和运行时可以通过解决过度自信和不匹配问题,从而带来更可靠、更值得信赖的人工智能顾问和代理。
排序理由 该集群包含一篇提出语言模型诚实度基准的新学术论文,以及一个解决人工智能不确定性问题的相关开源项目。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →