一篇新论文提出了一种使用决策理论原理来评估和正则化包括LLM在内的AI系统的方法。该方法被称为“揭示的理性”,它利用表征定理来检查AI的行为是否符合特定的理性公理。这使得无标签评估成为可能,其中AI对合成选择问题的自身响应被用来识别与一致性的偏差,并直接从这些偏差中计算惩罚。该论文概述了该方法的三个实例,借鉴了与概率一致性、偏好理性和主观预期效用相关的定理。 AI
影响 这项研究可以通过消除对外部标签和人类反馈的依赖,从而实现对AI系统更强大、更客观的评估。
排序理由 详细介绍AI评估新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Afriat's theorem
- arXiv
- De Finetti
- Echeñique
- Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems
- Saito
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →