实体
PromptEval
PromptEval
PulseAugur coverage of PromptEval — every cluster mentioning PromptEval across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
报告:仅8%的LLM提示得分“良好”;输出格式是关键
一项分析了1000多个大型语言模型提示的报告显示,只有8%的提示得分“良好”(75分及以上)。提示质量最重要的因素是清晰定义输出格式,平均贡献27分。在大多数提示中,鲁棒性是最薄弱的维度,10个中有9个无法有效处理模糊或意外的输入。提示过短或依赖“引人入胜”等模糊描述的提示表现不佳,而医疗保健等高风险领域的提示则构建得更为仔细。
-
新框架以统计置信区间对AI模型进行排名
研究人员开发了一个新的分层框架,用于在排行榜上评估预训练模型,解决了不同任务之间性能的不确定性和可变性。该方法在任务和排行榜层面构建了统计上保证的排名区间,提供了更可靠的方法来量化模型性能并考虑变异性。在TabArena和PromptEval (MMLU)等基准测试上的实验证明了该框架能够为不确定性感知的模型排名产生信息丰富的区间。