PulseAugur
中
实时 11:29:28
实体 ClarifyCodeBench

ClarifyCodeBench

PulseAugur coverage of ClarifyCodeBench — every cluster mentioning ClarifyCodeBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_280140 ·

    新的基准测试评估LLM的代码生成、澄清和检索能力

    三篇新的研究论文介绍了用于评估大型语言模型(LLM)在代码生成任务中能力的新基准和方法。ClarifyCodeBench侧重于LLM澄清模糊需求的能力,发现强大的代码生成能力并不一定能转化为有效的澄清能力。CONTRA提供了一种无需训练的方法来识别和限定改变行为的问题,以进行选择性澄清,从而提高了ClarifyCodeBench基准测试的F1分数。AlgoREval专门评估LLM的参数化代码检索能力,将其与新颖合成区分开来,并突出了不…