PulseAugur
实时 07:49:52
实体 code evaluation

code evaluation

PulseAugur coverage of code evaluation — every cluster mentioning code evaluation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_216063 ·

    研究揭示大型语言模型在代码评估中存在偏见

    一项发表在arXiv上的新研究探讨了大型语言模型(LLMs)在评估代码时存在的偏见。研究确定了六种潜在的偏见类型,表明LLM评估器会因为变量名或格式等表面差异,对语义上等价的代码不公平地提高或降低评分。即使在提示LLM预先生成测试用例后,LLM评估器在多种编程语言和模型上仍然容易受到这些偏见的影响,这表明需要更鲁棒的代码评估方法。