PulseAugur
实时 12:02:51
实体 RepoEval

RepoEval

PulseAugur coverage of RepoEval — every cluster mentioning RepoEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_206198 ·

    TDD-Agent框架通过测试优先方法增强LLM代码生成

    研究人员开发了TDD-Agent,一个将测试驱动开发原则应用于增强大型语言模型(LLM)代码生成的新框架。与之前将测试仅作为事后验证器的方法不同,TDD-Agent首先提示LLM生成可执行测试,在代码实现之前明确预期行为。然后,系统利用执行反馈迭代地改进代码和测试。在LiveCodeBench和RepoEval等基准测试上的评估表明,TDD-Agent在代码正确性以及生成测试的质量和有效性方面,显著优于现有的基于推理、基于检索和基于代…

  2. RESEARCH · CL_141489 ·

    新研究解决 AI 代码生成评估与测试问题

    两篇新研究论文探讨了 AI 生成代码评估方面的进展。第一篇 TENET 引入了一个使用测试驱动开发的仓库级代码生成框架,在 RepoCod 和 RepoEval 等基准测试中取得了 Claude Sonnet 4 的高 Pass@1 分数。第二篇 ACES 提出了一种评估代码生成评估测试可靠性的新方法,侧重于测试的一致性以及区分正确和错误代码的能力。

  3. TOOL · CL_93474 ·

    AlignCoder 框架通过增强检索来提高代码补全的准确性

    研究人员开发了 AlignCoder,一个旨在改进大型语言模型存储库级别代码补全的新框架。该系统通过查询增强机制和基于强化学习的检索器来增强检索增强生成(RAG),从而解决了当前代码 LLM 的局限性。这种方法旨在更好地将检索到的代码片段与用户的意图对齐,从而实现更准确的补全。在 CrossCodeEval 等基准测试上的评估显示,与现有方法相比,精确匹配分数提高了 18.1%,证明了其在不同代码 LLM 和编程语言中的广泛适用性。