LiveCodeBench
PulseAugur coverage of LiveCodeBench — every cluster mentioning LiveCodeBench across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的Mesh Learning方法可防止RLVR训练的LLM出现策略崩溃
研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。
-
新的IntentCoding策略提高了LLM代码生成对用户意图的遵循度
研究人员开发了一种名为IntentCoding的新解码策略,以提高大型语言模型(LLMs)在代码生成中遵循复杂用户指令的能力。该策略在不要求额外模型训练的情况下,增强了用户意图在生成过程中的影响力。为了便于评估,创建了一个名为CodeConstraints的新基准数据集,专门用于测试对多重约束的遵循情况。实验表明,与标准解码方法相比,IntentCoding在约束满足度和功能正确性方面均有显著提升。
-
PrismML 的 Bonsai 2 27B 实现大型 AI 模型近乎无损压缩
PrismML 发布了 Bonsai 2 27B,这是阿里巴巴 Qwen3.8-27B 模型的高度压缩版本。该新模型使用三元权重,达到了原始模型基准性能的 98.2%,同时将其大小从 54GB 减少到 5.9GB。与以往会降低推理能力的低比特量化方法不同,据报道 Bonsai 2 27B 在数学和编码基准等复杂任务上保持了强大的性能。
-
论文:LLM 隐藏状态可预测代码正确性
一项新的论文探讨了使用内省不确定性估计 (IUE) 来衡量大型语言模型 (LLM) 生成代码的正确性。研究表明,LLM 隐藏状态可以在响应和代码行级别上有效指示功能代码的正确性,这对于实际软件工程至关重要。虽然静态单标记探测最有效,但在不同任务和领域上的泛化性有所下降。研究还发现,代码行级别的预测比响应级别的估计更具挑战性,尽管条件定位设置在识别故障点方面显示出有效性。
-
研究:LLM生成的注释如果包含正确解决方案,则能提升代码生成效果
一篇新发表在arXiv上的研究调查了大型语言模型(LLM)生成的自然语言注释如何影响代码生成性能。研究人员发现,源自成功代码解决方案的注释能显著提高接收模型生成正确代码的能力,平均将pass@1率提高了17.2%。相反,描述失败解决方案或不相关问题的注释则没有益处,甚至会降低性能。研究结果表明,注释的效用在于其传达正确解决方案内容的能力,而不仅仅是其存在或描述意图。
-
新框架使用对抗性强化学习为代码大模型生成测试用例
研究人员开发了一个名为 Test Cases Scaling (TCS) 的新颖两阶段强化学习框架,用于自动为代码生成模型生成高质量的测试用例。该框架旨在创建既可靠又具辨别力的测试,作为反例来识别求解器的故障模式。通过两阶段训练测试生成器,首先使其与参考解决方案保持一致,然后生成对抗性反例,TCS 在 TACO 和 LiveCodeBench 等基准测试中显示出 pass@1 率和推理时答案选择的改进。
-
新的Agnostics管道提高了低资源语言中LLM的编码能力
研究人员开发了一种新的语言无关的训练后管道,称为Agnostics,旨在提高大型语言模型在低资源编程语言中的编码能力。该系统通过仅根据代码的可观察行为来判断代码,从而绕过了对特定语言数据集和基础设施的需求。Agnostics在Lua、Julia、R、OCaml和Fortran等语言中表现出显著的性能提升,甚至超越了更大的模型,并在较小参数模型的基准测试中创下了新的最先进成果。
-
自编排脚手架提升大型语言模型编码性能
一篇新研究论文探讨了用于改进大型语言模型(LLM)编码性能的管理器-工作者脚手架的有效性。研究发现,这种使用共享文件系统工作区的自编排技术,在各种模型上提供了真实但有条件的益处。虽然它显著提升了 Qwen3.8-27B 和 Kimi-K3 等一些模型的性能,但对于 Qwen3.6-35B 等其他模型,其影响微乎其微或为负面。研究表明,与仅仅使用更大的模型相比,这种脚手架可以更具成本效益地实现高准确性,其机制如上下文管理和问题分解有助于提升。
-
新框架通过故障代码测试提升LLM代码生成能力
研究人员开发了一个名为RobustTests的新框架,通过强化学习来提高大型语言模型(LLM)的代码生成能力。该框架通过合成故障代码来识别逻辑差异,并整合验证器代理来过滤测试用例,从而解决了现有测试用例生成中的局限性。此外,它还包含一个密集奖励函数,以减轻合成测试数据的假阴性。实验表明,使用RobustTests对Qwen3-32B模型进行微调,在LiveCodeBench基准测试中性能提高了3%。
-
新框架STEP-KTODER通过函数级反馈优化代码生成
研究人员推出了一种名为STEP-KTODER的新型框架,旨在通过函数级过程监督来增强代码生成模型。该方法将“步骤”定义为分解程序中的模块级函数,并利用自动生成的单元测试来分配二进制正确性标签。通过结合函数级监督和结果级反馈,STEP-KTODER旨在改进现有的方法,如直接偏好优化(DPO)和仅结果的KTO。在HumanEval(+)和MBPP(+)等基准上的评估证明了STEP-KTODER的有效性,并强调了基于执行的标签相对于会降低性…
-
Fireworks AI 宣传 DeepSeek V4 Pro 的性能和成本优势
Fireworks AI 宣布,其平台利用 DeepSeek V4 Pro 模型在 SWE-Bench 和 LiveCodeBench 基准测试中表现优于 Anthropic 的 Claude Fable 5。与某些可能拒绝此类工作的闭源模型不同,DeepSeek V4 Pro 提供了更低的每个已解决任务的成本,并表现出更愿意执行合法的安全审查任务。
-
AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难
一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。
-
对抗性审查:用于基于代理的代码审查的结构化分歧
研究人员引入了对抗性审查(AR),一种新颖的 AI 代码审查协议,该协议利用最少的三代理系统来促进结构化分歧。这种方法旨在缓解
-
TDD-Agent框架通过测试优先方法增强LLM代码生成
研究人员开发了TDD-Agent,一个将测试驱动开发原则应用于增强大型语言模型(LLM)代码生成的新框架。与之前将测试仅作为事后验证器的方法不同,TDD-Agent首先提示LLM生成可执行测试,在代码实现之前明确预期行为。然后,系统利用执行反馈迭代地改进代码和测试。在LiveCodeBench和RepoEval等基准测试上的评估表明,TDD-Agent在代码正确性以及生成测试的质量和有效性方面,显著优于现有的基于推理、基于检索和基于代…
-
研究发现:编码基准分数可能无法反映通用AI能力
一篇新论文认为,针对SWE-bench等特定编码基准优化AI模型,并不一定会提升其通用编码能力。研究人员发现,在这些基准上训练的模型在转移到其他任务(包括一个基于Django的自定义基准套件)时表现出有限的迁移性。该论文提倡采用更多样化的评估方法,例如对前沿模型的整体评估和研究用的多任务套件,以确保对AI编码能力的可靠评估。
-
Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源
独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。
-
DeepSeek V4 Pro 在实际前端测试中展现出强大的编码能力提升
DeepSeek 发布了其 V4 Pro 模型,与前代 V3.1 相比,在代码生成和推理能力方面有了显著提升。虽然官方基准测试突显了其进步,但本文侧重于通过实际前端开发测试来评估其真实世界性能。V4 Pro 提供了具有竞争力的性价比,尤其与 Claude 3.5 Sonnet 等模型相比,使其成为自动化代理任务的吸引人选择。
-
研究发现:心理影响策略会影响LLM代码生成
一项新发表在arXiv上的研究探讨了人类交流中常用的心理影响策略如何影响大型语言模型(LLMs)在代码生成任务中的表现。研究人员将Yukl & Falbe分类法中的八种影响策略改编为提示模板,并在LiveCodeBench和SWE-bench Verified基准上对五种领先的开源LLM进行了测试。研究结果表明,某些提示框架,特别是那些传达紧迫感的提示,与代码正确性和安全性下降有关。
-
新框架ExeCRE提升LLM代码生成可靠性
研究人员开发了ExeCRE,一个旨在提高大型语言模型(LLM)生成代码可靠性的框架。ExeCRE通过统计分析大量随机输入的执行输出来估算代码可靠性,而不是依赖传统的测试或LLM反馈。该方法将执行输出投影到一致性信号,并使用Dawid-Skene模型推断潜在的代码可靠性。当集成到自纠正管道中时,ExeCRE显著减少了误导性反馈,如在LiveCodeBench基准测试中,GPT-5.2的误导案例从113.2个下降到14.0个。
-
COMPAS方法通过联合调整模型、提示和设置来优化代码生成
研究人员开发了一种新颖的COMPAS方法,通过联合搜索模型、提示和解码设置来优化代码生成。这种难度感知方法学习特定组的质量-成本前沿,使其能够在不进行额外搜索的情况下将测试任务路由到最高效的配置。COMPAS在LiveCodeBench和SWE-bench等基准测试中显著提高了性能,提高了pass@1率和任务解决率,同时大幅降低了成本。