PulseAugur
实时 06:01:53
实体 LiveCodeBench

LiveCodeBench

PulseAugur coverage of LiveCodeBench — every cluster mentioning LiveCodeBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 44
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 33
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/3 页 · 共 44 条
  1. TOOL · CL_213489 ·

    AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难

    一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。

  2. RESEARCH · CL_210387 ·

    对抗性审查:用于基于代理的代码审查的结构化分歧

    研究人员引入了对抗性审查(AR),一种新颖的 AI 代码审查协议,该协议利用最少的三代理系统来促进结构化分歧。这种方法旨在缓解

  3. RESEARCH · CL_206198 ·

    TDD-Agent框架通过测试优先方法增强LLM代码生成

    研究人员开发了TDD-Agent,一个将测试驱动开发原则应用于增强大型语言模型(LLM)代码生成的新框架。与之前将测试仅作为事后验证器的方法不同,TDD-Agent首先提示LLM生成可执行测试,在代码实现之前明确预期行为。然后,系统利用执行反馈迭代地改进代码和测试。在LiveCodeBench和RepoEval等基准测试上的评估表明,TDD-Agent在代码正确性以及生成测试的质量和有效性方面,显著优于现有的基于推理、基于检索和基于代…

  4. TOOL · CL_203920 ·

    研究发现:编码基准分数可能无法反映通用AI能力

    一篇新论文认为,针对SWE-bench等特定编码基准优化AI模型,并不一定会提升其通用编码能力。研究人员发现,在这些基准上训练的模型在转移到其他任务(包括一个基于Django的自定义基准套件)时表现出有限的迁移性。该论文提倡采用更多样化的评估方法,例如对前沿模型的整体评估和研究用的多任务套件,以确保对AI编码能力的可靠评估。

  5. RESEARCH · CL_201933 ·

    Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源

    独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。

  6. SIGNIFICANT · CL_200316 ·

    DeepSeek V4 Pro 在实际前端测试中展现出强大的编码能力提升

    DeepSeek 发布了其 V4 Pro 模型,与前代 V3.1 相比,在代码生成和推理能力方面有了显著提升。虽然官方基准测试突显了其进步,但本文侧重于通过实际前端开发测试来评估其真实世界性能。V4 Pro 提供了具有竞争力的性价比,尤其与 Claude 3.5 Sonnet 等模型相比,使其成为自动化代理任务的吸引人选择。

  7. TOOL · CL_198059 ·

    研究发现:心理影响策略会影响LLM代码生成

    一项新发表在arXiv上的研究探讨了人类交流中常用的心理影响策略如何影响大型语言模型(LLMs)在代码生成任务中的表现。研究人员将Yukl & Falbe分类法中的八种影响策略改编为提示模板,并在LiveCodeBench和SWE-bench Verified基准上对五种领先的开源LLM进行了测试。研究结果表明,某些提示框架,特别是那些传达紧迫感的提示,与代码正确性和安全性下降有关。

  8. TOOL · CL_185269 ·

    新框架ExeCRE提升LLM代码生成可靠性

    研究人员开发了ExeCRE,一个旨在提高大型语言模型(LLM)生成代码可靠性的框架。ExeCRE通过统计分析大量随机输入的执行输出来估算代码可靠性,而不是依赖传统的测试或LLM反馈。该方法将执行输出投影到一致性信号,并使用Dawid-Skene模型推断潜在的代码可靠性。当集成到自纠正管道中时,ExeCRE显著减少了误导性反馈,如在LiveCodeBench基准测试中,GPT-5.2的误导案例从113.2个下降到14.0个。

  9. TOOL · CL_185260 ·

    COMPAS方法通过联合调整模型、提示和设置来优化代码生成

    研究人员开发了一种新颖的COMPAS方法,通过联合搜索模型、提示和解码设置来优化代码生成。这种难度感知方法学习特定组的质量-成本前沿,使其能够在不进行额外搜索的情况下将测试任务路由到最高效的配置。COMPAS在LiveCodeBench和SWE-bench等基准测试中显著提高了性能,提高了pass@1率和任务解决率,同时大幅降低了成本。

  10. RESEARCH · CL_160905 ·

    新的 TTEL 算法通过定位错误来提高 LLM 推理效率

    研究人员开发了一种名为“通过错误定位进行测试时扩展”(TTEL)的新型推理时算法,以提高大型语言模型在复杂推理任务上的效率。TTEL 利用反馈来精确定位错误发生的具体 token,从而能够截断错误的路径并为新生成的内容重用有效的词缀。评估表明,TTEL 在 LiveCodeBench、AIME-2025 和 HMMT-2025 等基准测试中显著优于现有方法,以更少的生成 token 实现了更好的性能。

  11. TOOL · CL_158645 ·

    Solar Open 2 语言模型拥有 100 万 token 上下文窗口和强大的代理能力

    研究人员推出了 Solar Open 2,这是一个拥有 2500 亿参数的混合专家(Mixture-of-Experts)语言模型,专为长时序代理任务而设计。该模型通过混合注意力机制实现了 100 万 token 的上下文窗口,并利用更强的起点和精选的高价值数据进行高效训练。Solar Open 2 在多项英语基准测试中表现领先,包括 MMLU-Pro 和 APEX-Agents 套件,并与其他顶级开放权重模型取得了有竞争力的结果。它…

  12. TOOL · CL_154229 ·

    新诊断工具评估LLM测试时协作的有效性

    研究人员开发了一个新的诊断框架,用于评估大型语言模型(LLM)测试时协作技术的有效性。该框架称为“固定池诊断”(Fixed-Pool Diagnostic),将自洽性(self-consistency)和批评模型(critic models)等方法的收益分解为可衡量的因素,例如可恢复质量(recoverable mass)和信号保真度(signal fidelity)。研究发现,收益通常受“Oracle Gap”和验证器判决与真实标签…

  13. RESEARCH · CL_152721 ·

    DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布

    独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…

  14. SIGNIFICANT · CL_143192 ·

    PrismML 发布 Bonsai 27B,使 Qwen3.6-27B 可在笔记本电脑和手机上运行

    PrismML 发布了 Bonsai 27B,这是 Qwen3.6-27B 的高度压缩版本,有 1 位和三元变体。这些模型旨在在笔记本电脑和手机等消费级硬件上运行,其中 1 位版本仅需 3.9GB,三元版本需要 5.9GB。尽管经过了激进的压缩,三元模型仍保留了原始 FP16 模型约 94.6% 的性能,而 1 位版本则保留了 89.5%,使其适用于需要大上下文窗口和高效内存使用的应用程序。

  15. COMMENTARY · CL_132963 ·

    Ollama 云模型:DeepSeek V4 Flash 相较于 V4 Pro 节省大量成本

    近期对 Ollama 云模型的分析显示,基于每次任务的 GPU 计算使用量而非仅 token 数量,存在显著的成本差异。研究发现,DeepSeek V4 Flash 尽管活跃参数较少,但在编码基准测试上的表现与 DeepSeek V4 Pro 相当,而计算量却减少了约 73%。这表明为 V4 Pro 等更高级别模型支付费用执行常规任务的用户可能严重支出过高。分析强调,每个 token 的活跃参数和思考 token 开销是 Ollama…

  16. TOOL · CL_123211 ·

    新的强化学习算法将问题分解,降低大型语言模型成本

    研究人员推出了一种新颖的强化学习算法 DecompRL,旨在增强大型语言模型(LLMs)的解决问题能力。DecompRL 不依赖于广泛的采样或多样性优化,而是专注于将复杂问题分解为更小、更易于管理子函数。该算法学习生成和重组这些模块的代码,显著降低了寻找解决方案相关的计算成本。这种方法在 LiveCodeBench 和 CodeContests 等基准测试中表现出色,使大型语言模型能够解决以前无法解决的问题。

  17. TOOL · CL_121474 ·

    新基准 AlgoBench 测试 LLM 的算法推理能力,超越记忆

    研究人员开发了 AlgoBench,一个旨在评估代码生成模型算法推理能力的新框架。与可能因训练数据暴露而受损的传统基准测试不同,AlgoBench 通过转换现有的竞争性编程问题来自动创建新颖的算法问题。这种方法确保了参考算法在新变体上失败,迫使模型展示真正的适应性而非记忆。该框架还引入了面向复杂性的指标,不仅评估功能正确性,还评估渐近效率,揭示了许多模型在算法适应性和高效解决方案方面存在困难。

  18. TOOL · CL_117688 ·

    新方法惩罚冗余,使大语言模型推理更高效

    研究人员开发了一种新颖的方法,通过惩罚其思维链(CoT)追踪中的内部和外部冗余来减少大型推理模型(LRM)的“过度思考”。这种双重惩罚强化学习框架分别解决了第一个正确答案之前的信��停滞和之后的冗余延续问题。在GSM8K和MATH500等基准测试上的实验表明,推理长度显著缩短,在1.5B模型上最多可减少41.3%,同时保持了具有竞争力的准确性并提高了整体效率。该方法还显示出对GPQA和LiveCodeBench等域外任务的可迁移性,为…

  19. SIGNIFICANT · CL_113454 ·

    Sakana AI 发布 Fugu,一个匹配受限模型的​​多智能体系统

    Sakana AI 推出了 Fugu,一个多智能体系统,它充当 LLM 池的协调器,可通过单个 API 访问。该系统有两个版本:Fugu,基于 TRINITY 构建;Fugu-Ultra,基于 Conductor 构建。Fugu-Ultra 已展示出强大的性能,据报道在 GPQA-Diamond 和 LiveCodeBench 等多个基准测试中,其性能可与 Anthropic 的 Mythos 和 Fable 5 等受限模型相媲美或超…

  20. TOOL · CL_108106 ·

    Sakana Fugu 编排器模型结合 LLM 以实现集体智能

    研究人员开发了 Sakana Fugu,这是一系列编排器模型,旨在将多个大型语言模型 (LLM) 的专业能力结合成一个集体智能系统。这些模型本身充当语言模型,理解用户查询并动态创建代理脚手架来解决它们。这种方法使 Fugu 能够超越任何单一 LLM 代理的性能,在 SWE-Bench Pro 和 GPQA-Diamond 等具有挑战性的基准测试中取得最先进的成果。该项目发布了两个模型:Fugu(用于平衡性能和延迟)和 Fugu-Ult…