LiveCodeBench V6
PulseAugur coverage of LiveCodeBench V6 — every cluster mentioning LiveCodeBench V6 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的Agentic Coding Index根据智能密度对大型语言模型进行排名
一位Reddit用户开发了一种名为Agentic Coding Index (ACI)的新指标,用于评估大型语言模型(LLM)在编码任务上的表现。ACI使用加权公式汇总了SWE-bench Pro、DeepSWE v1.1和Terminal-Bench等多个编码基准测试的得分。该指标旨在通过考虑模型的参数数量及其在这些多样化编码评估中的表现来衡量模型的“智能密度”,重点在于奖励真正的自主掌握能力。
-
Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜
阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。
-
Google DeepMind 的 DiffusionGemma 通过离散扩散实现每秒 1500 个 token
Google DeepMind 发布了 DiffusionGemma,这是一个开放权重的语言模型,它利用离散扩散进行文本生成,与传统的自回归模型相比,输出速度显著更快。虽然 DiffusionGemma 在单个 NVIDIA H100 上可以实现大约每秒 1500 个输出 token,但在能力基准测试上的得分低于其自回归对应模型 Gemma 4。这种在服务速度方面的创新对于需要低延迟和高吞吐量的代理系统尤其有益,预示着未来混合模型或智…
-
Bad Theory Labs 发布 BTL-3 代码任务代理模型
Bad Theory Labs 发布了 BTL-3,一个拥有 270 亿参数的开放权重模型,专为代理编码和结构化工具使用而设计。该模型是 Qwen3.6-27B 的后训练版本,在 HumanEval 等编码基准测试中表现强劲,通过率为 95.1%。BTL-3 还拥有 262,144 个 token 的大上下文窗口,并根据 Apache-2.0 许可提供,同时还有一个为本地推理优化的精简版。
-
Agents-A1-4B 模型在长时域搜索中表现强劲
InternScience 开发的新模型 Agents-A1-4B 在多项基准测试中表现强劲,尤其是在长时域搜索和智能体任务方面。该模型基于 Qwen3.7-4B,在 BrowseComp 和 GAIA 等领域显著优于其基础模型。虽然在指令遵循和工程任务方面取得了有竞争力的结果,但在 LiveCodeBench-V6 和 FrontierScience-Research 等一些领域落后于更大的模型。
-
新的 3B 模型 VibeThinker 在数学和编码方面达到前沿性能
研究人员开发了 VibeThinker-3B,这是一个拥有 30 亿参数的小型模型,在数学和编码任务上的表现可与更大模型相媲美。该模型基于 Qwen2.5-Coder-3B 构建,并采用了 Spectrum-to-Signal 训练流程,在 AIME26 和 LiveCodeBench 等基准测试中取得了优异成绩。开发者强调,参数密集的小型模型可以提供前沿的推理能力,是对传统扩展定律的补充,但他们也承认在更广泛的通用应用方面存在局限性。
-
新的CPPO方法通过探索多种策略来提升代码生成能力
研究人员推出了一种名为协调Pass@K策略优化(CPPO)的新方法,通过同时探索多种不同的算法策略来增强代码生成能力。与抽取独立样本的标准方法不同,CPPO训练一个联合策略,其中规划器提出$K=4$个备选方法,共享求解器尝试为每个方法找到解决方案。这种协调探索在APPS、CodeContests和LiveCodeBench-v6等多个基准测试中,显著提高了pass@K指标。
-
新的自蒸馏方法提高了大型语言模型在推理任务上的性能
研究人员开发了新的大型语言模型自蒸馏技术,可在不依赖外部反馈的情况下提高其性能。AVSD(自适应视图自蒸馏)在多个特权信息视图之间平衡共识信号,并使用视图特定的残差来增强学习。自策略蒸馏(SPD)从梯度中提取能力子空间,以提高性能和泛化能力,尤其是在代码生成和数学推理方面。CEPO(对比证据策略优化)通过对比正确答案和错误答案来锐化关键标记的信用分配,从而提高了多模态数学推理基准的准确性。
-
通过口头批评进行过程监督可提高大型语言模型的推理能力
研究人员开发了一种名为口头过程监督(VPS)的新框架,该框架无需梯度更新即可增强大型语言模型的推理能力。该方法利用更强大的AI生成的结构化自然语言批评来指导迭代的生成-批评-精炼过程。在GPQA Diamond和AIME 2025等基准测试上的实验表明,VPS取得了显著的改进,超越了现有的最先进结果,并优于Reflexion和Self-Consistency等其他方法。
-
Google DeepMind 为 Gemini Ultra 订阅用户推出 Deep Think
Google DeepMind 发布了一项名为 Deep Think 的新 AI 功能,现已通过 Gemini 应用提供给 Google AI Ultra 订阅用户。该功能利用并行思考技术,使模型能够同时探索多个想法并延长其解决复杂问题的推理时间。Deep Think 在 LiveCodeBench V6 和 Humanity's Last Exam 等基准测试中表现出了最先进的性能,内部评估显示其在 2025 年国际数学奥林匹克基准…