Codeforces
PulseAugur coverage of Codeforces — every cluster mentioning Codeforces across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Google 的 Stellar Colosseum 模型利用 Gemini 模型攻克长时数学证明
Google Research 开发了一个名为 Stellar Colosseum 的新型多智能体系统,旨在解决长时任务,尤其是在数学证明方面。该系统分阶段运行,并行生成候选解决方案,对其进行有针对性的证伪,并将其与批评意见合并。当与 Gemini 3.1 Pro 和 Gemini 3.7 Flash 结合使用时,Stellar Colosseum 在定理证明任务的 TCS-Bench 基准测试中取得了 71.0% 的成功率,并解决了…
-
DeepSeek 的 V4.1 Flash 模型提供速度和低成本,但市场份额增长缓慢
DeepSeek 发布了其 V4.1 Flash 模型,这是一个拥有 552B 参数的专家混合(Mixture-of-Experts)模型,该模型速度惊人,并且 KV 缓存大小显著减小,使其成为最便宜的前沿模型之一。尽管该模型在各种基准测试中表现出色,并且采用了激进的定价策略,但它似乎在市场采用方面遇到了困难,与 OpenAI 等成熟的竞争对手相比,其 API 使用量仅占很小一部分。这种差距凸显了开发人员对尖端、经济高效的模型感兴趣,…
-
AI推理痕迹被发现易于解密,暴露数据
研究人员发现,OpenAI、Anthropic和Google等主要AI提供商使用的“加密”推理痕迹并非真正安全。这些旨在保护专有推理和敏感数据的痕迹,可以通过使用同一提供商安全性较弱的同级模型来解密并提取为明文。这种漏洞可能导致凭证和个人身份信息暴露,以及绕过专有AI模型的反蒸馏保护。
-
新基准揭示大语言模型在交互式编程问题上存在困难
研究人员推出了 InteractBench,这是一个旨在评估大语言模型 (LLM) 在交互式问题上的算法推理能力的新基准。这些问题在竞技编程中很常见,要求模型通过查询动态获取信息,而不是预先提供所有输入。该基准包括来自 Codeforces 和 AtCoder 等平台的 322 个问题,以及用于离线评估的本地交互器。初步结果显示性能存在显著差距,目前先进的模型在交互式任务上表现不佳,除了算法逻辑错误外,还经常因协议违规或超出查询预算而失败。
-
新论文将 LLM 后训练视为“遗留系统维护”
arXiv 上 Amir M. Ebrahimi 的一篇新论文提出了数据仓库工程在大型语言模型后训练方面的工业视角。该研究将此过程定义为“遗留系统维护”,即在固定资源限制下对已部署的模型进行改进,同时不引起回归。论文强调了三个关键挑战:零和混合设计、以产出率为主要指标以及在不确定性下的集成。所提出的方法侧重于产出率工程,在 Codeforces 和 LiveCodeBench v6 等编码基准测试中表现出显著的改进,同时保持了在数学数…
-
AI 推理轨迹易受跨模型解密攻击
研究人员在 Anthropic、OpenAI 和 Google 的 API 生态系统中发现了一个漏洞,该漏洞允许提取所谓的隐藏推理轨迹。通过将加密的推理块重放到较弱的兼容模型中,这些模型充当解密预言机,将不透明的轨迹解密为可读的明文。对公开的代理轨迹的扫描发现了这些解码块中的个人信息和凭据,凸显了嵌入 AI 推理输出中的敏感数据的潜在安全风险。
-
SpecCoder框架通过形式化规范增强代码大模型
研究人员开发了SpecCoder,一个旨在通过利用中间形式化规范来增强代码大模型推理能力的新框架。与自然语言不同,这些可执行的规范为代码验证、调试和修复提供了机器可检查的约束。SpecCoder使用经过验证的程序、改变行为的变异体和精炼跟踪来训练模型,以生成对正确代码有效但拒绝错误代码的规范。该框架在HumanExec基准上进行了评估,显示出Qwen2.5-Coder等模型在规范质量、正确性和完整性方面有了显著的改进。
-
研究探讨语言代理如何有效利用反馈进行改进
一篇新研究论文调查了反馈在提高语言代理性能方面的有效性。该研究在多个基准测试中引入了一个受控的学生-教师协议,比较了外部反馈、自我反馈和无指导的自我完善。研究结果表明,交互式收益主要由学生模型利用反馈的能力驱动,而不是教师的身份或反馈的可用性。该研究建议,应将基于反馈的代理与重复尝试基线进行比较,以准确衡量真正的改进。
-
研究发现,仅凭两个因素即可预测AI基准分数
一篇新研究论文提出了一种名为BenchPress的方法,该方法仅使用两个关键分数即可预测前沿模型在众多基准测试中的表现。该研究分析了84个模型和133个基准测试,发现模型的整体表现主要由两个潜在因素决定。这种方法可以显著减少所需的评估次数,表明仅使用五个基准测试的子集就可以高精度地预测模型的完整评分卡。
-
尽管Gemini 3.1 Pro取得成功,AI代理在代码规范自动形式化方面仍面临挑战
研究人员推出了Verus-SpecGym,这是一个代理环境和基准测试,旨在评估AI模型将非正式编程问题转化为正式规范的能力。该系统将生成的规范与官方测试用例和对抗性示例进行比对,解决了确保正式规范准确反映用户意图的挑战。尽管像Gemini 3.1 Pro这样的前沿模型取得了令人鼓舞的结果,准确率高达77.8%,但该过程仍然脆弱,表明规范自动形式化是经过验证的代码生成的独特瓶颈。
-
新的自蒸馏方法提高了大型语言模型在推理任务上的性能
研究人员开发了新的大型语言模型自蒸馏技术,可在不依赖外部反馈的情况下提高其性能。AVSD(自适应视图自蒸馏)在多个特权信息视图之间平衡共识信号,并使用视图特定的残差来增强学习。自策略蒸馏(SPD)从梯度中提取能力子空间,以提高性能和泛化能力,尤其是在代码生成和数学推理方面。CEPO(对比证据策略优化)通过对比正确答案和错误答案来锐化关键标记的信用分配,从而提高了多模态数学推理基准的准确性。
-
DeepSeek V4 的架构大幅降低了成本,并在编码基准测试中表现出色
DeepSeek V4 于 2026 年 4 月 24 日发布,其架构具有五个关键技巧,有助于提高成本效益。该模型在 Codeforces 上的评分为 3,206,创下了有史以来的最高纪录。
-
Google 升级 Gemini 3 Deep Think 以用于科学和工程领域
Google 发布了 Gemini 3 Deep Think 的升级版本,这是一种专门用于应对复杂科学、研究和工程挑战的推理模式。新版本已提供给 Google AI Ultra 订阅用户和通过 Gemini API 的部分研究人员。早期测试者已使用 Deep Think 识别同行评审论文中的逻辑缺陷,优化半导体材料的晶体生长,并加速物理组件的设计。该模型还创下了新的基准记录,包括在 Humanity's Last Exam 上设定了新…
-
新的 Gemini 3 Deep Think,Anthropic 300亿美元 @ 3800亿美元,GPT-5.3-Codex Spark,MiniMax M2.5
Google DeepMind 发布了 Gemini 3 Deep Think V2,这是 Google AI Ultra 订阅用户的新推理模式,并可通过 API 提前访问。该模型在 ARC-AGI-2 等基准测试中取得了 84.6% 的准确率,创下新的最先进水平,并在 Humanity's Last Exam 和竞赛编程方面表现出色。该模型还因其效率而受到关注,每项任务成本降低 82%,并在科学和工程工作流程中具有实际应用,包括论文…
-
OpenAI 的 o1 模型展现出高级推理能力,而谷歌和苹果则在探索新的 LLM 训练方法。
OpenAI 发布了其新模型 OpenAI o1-preview 的早期版本,该模型在推理能力方面相比 GPT-4o 有显著提升。该模型在竞赛编程、高级数学考试和复杂的科学基准测试中表现出色,在某些领域超越了人类专家的表现。这种进步归功于一种大规模强化学习算法,该算法通过思维链教会模型进行生产性思考,并且性能随着训练和测试时间的计算量而扩展。