International Olympiad in Informatics
PulseAugur coverage of International Olympiad in Informatics — every cluster mentioning International Olympiad in Informatics across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI模型在国际信息学奥林匹克竞赛中超越顶尖人类选手
一篇新的研究论文详细介绍了一种训练大型语言模型以在竞赛编程中取得顶尖表现的方法。研究人员开发了一个包含问题策展、合成推理跟踪、监督微调和强化学习的流程。他们的模型 Nemotron-3-Nano-CC 和 Nemotron-3-Ultra-CC 表现出显著的改进,其中 Ultra-CC 最终在 2026 年国际信息学奥林匹克竞赛 (IOI) 中超越了得分最高的人类选手。
-
新基准揭示大语言模型在交互式编程问题上存在困难
研究人员推出了 InteractBench,这是一个旨在评估大语言模型 (LLM) 在交互式问题上的算法推理能力的新基准。这些问题在竞技编程中很常见,要求模型通过查询动态获取信息,而不是预先提供所有输入。该基准包括来自 Codeforces 和 AtCoder 等平台的 322 个问题,以及用于离线评估的本地交互器。初步结果显示性能存在显著差距,目前先进的模型在交互式任务上表现不佳,除了算法逻辑错误外,还经常因协议违规或超出查询预算而失败。
-
AI模型在编码竞赛中取得金牌表现,超越顶尖人类选手
研究人员开发了一个专门的流程来训练大型语言模型进行竞争性编程,在诸如国际信息学奥林匹克竞赛(IOI)和国际大学生程序设计竞赛(ICPC)等挑战性国际竞赛中取得了金牌表现。通过结合精选的问题、合成推理轨迹、监督微调和强化学习,他们训练了Nemotron-3-Nano-CC和Nemotron-3-Ultra-CC等模型。他们的GenCorrect策略在测试时进一步优化了解决方案,使AI系统在IOI 2026中超越了顶尖人类分数,标志着一个…
-
新研究发现AI模型干预不可靠
一项新的研究论文表明,通过操纵稀疏自编码器(SAE)特征来抑制AI模型中不良行为的干预措施是不可靠的。研究表明,即使在特定SAE特征被钳制的情况下,AI模型也可以通过残差空间中的替代路径恢复被抑制的行为。这一发现突显了在控制单个特征与确保完全行为控制之间存在的关键差距,尤其是在拒绝引导等安全关键应用中。
-
新框架为AI电路发现提供稳定、可证明的保证
研究人员开发了一个名为Certified Circuits的新框架,以提高识别神经网络中机械电路的可靠性。该方法提供了可证明的稳定性保证,确保发现的电路对特定数据集的依赖性较低,并且对分布外数据更具鲁棒性。通过使用随机数据子采样,Certified Circuits可以识别稳定的组件,并为跨各种架构和任务的模型行为产生更紧凑、更准确的解释。
-
OpenAI 的 o1 模型展现出高级推理能力,而谷歌和苹果则在探索新的 LLM 训练方法。
OpenAI 发布了其新模型 OpenAI o1-preview 的早期版本,该模型在推理能力方面相比 GPT-4o 有显著提升。该模型在竞赛编程、高级数学考试和复杂的科学基准测试中表现出色,在某些领域超越了人类专家的表现。这种进步归功于一种大规模强化学习算法,该算法通过思维链教会模型进行生产性思考,并且性能随着训练和测试时间的计算量而扩展。