FrontierCode 1.1 Main
PulseAugur coverage of FrontierCode 1.1 Main — every cluster mentioning FrontierCode 1.1 Main across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Cognition 的 SWE-2 在简单任务上表现出色,但在困难的对抗性问题上遇到困难
Cognition 的新模型 SWE-2 在简单基准测试中表现出色,得分接近完美,为更简单的任务提供了强大的性价比。然而,对其在更困难、对抗性任务上表现的深入分析显示,与 TB2.1 分数相比,在 Terminal-Bench TB4 上得分下降了 65.5 分。这种鲜明的对比表明 SWE-2 的优势在于工作负载的“易处理切片”,而其在真正具有挑战性的问题上的表现落后于 Fable 5.1 和 GPT-6 Astra 等竞争对手,这表…
-
Google 快速迭代 Gemini Flash 模型以应对专业编码任务
Google 在 12 周内迅速发布了其 Gemini Flash 模型的三个迭代版本,每个版本都针对特定改进。5 月份推出的 Gemini 3.5 Flash 提供了高速性能。随后在 7 月份推出了 Gemini 3.6 Flash,专注于优化 token 使用并降低成本。最新发布的 Gemini 3.7 Flash(8 月份)增强了推理和多步规划能力,在 DeepSWE v1.1 和 FrontierCode 1.1 Main 等…
-
Google 发布 Gemini 3.7 Flash,性能大幅提升且价格下调 · 跟踪 9 个来源
Google 发布了 Gemini 3.7 Flash,这是其用于编码和 AI 代理的旗舰模型的最新版本,距离前代 Gemini 3.6 Flash 发布仅三周。此次更新在软件工程、知识工作和 Web 开发方面提供了显著的性能改进,在编码准确性和复杂文档处理方面取得了显著进展。Gemini 3.7 Flash 的推出价格也比其前代产品低一半,旨在为开发人员和客户提供具有成本效益的扩展。新模型已集成到 Gemini Spark 中,增强…