SWE-Bench Multilingual
PulseAugur coverage of SWE-Bench Multilingual — every cluster mentioning SWE-Bench Multilingual across labs, papers, and developer communities, ranked by signal.
-
新工具PAIChecker识别LLM基准中的PR-问题不匹配
研究人员开发了PAIChecker,一个多智能体系统,旨在识别和纠正用于评估大型语言模型(LLM)的基准中拉取请求(PR)与其相关问题之间不匹配的情况。对SWE-bench Verified实例的研究显示,在各种模式下,13.6%的PR-问题配对存在不匹配。PAIChecker采用三阶段方法,结合模式识别、标签合成和代码级验证,以确保更准确和可泛化的基准构建。实验表明,PAIChecker在SWE-Gym和SWE-bench Mult…
-
MindForge 管道训练小型 LLM 完成软件工程全生命周期
研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…
-
Poolside AI 发布 Laguna S 2.1,一款拥有 1M 上下文的紧凑型编码模型
Poolside AI 发布了 Laguna S 2.1,这是一款拥有 118B 参数的混合专家模型,其中 8B 参数被激活,并拥有 1M token 的上下文窗口。该模型在不到九周的时间内开发完成,在长时程编码基准测试中表现强劲,在同级别模型中超越了体积大其数倍的模型。Laguna S 2.1 在 Terminal-Bench 2.1 上获得了 70.2% 的分数,在 DeepSWE v1.1 上获得了 40.4% 的分数,所有评估…
-
小米的MiMo-V2-Flash凭借高效的MoE架构引领开源编码基准测试
小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation…
-
Tencent 发布 Hy3,一个开放的 295B MoE 模型,支持 256K 上下文
Tencent 发布了 Hy3,一个开源的 2950 亿参数专家混合(MoE)模型,专为复杂推理、代理工作流和长上下文任务而设计。该模型每个 token 只激活 210 亿参数,在保持效率的同时支持 256K 的上下文窗口。Hy3 在编码、STEM 和推理任务等各种基准测试中表现出色,并经过特定训练以提高工具调用中的可靠性、减少幻觉并增强多轮意图跟踪。该模型可通过兼容 OpenAI 的 API 访问,并提供 `reasoning_ef…
-
Dockerless 无需运行测试即可验证 AI 编码代理补丁
研究人员推出了一种名为 Dockerless 的新方法,无需执行存储库特定的测试即可验证 AI 编码代理生成的代码补丁。该方法通过采用“无执行”的裁判来绕过为每个存储库构建 Docker 容器的成本高昂且耗时的过程。该裁判能动地探索代码库以收集证据并确定补丁的正确性,在 SWE-bench Verified 基准测试上达到了 62.0% 的解决率。
-
Poolside 发布 Laguna M.1,一款用于代理编码的 225B MoE 模型
Poolside 发布了 Laguna M.1,这是一款拥有 2250 亿参数的混合专家(MoE)模型,专为代理编码任务进行了优化。该模型采用了具有 256 个专家的稀疏 MoE 架构和全局注意力机制,使其能够处理长时程工作和带有工具调用的交错推理。Laguna M.1 在 SWE-bench Verified 和 Terminal-Bench 2.0 等代理基准测试中表现出色,可与其他领先的开放权重模型和前沿模型相媲美。该模型在 A…
-
Fireworks AI 实现万亿参数 MoE 模型训练
Fireworks AI 开发了新的训练基础设施,能够微调万亿参数的混合专家(MoE)模型,克服了之前的内存和编排瓶颈。该平台在最近发布的 Cursor Composer 2.5 中发挥了关键作用,Composer 2.5 是一个在多个基准测试中取得顶尖性能的编码模型。该系统利用低精度专家量化和优化器状态卸载等技术来管理大型 MoE 模型内存需求,使其更容易进行训练和微调。