实体
SWE-bench-Live
SWE-bench-Live
PulseAugur coverage of SWE-bench-Live — every cluster mentioning SWE-bench-Live across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新型Tiel-Coder 35B模型在编码和长对话方面表现出色
一款名为Tiel-Coder-35B-A3B的新型开源模型已发布,该模型针对编码任务和长对话进行了优化。它在SWE-bench-Live基准测试中取得了强劲的性能,修复了25个问题中的12个,这与Anthropic的Opus 4.6中型模型相当。虽然Tiel在编码和多轮对话方面表现出色,但在琐事和常识任务方面能力较弱,在MMLU-Pro上的得分低于同类其他模型。
-
新的 Qwen 聊天模板提升编码和知识工作效率
一款名为 Qwen-Sharp-Chat-Templates 的新聊天模板已发布,旨在优化 Qwen 模型在知识工作和编码方面的表现。该模板通过减少填充标记和提高每标记的通信效率,使 Qwen3.8-27b 等模型更加智能和高效。在 SWE-bench-Live 上的早期测试表明,使用 Sharp 模板的模型可以在一半的时间内找到解决方案,其中一种配置的性能与 Anthropic 的 Claude Opus 5 相当,另一种配置的性能…