stirrup
PulseAugur coverage of stirrup — every cluster mentioning stirrup across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
分析称 OpenAI 的 GPT-6 Astra 在图形方面取得重大进展
Sebastian Raschka 的分析表明,OpenAI 的新 GPT-6 Astra 模型在图形任务方面比前代 GPT-5.6 "Sol" 有显著改进,并在 ARC-AGI-3 基准测试中取得了近乎完美的成绩。虽然 Astra 在数学和编码方面表现出色,但其在代理编码任务上的领先优势不那么明显,这可能归因于基准测试特定的训练。文章还深入探讨了“循环 Transformer”的概念及其与高级 AI 模型中“隐藏推理”的潜在联系。
-
Anthropic 的 Claude Opus 5 领跑 agentic 指数,Qwen3.8 Max 紧随其后 · 跟踪 1 个来源
Artificial Analysis 的 Agentic Index 显示 Anthropic 的 Claude Opus 5 领先,阿里巴巴集团的 Qwen3.8 Max 紧随其后。虽然一些报道错误地宣称 Qwen 是顶级模型,但该指数实际上将 Claude Opus 5 置于最高推理努力的第一位,Qwen3.8 Max 并列第二。该指数的方法论通过平均 agentic 基准测试和检查数据库状态,而不是依赖模型摘要,突显了严格评估的重要性。
-
Kimi K3 以 94.6% 的通过率领跑 Harvey 法律代理基准
Artificial Analysis 发布了其 Harvey LAB-AA 基准测试的结果,该测试使用 Stirrup 代理实现了 Harvey 法律代理基准 (LAB)。评估使用了 Harvey 数据集,该数据集包含 24 个法律领域的 120 个私有任务,以评估按标准划分的通过率和总体通过率。Kimi K3 取得了最高分 94.6%,其次是 Claude Fable 5 的 93.6% 和 Muse Spark 1.1 的 93…