Claude Opus 5 在 FoodTruck Bench 上取得了新纪录,在 30 天后以 75,264 美元的资本完成。这一结果比包括 GPT-5.5 在内的任何其他模型的先前最佳表现提高了 13.6%。该模型还以 41.4% 的显著优势超越了 GPT-5.6 Sol,展示了其先进的推理能力。 AI
影响 为大型语言模型设定了新的性能基准,可能影响未来的模型开发和评估策略。
排序理由 大型语言模型的新基准结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →