Anthropic 发布了 Claude Fable 5.1,据称该模型在编码、知识工作和长期问题解决任务方面设定了更高的标准。该模型在新发布的 Terminal-Bench-Science 0.1 基准测试中取得了 52.6% 的分数,相比之前的版本以及 GPT 5.6 "Sol" 等竞争对手有了显著提升。虽然初步测试显示在较低的计算量设置下推理能力有限,但在较高的设置下,输出越来越详细和复杂,其中“最大”计算量设置生成了一个高度详细的动画鹈鹕 SVG,但仍不及 Gemini 3.7 Flash 的风格。 AI
影响 为编码和科学任务树立了新标杆,可能影响企业采用和竞争性基准测试。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- Anthropic
- Claude Fable 5.1
- Gemini 3.7 Flash
- GPT 5.6 "Sol"
- Python
- Simon Willison
- Terminal-Bench-Science 0.1
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →