Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,在八项基准测试中均取得顶级性能,并将某些任务的价格降低了高达 45%。Fable 5.1 在多步推理和遵循风格提示方面有所改进,而 Mythos 5.1 在科学研究和编码方面取得了显著进展,包括蛋白质设计亲和力提高 10 倍,计算生物学任务速度提高 2.5 倍。此次发布还引入了一种新的反蒸馏机制,以防止操纵对话历史和上下文。 AI
影响 在科学和编码基准测试中设定了新的 SOTA(State-of-the-Art),可能降低复杂 AI 任务的成本并提高研究能力。
排序理由 前沿实验室模型发布,附带系统卡和基准测试结果。[lever_c_从 frontier_release 降级:ic=1 ai=1.0]
- Adaptyv Bio
- Anthropic
- Claude
- EnVision
- European Space Agency
- Fable 5.1
- Flix Rieseberg
- GPT 5.6 "Sol"
- Mythos 5.1
- Nasa
- Veritas
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →