根据英国人工智能安全研究所的数据,OpenAI 的新 GPT-6 Astra 模型展示了显著更长的自主任务范围,达到 30.9 分钟,而 GPT-5.6 Sol 为 3.6 分钟。这种扩展的能力允许更复杂、无人值守的任务,例如在不到 19 小时内从屏幕截图中完成游戏,而 GPT-5.6 Sol 完成此任务花费了超过 96 小时。尽管取得了这些进展,GPT-6 Astra 的访问仍然受到限制,许多用户,特别是那些依赖具有 ChatGPT 账户的 Codex 的用户,目前仍无法运行该模型。 AI
影响 在自主任务范围方面设定了新的 SOTA,可能支持更长的无人值守的代理工作流。
排序理由 前沿实验室模型发布,附带系统卡和独立基准测试。[lever_c 从 frontier_release 降级:ic=1 ai=1.0]
在 dev.to — Claude Code tag 阅读 →
- Artificial Analysis
- ChatGPT
- Claude Fable 5.1
- codex
- GPT-5.5
- GPT-5.6 Sol
- GPT-6 Astra
- OpenAI
- UK AI Safety Institute
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →