新的 GPT-6 Astra 模型利用循环 Transformer,其中计算块使用重复的权重运行多次,在不增加参数的情况下有效地将模型深度加倍。这种架构意味着 AI 推理的可视化追踪是事后叙述,而不是直接的计算日志。因此,通过检查 AI 代理和代码的“思维链”来评估它们变得不可靠,因为生成的文本可能无法准确反映实际的计算过程。建议开发者将评估重点放在可观察的行为上,例如工具使用、文件修改和最终输出,而不是仅仅依赖模型的书面推理。 AI
影响 这种架构转变挑战了当前的 AI 评估方法,要求我们转向可观察的行为,而不是仅仅依赖生成的推理追踪。
排序理由 前沿实验室发布的新模型,具有新颖的架构特性。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →