一个拥有270亿参数的模型在Terminal-Bench基准测试中取得了显著的进步, 将其分数从1.4%提高到5.4%。这一进展并非源于模型规模的扩大, 而是归功于一种新颖的训练方法, 该方法专注于生成真实的强化学习(RL)梯度信号, 而非肤浅的信号。 AI
影响 展示了一种新的训练方法, 可以在无需增加参数数量的情况下提高模型性能。
排序理由 该集群描述了AI模型的特定基准测试改进, 表明了一个研究里程碑。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →