PulseAugur
中
实时 09:56:43
实体 Debate Benchmark

Debate Benchmark

PulseAugur coverage of Debate Benchmark — every cluster mentioning Debate Benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_182506 ·

    Qwen 3.8 Max 辩论表现提升但成本增加

    Qwen 3.8 Max 在辩论基准测试上相比其前代 Qwen 3.7 Max 表现有所提升,得分从 1462 提高到 1588。然而,这种性能的提升是以成本为代价的,每次辩论的平均成本增加了 45%。辩论基准测试旨在评估大型语言模型在各种主题上进行对抗性、多轮论证的能力,奖励知识、压力下的准确事实使用和连贯的反驳。

  2. TOOL · CL_148751 ·

    Kimi K3 在 Debate Benchmark 上排名第二,但成本高于 Kimi K2.6

    Kimi K3 模型在 Debate Benchmark 上取得了第二高的排名,仅次于 Claude Fable 5。然而,这一性能的代价是 Kimi K3 的运行成本远高于其前代 Kimi K2.6。