一项基准测试评估了三个 AI 模型——Claude Sonnet 5.5、Claude Opus 5.5 和 Gemini 3.7 Flash——在复制到新单元格时正确更新电子表格公式的能力。Claude Opus 5.5 和 Gemini 3.7 Flash 获得了满分,在所有测试案例中都能准确返回更新后的公式。Claude Sonnet 5.5 表现不佳,得分仅为 0.25,即使在部分理解引用移动的情况下,也常常无法提供可用的公式。 AI
影响 凸显了大型语言模型在实际电子表格辅助方面的能力差异,表明模型选择对公式操作的可用性有显著影响。
排序理由 AI 模型在特定任务上的性能基准测试。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →