SpreadsheetBench
PulseAugur coverage of SpreadsheetBench — every cluster mentioning SpreadsheetBench across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的BREW框架使LLM代理能够从经验中学习
研究人员开发了BREW,这是一个新颖的框架,旨在使基于大型语言模型(LLM)的代理能够从过去的经验中学习。与每次会话都重新开始学习的当前代理不同,BREW将交互轨迹提炼成结构化的自然语言食谱知识库。该知识库捕获有关任务执行、适用性和潜在陷阱的基本信息。该系统利用扩展和收集蒙特卡洛树搜索算法来高效地构建和检索知识,并结合了事后重新标记,将不成功的尝试转化为学习机会。在OSWorld和tau^2-Bench等基准测试的评估中,与基线代理和…
-
新的 ProCUA-SFT 数据集提升了 AI 代理的桌面性能
研究人员开发了 ProCUA-SFT,一个旨在改进与图形桌面环境交互的计算机使用代理(CUAs)训练的新数据集。AgentNet 等现有数据集已显示出负迁移效应,阻碍了性能。ProCUA-SFT 由 310 万个来自合成轨迹的步级样本组成,通过使用自动化的任务生成和验证管道来解决这个问题。在 ProCUA-SFT 上微调 UI-TARS 7B 模型,在 OSWorld 基准测试上显著提高了性能,优于在 AgentNet 上训练的模型。…
-
AI模型Excel准确性基准测试;专业工具领先
一项名为SpreadsheetBench的新基准测试评估了AI模型在处理Excel文档方面的准确性。该基准测试使用了来自Excel论坛的真实任务,要求逐个单元格的精确准确性,并测试复杂的公式依赖关系和结构重组。Dealglass和Leni等专业AI工具的准确率超过90%,显著优于Claude Opus 4.6(约80%)和GPT 5.4(70%多)等通用模型。
-
SkillOpt 使用经过验证的参数编辑来优化 AI 代理技能
一篇新论文介绍了一种名为 SkillOpt 的方法,该方法通过将 markdown 技能文件视为可训练参数来优化 AI 代理技能。该方法使用一个前沿模型来提出有界编辑,然后根据保留集进行验证,只接受严格的改进。这种方法表明,最佳技能可以通过少量接受的编辑收敛,并且优化后的技能可以在不同模型之间有效迁移,甚至可以提高基准测试的性能。