PulseAugur
实时 07:22:23
实体 SpreadsheetBench

SpreadsheetBench

PulseAugur coverage of SpreadsheetBench — every cluster mentioning SpreadsheetBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. SIGNIFICANT · CL_242890 ·

    蚂蚁集团“百灵”发布金融大模型及评测基准

    蚂蚁集团“百灵”发布了其首个金融增强开源大模型Ling-3.0-flash-Fin,旨在处理复杂的金融工作流,而非简单的问答。该模型的目标是推动AI从回答单一问题转向完成投资研究中的整个任务,涵盖信息检索、推理、估值建模和报告撰写。与模型一同发布的还有“百灵”的金融智能体评测基准FinFIRST,用于评估AI处理需要溯源和可验证结论的真实金融任务的能力。

  2. COMMENTARY · CL_185732 ·

    ChatGPT 的电子表格准确性受到独立测试质疑

    一项最新分析显示,尽管 OpenAI 声称 ChatGPT 在处理财务电子表格方面具有高准确性,但实际表现却存在显著差异。OpenAI 报告称,在构建财务模型方面,其内部基准测试的准确率从 43.7% 提高到 87.3%,但华尔街预科学校(Wall Street Prep)的一项独立测试在涉及苹果公司财务模型的实际任务中,给 ChatGPT 的评分仅为 2.5 分(满分 10 分)。这种差异凸显了不同的测试方法论,供应商基准测试侧重于…

  3. TOOL · CL_139589 ·

    新的BREW框架使LLM代理能够从经验中学习

    研究人员开发了BREW,这是一个新颖的框架,旨在使基于大型语言模型(LLM)的代理能够从过去的经验中学习。与每次会话都重新开始学习的当前代理不同,BREW将交互轨迹提炼成结构化的自然语言食谱知识库。该知识库捕获有关任务执行、适用性和潜在陷阱的基本信息。该系统利用扩展和收集蒙特卡洛树搜索算法来高效地构建和检索知识,并结合了事后重新标记,将不成功的尝试转化为学习机会。在OSWorld和tau^2-Bench等基准测试的评估中,与基线代理和…

  4. RESEARCH · CL_95769 ·

    新的 ProCUA-SFT 数据集提升了 AI 代理的桌面性能

    研究人员开发了 ProCUA-SFT,一个旨在改进与图形桌面环境交互的计算机使用代理(CUAs)训练的新数据集。AgentNet 等现有数据集已显示出负迁移效应,阻碍了性能。ProCUA-SFT 由 310 万个来自合成轨迹的步级样本组成,通过使用自动化的任务生成和验证管道来解决这个问题。在 ProCUA-SFT 上微调 UI-TARS 7B 模型,在 OSWorld 基准测试上显著提高了性能,优于在 AgentNet 上训练的模型。…

  5. TOOL · CL_61569 ·

    AI模型Excel准确性基准测试;专业工具领先

    一项名为SpreadsheetBench的新基准测试评估了AI模型在处理Excel文档方面的准确性。该基准测试使用了来自Excel论坛的真实任务,要求逐个单元格的精确准确性,并测试复杂的公式依赖关系和结构重组。Dealglass和Leni等专业AI工具的准确率超过90%,显著优于Claude Opus 4.6(约80%)和GPT 5.4(70%多)等通用模型。

  6. TOOL · CL_52060 ·

    SkillOpt 使用经过验证的参数编辑来优化 AI 代理技能

    一篇新论文介绍了一种名为 SkillOpt 的方法,该方法通过将 markdown 技能文件视为可训练参数来优化 AI 代理技能。该方法使用一个前沿模型来提出有界编辑,然后根据保留集进行验证,只接受严格的改进。这种方法表明,最佳技能可以通过少量接受的编辑收敛,并且优化后的技能可以在不同模型之间有效迁移,甚至可以提高基准测试的性能。