一个开源税务引擎在 TaxCalcBench 基准测试中取得了 96% 的创纪录分数,性能超越了 GPT Sol 和 An Ape and a Fox 等模型。该引擎利用 Claude Sonnet 5,在税务计算方面表现出色,其开发者指出,少数未命中之处是由于基准测试本身存在不一致性。这个确定性引擎旨在通过为 AI 模型提供可靠的计算工具,减少税务研究和准备中的猜测和错误。 AI
影响 这个开源税务引擎展示了专业工具如何提高 AI 模型在特定任务上的性能,从而可能提高金融应用的准确性。
排序理由 该项目描述了一个开源工具的新基准测试分数,这是一个面向研究的成果。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →