PulseAugur
实时 12:56:46
实体 FinED-Bench

FinED-Bench

PulseAugur coverage of FinED-Bench — every cluster mentioning FinED-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_200105 ·

    新基准显示大型语言模型在金融文件错误检测方面存在困难

    一项名为 FinED-Bench 的新基准测试已被推出,用于评估大型语言模型 (LLM) 在金融文件错误检测方面的能力。该基准测试包含 2025 年的 900 多份真实金融文件,涵盖九种场景和三个认知复杂性级别。使用 GPT-4o 和 Qwen3-14B 等模型进行的初步评估表明,当前的大型语言模型在此任务上面临挑战,尤其是在更复杂的情况下,尽管监督微调显示出提高性能的潜力。