实体
DocSem
DocSem
PulseAugur coverage of DocSem — every cluster mentioning DocSem across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
EVICALC 系统在 DocSem 任务中准确率达 8.61%,凸显 OCR 挑战
一个名为 EVICALC 的系统,专为 DocSem 共享任务设计,在 1,730 个任务上实现了 8.61% 的联合准确率。该系统通过选择段落来处理 PDF,使用语言模型生成算术表达式,然后在本地评估这些表达式。一个单独的公开验证运行获得了更高的分数,准确率为 92.17%,证据 F1 为 1.00,尽管由于配置不同,这些指标不能直接比较。分析显示,光学字符识别错误(如合并文本块)等问题可能导致系统从不相关的内容中回答。
-
AI推理:在数值任务中,优化架构胜过模型规模
一篇新的研究论文探讨了不同AI系统架构在定量推理任务中的有效性,尤其是在文档理解方面。研究发现,对于涉及数值推理的任务,应用架构和检索方法比语言模型的规模更具影响力。具体来说,“思维程序”提示技术显著提升了一个较小的7B参数模型的性能,而对一个更大的72B模型几乎没有带来收益。研究还强调,输入数据的质量,例如扫描文档的可读性,会极大地影响系统性能,甚至导致一个先前成功的系统崩溃。