实体
DTBench
DTBench
PulseAugur coverage of DTBench — every cluster mentioning DTBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Anthropic的Claude模型显示出能力与CDT不偏好之间的强关联
一项最新分析表明,Anthropic的Claude模型在决策理论推理能力与其不倾向于选择关键决策工具(CDT)之间存在很强的相关性。与OpenAI等其他开发商的模型相比,Claude模型(包括Opus 4.7和Fable 5)的这种相关性尤其高。研究发现,对于Anthropic的模型,能力和偏好规避CDT答案几乎是相同的,并且与发布日期密切相关。
-
新基准和模型推动文档解析和表格提取发展
研究人员推出了新的基准和改进的模型,用于文档解析和表格提取。Dr. DocBench 专注于专家级别的文档解析,包括化学式和音乐符号等复杂结构,突出了当前模型的局限性。DTBench 提供了一个用于文档到表格提取的合成基准,评估 LLM 的推理和冲突解决能力。此外,PaddleOCR-VL-1.6 通过区域感知优化和渐进式后训练得到了增强,在 OmniDocBench v1.6 上取得了最先进的结果。