一项新研究使用更新后的Financial Touchstone基准测试了开放权重语言模型在金融文本理解方面的能力,该基准包含来自国际年报的近3000个问答对。研究发现,虽然Anthropic的Claude Opus 4.6准确率最高,Google的Gemini 2.5 Pro幻觉率最低,但Kimi K2.6和GLM 5等几款开放权重模型表现出了竞争力。研究还强调,信息检索是一个重要的瓶颈,并指出一些中国模型中的地缘政治内容过滤器可能会拒绝合法的金融查询。 AI
影响 挑战了需要专有模型才能实现强大金融理解能力的假设,表明开放权重模型是可行的替代方案。
排序理由 该集群包含一篇提出新基准和模型评估的学术论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- Anthropic
- Claude Opus 4.6
- DeepSeek V3.2
- Financial Touchstone
- Gemini 2.5 Pro
- GLM 4.7
- GLM 5
- Kimi K2.6
- Mistral 3
- Qwen3 Max
- Alibaba
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →