一项名为FinRiskAtlas的新中文基准已被开发出来,用于评估大型语言模型在金融风险审查中的决策能力。该基准评估模型执行特定审查操作以及判断是否存在足够证据支持决策的能力,超越了通用的金融知识。结果表明,广泛的金融能力得分并不能完全预测模型在专业工作流程中的可靠性,这凸显了与现实世界决策和证据状态相一致的评估的必要性。 AI
影响 该基准通过关注决策对齐,有望促使更可靠的大型语言模型在金融风险评估中得到部署。
排序理由 该集群包含一篇介绍LLM新评估基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →