研究人员开发了 PortBench,这是一个旨在评估大型语言模型 (LLM) 在投资组合管理方面能力的基准测试。现有的基准测试未能考虑到关键的跨资产相关性以及完整的决策流程。PortBench 通过一个静态问答数据集和一个动态的五阶段配置流程来解决这些不足,并引入了新的指标来评估投资组合的多样化和误差累积。对十个前沿 LLM 的评估显示,90% 的 LLM 的表现不如简单的等权重策略,即使是合规的模型在压力时期也会出现显著的回撤。 AI
影响 突显了当前 LLM 在复杂金融决策中的关键局限性,为实际应用需要进一步研究。
排序理由 这是一篇介绍用于评估 LLM 在特定领域能力的基准测试的研究论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →