PulseAugur
实时 02:15:16
English(EN) PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

新的 PortBench 基准测试揭示 LLM 在投资组合管理方面存在困难

研究人员开发了 PortBench,这是一个旨在评估大型语言模型 (LLM) 在投资组合管理方面能力的基准测试。现有的基准测试未能考虑到关键的跨资产相关性以及完整的决策流程。PortBench 通过一个静态问答数据集和一个动态的五阶段配置流程来解决这些不足,并引入了新的指标来评估投资组合的多样化和误差累积。对十个前沿 LLM 的评估显示,90% 的 LLM 的表现不如简单的等权重策略,即使是合规的模型在压力时期也会出现显著的回撤。 AI

影响 突显了当前 LLM 在复杂金融决策中的关键局限性,为实际应用需要进一步研究。

排序理由 这是一篇介绍用于评估 LLM 在特定领域能力的基准测试的研究论文。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 PortBench 基准测试揭示 LLM 在投资组合管理方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yuxuan Zhao, Sijia Chen, Ningxin Su ·

    PortBench:一个用于LLM驱动的投资组合管理的、感知相关性的全流程基准测试

    arXiv:2605.27887v1 Announce Type: new Abstract: LLMs have shown strong performance across diverse financial tasks, yet portfolio management (PM), a critical financial decision-making task, remains poorly benchmarked. Existing benchmarks exhibit two main gaps: they ignore cross-as…