finance
PulseAugur coverage of finance — every cluster mentioning finance across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
语言模型测试时扩展瓶颈已在输出选择中识别
一篇新的arXiv论文研究了语言模型的测试时扩展(TTS)技术,该技术通过使用额外的推理计算来改进输出。研究发现,虽然扩展探索有效地提高了各种领域(如医学、法律、金融和创意写作)的候选输出质量,但利用阶段——选择最佳最终输出——是主要瓶颈。这是因为奖励模型与真实质量之间的相关性很低,使得选择近乎随机。跨候选的综合分析显示质量持续提高,但仍只恢复了约40%的潜在质量,这表明选择候选池中的内容,而不是生成更多候选,是限制因素。
-
arXiv 调查统一事件流建模的自监督学习
一篇新发表在 arXiv 上的调查论文回顾了事件流 (ES) 建模的自监督学习 (SSL) 方法。该论文解决了利用医疗保健、电子商务和金融等领域的海量 ES 数据所面临的挑战,主要是由于缺乏标记数据和研究碎片化。它提出了一个 SSL 技术统一分类法,包括预测和对比范式,并概述了可扩展、领域无关的 ES 建模框架的未来研究议程。目标是促进创新,提高 SSL 在各种现实世界事件流挑战中的适用性。
-
Talordata API增加了广泛的Google搜索类型、Bing和Yandex支持
Talordata已扩展其API,以包含更全面的Google搜索覆盖范围,集成了AI Mode、Finance、Flights、Hotels、Lens和Google Play商店等功能。该API还支持与Bing和Yandex搜索引擎的完全集成,通过单一API提供33种不同的搜索类型。
-
新系统将安全意图编译为可执行的网络拓扑
研究人员开发了TopoIntent系统,该系统旨在将自然语言安全需求转换为可执行的网络拓扑。该系统利用模式契约进行生成,通过密集向量搜索从模板库中检索参考架构,并通过分阶段融合来对齐意图与模板。TopoIntent根据CIS Controls v8.1.2安全措施检查生成的拓扑,并使用加法编辑来修复结构性差距,最终将其导出为带有iptables ACL的Mininet脚本进行测试。从参考安全架构图构建的评估集证明了CIS满意度和策略通…
-
调查详述了GPT-4o等NLP模型的实际可解释性
一篇新发表在arXiv上的调查论文,考察了可解释自然语言处理(XNLP)在医疗、金融和客户服务等不同领域的实际应用。该论文强调了像GPT-4o、Gemini和BERT这样的NLP模型日益增长的决策制定作用,以及对其透明度的关键需求。论文分析了七个不同应用领域中所需的解释类型、所使用的方法和评估策略,并指出了当前研究在实际应用性和人类判断方面的不足。
-
新的Chartography基准测试揭示AI在专业图表理解方面存在困难
一项名为Chartography的新基准测试已被开发出来,用于评估AI在医学、工程、金融和科学等各个领域的专业图表理解能力。与现有基准测试不同,Chartography包含100项任务,图表采用专业格式,问题由领域专家设计,并经过独立验证。目前最先进的模型在此基准测试上面临挑战,准确率最高仅为45.0%,表明在视觉感知、读取细微特征和解释领域特定约定方面存在重大困难。
-
B2B SaaS 服务台优先考虑工单标记的成本可预测性
一家 B2B SaaS 服务台架构优先考虑工单标记的每个租户成本可预测性,而非原始准确性。该系统要求每个标签都与租户和成本相关联,需要一个仅追加的账本用于使用记录,以避免重复收费并确保准确计费。对于标记,建议使用嵌入分类器,因为它具有成本可预测性并能利用现有的标记数据,而零样本 LLM 则适用于覆盖不太常见的标签或新租户。
-
研究发现:AI免责声明可能增加过度自信
一篇新研究发布在arXiv上,标题为“透明度陷阱:AI免责声明如何导致高风险决策中的过度自信”,探讨了AI免责声明的有效性。该研究涉及52名参与者,在金融、医学和AI生成内容领域进行了378次回复,发现由于警告习惯化和透明度悖论,免责声明通常无法阻止过度依赖。在某些情况下,参与者将免责声明解读为诚实的迹象,反而增加了信任。研究表明,当前标准化的AI免责声明不足以在关键场景中实现负责任的AI设计和消费者保护。
-
新方法简化金融监管的机器学习方程
研究人员开发了一种方法,可以将复杂的机器学习方程简化为更易读的格式,适用于金融等受监管行业。该过程从一个可解释的方程开始,逐步将其简化为修剪后的单项式、如果-则规则或整数评分卡等形式。在金融数据集上的实证测试表明,这些简化可以在显著提高监管机构和背景各异的专业人士的可读性的同时,保持高保真度和预测性能。
-
开发者构建AI引擎以捕获金融数学错误
一位开发者创建了一个确定性引擎,旨在识别和纠正AI系统在金融计算中出现的错误。该引擎旨在防止这些错误被部署到实际应用中,尤其是在金融领域。开发者正在寻求用户的关键反馈,以便在进一步开发之前完善该系统。
-
AI需要新的企业数据平台来理解含义,而不仅仅是结构
为人类用户设计的传统企业数据平台,无法满足AI系统的需求。未来的平台必须超越简单的数据存储和处理,使机器能够理解数据的含义、关系和业务背景。这需要一个连接业务概念和物理数据的新基础设施层,使AI能够解释信息,而不仅仅是检索它。
-
新的基准测试和研究揭示了LLM安全与性能的权衡 · 已追踪2个来源
两篇新研究论文探讨了大语言模型(LLM)的安全与性能权衡。第一篇论文介绍了Trident-Bench,一个旨在专门评估金融、医疗和法律领域LLM安全性和合规性的基准测试,并强调虽然通用模型表现出基本能力,但领域特定模型在伦理细微问题上常常表现不佳。第二篇论文研究了LLM的越狱防御如何负面影响性能,增加对良性输入的过度拒绝,并提高推理成本,同时提供了基于部署限制选择防御机制的指导。
-
Databricks 概述了金融领域的人工智能用例和负责任的部署
Databricks 发布了一份指南,详细介绍了人工智能在金融领域的实际应用,涵盖信用评分、算法交易和金融自动化等领域。该指南通过可解释的人工智能、数据沿袭文档记录以及对参与关键金融决策的人工智能代理进行人工监督,强调负责任的部署。它还概述了一个分阶段的实施方法,首先进行优先试点项目和严格评估,然后再进行企业范围的扩展。
-
新理论揭示合成数据在类别不平衡学习中的有效性问题
一种新的数据依赖有效性理论和去偏测试挑战了长期以来为解决机器学习中类别不平衡问题而制造合成少数类数据的做法。研究表明,合成数据通常是冗余或无效的,尤其是在类别重叠时,并且经典的验证方法存在缺陷。提出的去偏估计器能密切跟踪真实的无效性,揭示大多数方法未能提供显著的信息增益,甚至可能损害校准,这表明合成数据生成方法的证明责任发生了转移。
-
LLM转SQL系统因模式漂移和歧义而面临生产环境中静默失效的风险
LLM转SQL系统虽然为自然语言分析带来了希望,但在生产环境中面临严峻挑战。当数据库模式发生变化或业务定义演变时,这些系统可能会静默失效,导致答案不正确,从而损害信任。一个关键问题是模式漂移,即模型在模式更新后仍继续使用过时字段,产生陈旧结果但不会报错。此外,LLM可能难以处理“活跃用户”等歧义术语,在未获用户澄清的情况下自行选择一种定义,这可能导致高管、数据分析师和产品经理做出错误的决策。
-
Databricks 迁移检查表侧重于验证以防止财务问题
一份迁移到 Databricks 的检查表强调了成功切换所需的关键验证步骤。该过程涉及七项关键检查,以确保数据完整性并防止财务差异,例如收入下降,如果迁移后的数据不能准确反映之前的业务运营,就可能发生这种情况。虽然使用现代工具进行数据迁移本身变得更加容易,但证明迁移数据的准确性仍然是一个重大挑战。
-
自适应 Mamba 神经算子为求解 PDE 提供新范式
研究人员推出自适应 Mamba 神经算子 (AMO),这是一个用于在各种几何形状和网格上求解偏微分方程 (PDE) 的新颖框架。AMO 集成了再生核与状态空间模型,符合自适应傅里叶分解理论,以逼近 PDE 解流形。在流体物理、固体物理和金融领域的基准测试中,AMO 与现有求解器相比表现出卓越的性能,为可解释的神经算子设计提供了一种新方法。
-
AI生成的UI在关键领域嵌入了无障碍障碍
AI生成的用户界面经常包含无障碍障碍,这些障碍正被整合到教育、医疗和金融等关键领域。这种在没有适当无障碍检查的情况下自动化UI设计的做法,有加速歧视的风险。需要审计工具来解决这一差距。
-
运筹学博士寻求高价值行业的高级机器学习技能
一位拥有科技巨头背景的运筹学和工程学博士正在寻求转型,进入机器人、国防和金融等高价值行业的高级机器学习领域。他们希望通过专注于实用的、数学密集型的建模技能来提高自己的市场竞争力,特别是在因果推断、XGBoost等高级树模型以及用于控制系统的强化学习等领域。该人士正在寻求关于如何优先考虑机器学习主题以获得最高薪酬、展示超越API使用的实际实施技能以及如何有效地向潜在雇主推销其“预测-优化”方法的指导。
-
联邦研究发现:工程学位的早期职业薪资最高
纽约联邦储备银行的一项研究表明,工程学位的毕业五年内收入潜力最高。研究发现,收入最高专业的前80%都属于工程领域,其中计算机工程毕业生的中位数年薪为9万美元。相反,文科和人文学科的学位收入则显著较低,一些专业的年收入低至3.8万美元。即使在工程学内部,航空航天和电气工程等专业领域也比普通工程学位的薪资更高。