arXivLabs
PulseAugur coverage of arXivLabs — every cluster mentioning arXivLabs across labs, papers, and developer communities, ranked by signal.
22 天有情绪数据
-
机器学习框架利用GIS数据估算行人流量
研究人员开发了一个利用GIS数据估算行人流量的机器学习框架,旨在改善交通机构的安全投资优先排序。该提出的流程包括特征选择和梯度提升模型,与传统的负二项广义线性模型(Negative Binomial GLM)相比,交叉验证的均方根误差(RMSE)降低了12%。表现最佳的模型,即基于直方图的梯度提升模型,采用泊松损失和L1 Lasso特征选择,在留存RMSE方面也降低了19%。相关代码已在GitHub上公开。
-
新理论统一人工智能的通信、控制和决策
一篇新论文提出了一个实用信息理论的数学框架,旨在统一通信、控制和决策。该理论引入了 isoteleia 的概念,该概念将不同语义路径在导致相同最优行动时可以被视为实用等价的思想形式化。该框架将熵和信道容量等经典信息论概念扩展到面向任务的语境中,为智能系统基于其目标和资源约束可以提取的效用设定了基本限制。
-
新基准测试AI代理处理复杂、多模态的长期研究任务
研究人员推出Mr.LHDR,这是一个新的基准,旨在评估深度研究代理处理长期、复杂和多模态研究任务的能力。该基准包含需要平均12.1个中间结论和10.4个依赖深度的问题,并整合了图像、图表和PDF等多种证据类型。目前领先的AI系统在此基准上面临挑战,总体准确率仅为43.1%,凸显了AI代理在持续、依赖一致的证据整合方面存在的重大挑战。
-
量子储层计算在分子性质预测方面取得突破性进展
研究人员开发了一种新颖的量子储层计算架构,使用离散时间晶体(DTCs)来预测分子性质。该基于DTC的系统处理局部分子图事件和表面跳跃帧,并通过受控重置来管理输入贡献。与回声状态网络相比,该架构在抑制剂活性分类和电子能隙预测等任务中表现出优越的性能,特别是在输入长度与输出宽度匹配时。在超导量子云平台上的实验表明,即使在设备噪声下,该系统也能保留任务信息,这表明其在分子筛选和时间分辨性质预测方面的潜力。
-
新的深度学习框架可根据单细胞数据预测药物效应
研究人员开发了scDEFT,一个新颖的深度学习框架,旨在利用单细胞数据预测药物效应并实现反事实推理。该框架将药物视为细胞表示上的条件算子,能够预测药物诱导的状态变化和患者分层。在对大型炎症性肠病图谱的测试中,scDEFT在预测状态变化和治疗前识别响应者方面表现出显著的准确性,支持其在药物开发和个性化医疗中的应用。
-
新的 3D 深度学习框架增强了 MRI 脑转移瘤的检测
研究人员开发了一种新颖的尺度感知 3D 深度学习框架,以改进多模态 MRI 扫描中脑转移瘤的检测。该方法使用加权后期融合,结合了具有不同视场 (FOV) 的独立训练的 3D U-Nets 的输出。与单个模型相比,该方法在病灶级别的精度和 F1 分数方面有所提高,同时显著减少了假阳性,表明跨 FOV 概率融合是提高检测精度的有效策略。
-
新方法通过基于主题的翻译改进了大型语言模型的图谱标注
研究人员开发了一种名为 Structurally Speaking 的新方法,以改进像 GPT-5.1 这样的语言模型在图谱标注方面的表现。该协议指导显式图连接与简洁的主题级描述之间的翻译,解决了直接提示生成的图谱标注冗长且不一致的问题。实验表明,这种结构化提示方法生成的图谱标注更短、更符合主题,同时保持了相当的图谱恢复能力,这表明它可以在无需模型微调的情况下提高 LLM 生成的图谱标注的可解释性。
-
新算法可在不可逆环境中实现安全学习
研究人员开发了一种新颖的学习算法,专为在具有不可逆动力学的环境中运行的智能体设计,在这些环境中错误无法撤销。该算法允许智能体向导师请求帮助,并在相似状态之间转移知识,从而实现安全运行和有效学习。所提出的方法即使在没有重置可能性的复杂、无界和高风险场景中,也能随着时间的推移实现亚线性遗憾和有限次数的导师查询。
-
新框架模拟资源约束下的安全保障
一篇新的研究论文介绍了一个用于评估资源约束下安全保障的理论框架。该框架区分了重复成功、独特覆盖、可接受证据和操作保护。它还解决了诸如积极结果相关性和有限预算观察等问题,并提出了一个概念性的防御架构和一个评估协议。该工作侧重于理论综合和反例,而不是经验基准。
-
新数学论文详述非局部输运收敛率
一篇新近发表在 arXiv 上的论文详细介绍了一个理解非局部输运现象的数学框架。该研究侧重于非局部连续方程解向热流的收敛性,在参数 $b$ 趋近于零时,确立了一个尖锐的、时间均匀的收敛率为 $Cb^2$。该分析被扩展到圆上的确定性 N-粒子动力学,在特定条件下,提供了近似热流的速率为 $N^{-2/5}$。
-
新的自动化流程增强了机器人相机内参标定
研究人员开发了一种自动化的相机内参标定流程,这是机器人精确感知的一个关键步骤。这种新方法可自动过滤高质量图像并确定适当的径向畸变阶数,无需人工干预。实验表明重投影误差显著降低,自动化过滤将精度提高了25%,阶数选择进一步提高了5%。该团队计划发布代码和数据以支持该领域的未来研究。
-
提出人工智能素养框架以促进可持续发展目标
一项发表在arXiv上的新研究提出了将人工智能素养纳入可持续发展倡议的框架。该研究引入了一个六级人工智能推理和伦理分类法,旨在增强伦理判断和战略前瞻性。一项对300名参与者的调查结果表明,在负责任地管理人工智能的技术意识与伦理/治理准备程度之间存在显著差距。该研究建议将人工智能素养能力融入教育课程和机构政策,以促进公平和负责任地实现可持续发展目标。
-
新的Frank-Wolfe算法针对具有稀疏性的凸函数最小化
研究人员开发了Frank-Wolfe(FW)系列中的新型加速一阶算法,用于最小化光滑凸函数。这些算法特别关注两种约束类别:多面体和矩阵域。一项关键的技术贡献是解决解稀疏性的互补条件,该条件与多面体的面维数和矩阵的秩有关。所提出的方法包括一种纯粹的线性优化预言机(LOO)方法,用于具有最优预言机复杂度的多面体,以及一种结合FW和稀疏投影预言机的混合方案,用于矩阵域,两者都实现了独立于环境维度的有效收敛。
-
研究:大型语言模型使同行评审者偏好远离词汇复杂度
一篇新发表在arXiv上的研究调查了学术论文的同行评审者对词汇复杂度的偏好如何随时间推移而变化,特别是在大型语言模型兴起的背景下。通过使用一种“冻结评分者”方法,并利用来自单一模型家族生成的机器评审,研究人员能够将人类评审者偏好的变化与投稿内容的变化分离开来。研究结果表明,人类评审者已开始忽视词汇复杂度——由于大型语言模型降低了其生成成本——但仍然奖励句子长度的变化性。
-
新框架解决情境化、审查需求下的定价和库存问题
研究人员开发了一个新框架,以应对零售商在不断变化的市场条件和模糊的需求数据下面临的最优定价和库存控制的挑战。所提出的模型将需求视为具有未知系数的基函数的线性组合,从而能够做出响应情境因素的自适应决策。设计了一个高效的算法来实现强大的遗憾界限,数值实验验证了其在各种场景下的有效性。
-
新竞技场连接大语言模型红队攻击与蓝队防御
研究人员开发了ACEA,一个对抗性协同进化竞技场,旨在通过头对头的方式让红队攻击与蓝队防御相互对抗来测试大语言模型(LLMs)。该平台通过标准化的HTTP协议连接各种攻击和防御项目,允许模型无关的参与。ACEA包含一种评估方法,使用种子秘密来区分真实数据泄露与幻觉,并独立于防御成功与否来衡量原始攻击效力。该系统还具有实时可视化和详细报告,以查明失败之处,并提供一个可选的改进循环,为适应性团队提供咨询提示。
-
机器人通过引导人类到关键决策点来推断其目标
研究人员开发了一种新颖的策略,使机器人在互动过程中能够更准确、更早地推断出人类的目标。该方法侧重于引导人类走向“关键决策点”(CDPs),这些点是指不同人类策略会导致不同行动的状态,从而揭示潜在目标。该方法使用策略分歧度量来形式化CDPs,并将其整合到一个平衡任务进展与信息获取的规划系统中。在模拟和现实场景中的评估,包括协作烹饪任务和竞争性捉迷藏游戏,都证明了其比现有方法更优越的目标推断能力。
-
新的世界模型方法处理异步传感器数据
研究人员开发了一种新的世界模型方法,可以处理异步传感器观测,这是物理系统中传感器以不同速率运行的常见挑战。所提出的方法包括为模型提供指示传感器数据陈旧性和刷新时间的特征。在各种因果耦合机制下使用基于 Transformer 的世界模型进行的实验表明,这种刷新时间信息的效果取决于其在系统中的因果作用,特别是当刷新事件主动影响系统状态而不是仅仅报告它时。这项工作为处理异步物理观测的预测世界模型提供了采样计划的有价值见解的条件。
-
AI安全研究:提出生成器无关的运行时保障
一篇新的研究论文提出了一种在人工智能系统部分观测下实现生成器无关的运行时保障的方法。该工作引入了同时集合式健全性(simultaneous setwise soundness)的概念,该概念被证明是录取健全性(admission soundness)的充要条件,即使在生成器被替换的情况下也能确保安全。该方法旨在提供对任意生成器替换不变的合约安全保证,并具有有界的违规概率。
-
新AI方法应对不确定性下的业务流程规划
研究人员开发了新的业务流程规划和调度方法,能够应对控制流中的不确定性。所提出的方法旨在通过缩短总工期和最小化冗余活动来提高效率。文章提出了两种方案:一种是用于可扩展性的分解两阶段方法,另一种是提供更优总工期但计算量大的集成方法。在真实世界和合成数据上的评估展示了这些方法之间的权衡。