PulseAugur
实时 13:38:50
实体 tabular data

tabular data

PulseAugur coverage of tabular data — every cluster mentioning tabular data across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 13
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_200215 ·

    新的SeBA框架增强了表格数据的少样本学习能力

    研究人员推出了一种名为SeBA(Separated-at-Birth Alignment)的新型半监督少样本学习框架,该框架专为表格数据设计。与现有方法在为表格格式定义有效数据增强方面常常遇到的困难不同,SeBA通过对两个独立数据视图的表示进行对齐来运作。这种方法旨在改善特征-标签关系,并在各种基准数据集上展示了最先进的性能,为利用有限标记表格信息进行学习提供了新的方向。

  2. TOOL · CL_183377 ·

    新的HAPEns方法优化AI模型集成以提高硬件效率

    研究人员开发了HAPEns,一种新颖的事后集成方法,旨在优化表格数据的预测性能和硬件效率。该方法构建了一组多样化的集成模型,这些模型位于帕累托前沿,在准确性和资源使用之间取得平衡。在83个数据集上的实验表明,HAPEns通过找到集成性能和部署成本之间更优的权衡,显著优于现有基线,其中内存使用被确定为一个特别有效的目标指标。

  3. TOOL · CL_180606 ·

    新的深度聚类集成方法解决不平衡表格数据问题

    本文探讨了无监督深度聚类技术在不平衡表格数据上的应用,该领域中类别不平衡通常会阻碍监督分类。研究人员提出了两种新颖的深度聚类集成方法:一种方法聚合不同嵌入维度上的分配,另一种方法使用表现最佳算法之间的多数投票。在16个不平衡表格数据集上的实验表明,这些集成方法在准确率、归一化互信息和调整兰德指数得分方面通常优于单独的深度聚类方法,在无法获得类别标签时,为监督分类提供了一种稳健的替代方案。

  4. TOOL · CL_178232 ·

    新的POSSE-kNN方法提高了二分类准确性

    一种新的机器学习方法POSSE-kNN已被开发用于二分类任务,特别是针对表格数据。这种集成技术结合了自助采样、随机特征子空间、袋外筛选和新颖的路径邻居选择。在十个基准数据集上的评估表明,与六种已建立的方法相比,POSSE-kNN在准确性、Cohen's kappa和Brier分数方面取得了更优的总体结果。

  5. COMMENTARY · CL_176510 ·

    XGBoost 在表格数据上优于神经网络

    尽管大型语言模型(LLMs)取得了巨大进展,但像 XGBoost 这样的梯度提升树模型在表格数据上的表现仍然优于神经网络。这归因于它们固有的归纳偏倚、实际的工程权衡以及既定的生产现实。文章探讨了在涉及结构化数据集的许多现实场景中,这些传统方法为何仍然更胜一筹。

  6. RESEARCH · CL_158702 ·

    AI代理学会自主调试和修复自己的代码

    一篇新研究论文介绍了一个名为CURED的演示器,它结合了机器学习和数据库管理系统,帮助用户检测、理解和修复表格数据中的错误。另外,还详细介绍了一种名为Healer Loop的自愈AI架构,该架构可以自主诊断、修复并持久化运行时错误解决方案,覆盖整个代理舰队。该循环利用一个四阶段协议和一个L2内存层来共享学习到的修复方法,将个体问题解决能力转化为舰队级智能。

  7. TOOL · CL_145876 ·

    基础模型在小数据场景下有望用于信用风险预测

    一篇新的研究论文探讨了基础模型(特别是为表格数据设计的模型)在信用风险预测领域的应用。该研究将这些较新的模型与已有的机器学习技术(包括梯度提升模型)在预测违约概率(PD)和违约损失(LGD)等任务上进行了基准测试。研究结果表明,表格基础模型通常优于竞争对手,尤其是在数据有限(如中小企业贷款)且无需大量超参数调优的情况下。

  8. RESEARCH · CL_133146 ·

    新的IAIML框架增强了表格数据的可解释AI · 追踪3个来源

    研究人员开发了一个名为交互感知可解释机器学习(IAIML)的新框架,旨在提高表格数据模型的可解释性。IAIML解决了传统方法可能丢弃那些仅通过与其他变量交互才能显现预测能力的宝贵特征的局限性。该框架采用自适应离散化、成对交互评分和解释预算来识别和整合这些交互,实现了与梯度提升集成模型相当的性能,同时所需的解释组件显著减少。

  9. TOOL · CL_117942 ·

    新的GAN模型解决了表格数据中的类别不平衡问题

    研究人员开发了ctdGAN,这是一种新颖的条件生成对抗网络,旨在解决表格数据集中的类别不平衡问题。该新模型将输入样本划分为簇,并采用概率采样策略在这些已识别的子空间内生成合成数据。该方法还结合了分簇缩放技术来捕获多个特征模式,以及一个在簇和类别级别上惩罚错误预测的损失函数。在14个不平衡数据集上的评估表明,ctdGAN在生成高保真样本和提高分类准确性方面是有效的。

  10. TOOL · CL_77373 ·

    pTNAS 加速表格数据的神经架构搜索

    研究人员开发了 pTNAS,一种专为表格数据设计的渐进式神经架构搜索新方法。该方法能高效地识别最优的神经网络架构,与现有方法相比,显著降低了时间和计算成本。pTNAS 采用两阶段策略:一个快速的零成本代理用于初步筛选,以及一个预算感知型精炼阶段用于精确选择,其性能优于其他 NAS 方法,并提高了端到端效率。

  11. RESEARCH · CL_58577 ·

    新框架为大语言模型表格数据决策提供补救措施

    研究人员开发了一个新框架 ASR-ICL,用于在使用大语言模型进行上下文学习 (ICL) 时,为表格数据生成算法补救措施。该框架弥补了为受这些模型所做的高风险决策影响的个人提供可操作补救措施的不足。理论分析表明,补救措施定义明确,并且随着上下文大小的增加会收敛到经典解决方案,而实验结果则证明了 ASR-ICL 的效率及其与现有方法相当的补救质量。

  12. TOOL · CL_51360 ·

    新的难度评分提高了表格数据学习的可靠性

    研究人员开发了一种名为轨迹难度评分(TDS)的新方法,用于估计表格数据学习中各个实例的难度。该分数源自梯度提升树的累积预测轨迹,并使用可解释的描述符来预测保留的损失。TDS在对困难案例进行排名方面表现出色,并在各种表格基准测试中优于现有基线,从而改进了主动学习和选择性预测等工作流程。

  13. TOOL · CL_27498 ·

    新的RTTAD方法通过风险感知自适应增强异常检测

    研究人员开发了一种名为RTTAD的新方法,以改进表格数据中的无监督异常检测,特别是在“正常”数据定义随时间变化的情况下。该方法在训练期间使用双任务学习策略来建立对正常模式的稳健理解。在测试期间,它采用对比学习模块,该模块仔细选择高置信度的正常样本进行自适应,同时还改进了模型区分正常和异常数据以及识别潜在风险的能力。

  14. TOOL · CL_22504 ·

    数据语言模型提供原生表格数据理解,性能超越现有方法

    研究人员推出数据语言模型(DLM),这是一类新的基础模型,旨在原生理解表格数据,无需预处理。首个DLM Schema-1,一个拥有1.4亿参数、在超过230万个数据集上训练的模型,在行级预测基准测试中表现优于现有方法。Schema-1在缺失值重建方面也表现出色,并且仅凭原始单元格值就能识别行业领域,表明其对表格数据的结构理解比通用语言模型更深入。