Tabarena
PulseAugur coverage of Tabarena — every cluster mentioning Tabarena across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
TabArena benchmark may be underestimating specialized tabular models
A recent arXiv paper argues that aggregated performance metrics in benchmarks like TabArena may overlook models with unique, specialized strengths. The proposed 'data-centric peak performance frontier' suggests that TabArena's current evaluation might favor consistency over identifying models that excel on specific data subsets, potentially leading to an underestimation of their true value.
TabArena may evolve to incorporate more diverse evaluation metrics beyond aggregation
The ongoing discussion around benchmark evaluation, highlighted by the 'data-centric peak performance frontier' concept, suggests a potential shift in how benchmarks are designed. We hypothesize that TabArena, as a prominent tabular benchmark, will eventually evolve to include more nuanced evaluation metrics that capture specialized model strengths, moving beyond simple aggregated scores to better reflect real-world utility.
TabArena may see increased adoption of localized/efficient retrieval methods
The release of Localized TabICLv2, which significantly improves efficiency for tabular data models by using k-NN retrieval, suggests a growing trend towards optimizing inference for tabular data. Given TabArena's role as a benchmark, we hypothesize that future models submitted to or evaluated on TabArena will increasingly incorporate such localized or efficient retrieval mechanisms to demonstrate practical performance gains.
-
激活对齐提升表格模型上下文学习能力
研究人员开发了一种名为激活对齐的新方法,以提高表格基础模型在上下文学习中的性能。该技术通过训练一个轻量级的线性变换,将使用有限上下文的模型的中介激活映射到使用完整上下文的模型的中介激活,从而实现匹配。这种方法允许在保持更快的推理速度(与较小的上下文相关)的同时,显著缩小与使用整个数据集的模型相比的性能差距。该方法在使用了 TabPFN-3 和 TabFM 等领先表格基础模型的 38 个数据集上显示出广泛的改进。
-
深度学习在表格数据上长达十年的挣扎被新的模式迁移方法克服
Prior Labs的联合创始人Frank Hutter解释说,由于表格固有的混乱和异质性,深度学习在表格数据上遇到了十年的挑战。他指出,像TabNet这样的模型泛化能力不强,缺乏标准化的基准数据集也阻碍了进展。关键的突破在于学会了在不同表格之间迁移模式识别能力,从而开发出了TabPFN-3.5,该模型现在在TabArena基准测试中处于领先地位。
-
新研究推动表格基础模型实现高效和鲁棒性
多篇研究论文探讨了表格基础模型(TFMs)的进展,重点关注提高其效率、鲁棒性和适应性。知识蒸馏等技术正被用于从大型TFM创建更小、更快的学生模型,而RelICL和VIP-COP等新方法则解决了关系学习和上下文优化中的挑战。此外,研究正在探索架构选择和参数高效适应策略,以增强TFM在亚群体偏移和大规模数据集等各种数据条件下的性能。
-
TabPFN-3.5 通过增强的性能和速度推动表格基础模型的发展
一份新的技术报告介绍了 TabPFN-3.5,这是表格基础模型领域的重大进展。该模型在各种表格数据挑战中超越了其前身 TabPFN-3 和其他现有基准。TabPFN-3.5 在标准的表格预测任务上展示了最先进的性能,并将其能力扩展到处理复杂的现实世界数据,包括具有时间或分组拆分的非 i.i.d. 数据,以及包含文本、字符串和图像的表格。像 TabPFN-3.5-Fast 这样的专用变体提供高达 3 倍的推理速度,而 TabPFN-3.…
-
清华LimiX-2模型结构化数据基准测试登顶,超越Google
清华大学与文准智能联合发布了新的结构化数据基础模型LimiX-2。该模型拥有4亿参数,在TabArena、BCCO和TALENT等国际基准测试中取得了最高排名,超越了Google、SAP和Amazon等大公司的模型。LimiX-2引入了上下文机制网络(CMNs),为结构化数据建模开创了新范式,专注于发现变量之间的关系,而不仅仅是预测特定结果。该模型还配备了升级的合成数据生成引擎,并在因果发现方面展示了显著的进步。
-
智能体AI为表格机器学习设计改进的搜索空间
研究人员开发了能够为表格机器学习模型设计改进的超参数优化(HPO)搜索空间的智能体AI系统。这些智能体提出了各种管道模块的代码实现,当与传统HPO结合时,可在众多数据集上带来性能提升。扩展的搜索空间平均相对性能提升了0.6%,在回归任务上表现尤为突出,并有效地迁移到了TabArena基准测试中,优于现有集成模型。
-
新的表格基础模型 TabPFN-3.5 和 Causilo 取得最先进的成果
新的表格基础模型正在快速发展,Prior Labs 发布了 TabPFN-3.5,Nums AI 发布了 Causilo。TabPFN-3.5 表现强劲,在默认设置下,其性能优于 2015 年 Kaggle 竞赛的获胜解决方案(在 Otto 数据集上),并在多项基准测试中名列前茅。Causilo 在分类和回归任务的单模型中也处于 TabArena 排行榜的前列。研究还表明,虽然对于先进的表格基础模型而言,特征工程的收益正在减小,但提供…
-
LimiX-2 模型通过新的网络范式推动结构化数据智能 · 跟踪到 2 个来源
研究人员推出了 LimiX-2,这是 LimiX 系列中一个专为通用结构化数据智能设计的新模型。该模型利用上下文机制网络 (CMNs) 并使用上下文条件掩码建模 (CCMM) 进行预训练。LimiX-2 将重点从目标中心预测转移到面向机制的联合建模,学习给定上下文内数据生成的联合结构。在 TabArena、TALENT 和 BCCO 等基准测试上的评估表明,LimiX-2 超越了现有的特定数据集和表格基础模型,并且其注意力机制还能实现…
-
新的注意力量化加速表格基础模型
研究人员为表格基础模型开发了一种新的注意力量化策略,以提高推理性能。该方法侧重于将查询、键和值量化为 FP8,并利用显式的 FP8 矩阵乘法指令。一项关键发现是,必须在训练和测试数据之间对齐量化误差,以防止精度下降。开发的 Triton 内核在标准 16 位内核上实现了高达 1.7 倍的加速,同时在 TabPFN-v3 和 TabICLv2 等模型在基准数据集上的表现没有显著的精度损失。
-
Mitra-v2 表格基础模型以更小的尺寸实现SOTA性能
研究人员推出了一款新的表格基础模型Mitra-v2,该模型在分类和回归任务上取得了最先进的性能。Mitra-v2仅使用合成数据进行训练,采用了紧凑的二维Transformer架构,能够高效处理更长的上下文和更大的特征空间。尽管与TabFM等行业级模型相比尺寸较小,Mitra-v2在TabArena和TALENT等基准测试中仍表现出具有竞争力或更优的结果,使其成为表格数据问题的强大且广泛适用的开源选项。
-
表格大语言模型在电子表格预测任务上超越梯度提升树
一类新的基础模型,称为表格大语言模型,在电子表格预测任务上的表现优于传统的梯度提升树。这些模型,例如TabICLv2和Google Research的TabFM,能够像语言模型补全文本一样,零样本预测任何表格中的缺失值。对TabICLv2的独立验证证实了其在TabArena基准测试中的强劲表现,展示了在低服务成本下的竞争性准确性。
-
小米发布TabLDM,一个在合成数据上训练的表格基础模型
研究人员推出Xiaomi-TabLDM,一个用于分类和回归任务的新型表格基础模型。该模型通过上下文学习实现高预测精度,无需针对特定任务进行微调。它在从结构因果模型生成的合成数据上进行了预训练,能够实现高效的容量扩展和灵活的上下文利用。Xiaomi-TabLDM在各种基准测试中表现强劲,在OpenML-CTR23上排名第一,并显示出性能和计算成本之间的有利权衡。
-
NVIDIA 发布 Kumo Tabular,性能超越基准和 GPT-4o
NVIDIA 发布了 Kumo Tabular,这是一个用于表格数据的新型开放基础模型系列,现已在 Hugging Face 上提供。这些模型是 NVIDIA Kumo Structured 系列的一部分,无需训练或调优即可在单次前向传播中预测新行的标签。Kumo Tabular 在人工数据上进行了预训练,有三种尺寸,在多个基准测试中表现出色,在表格理解任务上超越了现有模型甚至 GPT-4o。这些模型在宽松的 OpenMDW-1.1 …
-
EXAONE Tabular 1.0:紧凑型基础模型在表格基准测试中达到SOTA
一份新的技术报告介绍了EXAONE Tabular 1.0,这是一个为分类和回归等表格数据任务设计的紧凑型基础模型家族。该模型通过在其Transformer架构中交织特征轴和项目轴注意力,实现了强大的预测性能和效率。EXAONE Tabular在包括TabArena和ScoringBench在内的多个基准测试中取得了最先进的结果,以显著更低的推理成本超越了更大的模型和复杂的集成。
-
新的arXiv论文认为基准测试忽略了模型独特的优势
一篇新发表在arXiv上的论文认为,当前聚合性能得分的机器学习基准测试未能捕捉到模型独特的优势。作者提出了一个“以数据为中心的峰值性能前沿”来识别对特定数据集不可替代的模型。他们对TabArena基准的分析表明,聚合指标偏好一致性而非独特能力,可能忽略了具有专业优势的模型。
-
新的机器学习基准框架突显模型不可替代的优势
一种新的机器学习模型评估框架,称为“以数据为中心的峰值性能前沿”,旨在超越简单的聚合指标。这种方法识别那些在特定数据集上实现顶级性能不可替代的模型,而不仅仅是那些在许多数据集上表现一致良好的模型。研究表明,当前基准测试中的聚合方法常常奖励避免失败的模型,可能会掩盖其他模型独特、特定于数据集的优势。扩展可达到的峰值性能集应成为基准评估进展的关键衡量标准。
-
Localized TabICLv2 通过 k-NN 检索提高表格模型效率
研究人员开发了 Localized TabICLv2,一种提高表格数据基础模型效率的方法。这种新方法通过仅检索每个数据点的 k-最近邻,而不是处理整个训练上下文,从而降低了 TabICLv2 的计算成本。微调后的本地化模型在保持原始准确率超过 98% 的同时,在批量和单查询推理场景中都实现了显著的加速。
-
Prior Labs 发布关系学习研究开源工具
Prior Labs 发布了三款旨在推进关系学习研究和可复现性的开源软件工具。RelArena-α 是一个用于在 RelBench v1 基准上比较模型的统一框架,标准化了数据加载和评估。TabPFN-Rel 是 TabPFN-3 的关系型工具,目前在 RelArena-α 上排名第一,并展示了将关系型数据库展平成单个表进行处理的竞争力。此外,关系预测接口 (RPI) 为早期采用者提供了一种模型无关的方式,可以将各种模型应用于新数据库。
-
TabH2O基础模型统一表格预测任务
研究人员推出TabH2O,这是一种用于表格数据预测任务的新型基础模型。该模型使用上下文学习将分类和回归统一到单个前向传播中,提高了训练效率并降低了成本。TabH2O包含多项架构增强功能,包括用于统一训练的双头设计、具有稳定性改进的单阶段预训练,以及增强对无关特征鲁棒性的噪声感知预训练。在TALENT和TabArena等基准测试上的评估表明,TabH2O的性能与现有方法相比具有竞争力,并在TabArena上取得了最先进的成果。
-
新的大语言模型技术提高了表格数据预测的效率和准确性
研究人员开发了新的方法,通过整合大语言模型的语义理解来增强表格学习器的性能。一种方法CASE使用基于Gemma 3的表格语言模型来语境化嵌入,从而在语义丰富的、尤其是数据有限的数据集上提高性能。另一项开发TabDPT-Turbo则通过长上下文预训练和架构改进来提高效率,以显著更快的速度实现了与现有模型相当的性能。